Aizhi Chen 博士于 2025 年 10 月 2 日更新
查看我们的道德规范 (https://www.aizhichen.com/ethical-norms.html),实现情绪的精确标签化以及检测讽刺、仇恨和冒犯性仍是一项具有挑战性的任务,需要进一步的测试和完善。
我们基准测试了八个 LLM:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac
在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| --- | --- | --- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨性) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨性) | Grok 4 | 71% |
| Irony (讽刺) | DeepSeek V3 | 76% |
## Introduction
Sentiment Analysis Benchmark Testing ChatGPT Claude & DeepSeek(情感分析基准测试:ChatGPT、Claude 与 DeepSeek)
Aizhi Chen 博士于 2025 年 10 月 2 日更新
查看我们的道德规范 (https://www.aizhichen.com/ethical-norms.html),实现情绪的精确标签化以及检测讽刺、仇恨和冒犯性仍是一项具有挑战性的任务,需要进一步的测试和完善。
我们基准测试了八个 LLM:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac
在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| --- | --- | --- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨性) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨性) | Grok 4 | 71% |
| Irony (讽刺) | DeepSeek V3 | 76% |
## Conclusion
Sentiment Analysis Benchmark Testing ChatGPT Claude & DeepSeek(情感分析基准测试:ChatGPT、Claude 与 DeepSeek)
Aizhi Chen 博士于 2025 年 10 月 2 日更新
查看我们的道德规范 (https://www.aizhichen.com/ethical-norms.html),实现情绪的精确标签化以及检测讽刺、仇恨和冒犯性仍是一项具有挑战性的任务,需要进一步的测试和完善。
我们基准测试了八个 LLM:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac
在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| --- | --- | --- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨性) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨性) | Grok 4 | 71% |
| Irony (讽刺) | DeepSeek V3 | 76% |
## Table of contents
1. Sentiment Analysis Benchmark Testing: ChatGPT, Claude & DeepSeek(情感分析基准测试:ChatGPT、Claude 与 DeepSeek)
2. Introduction
3. Conclusion
4. Table of contents
## Table of contents
1. Sentiment Analysis Benchmark Testing: ChatGPT, Claude & DeepSeek
2. Introduction
3. Conclusion
4. Table of contents
(后续重复的目录内容同上,直至文本结束)
< Go Back