图康 - ChatGPT中国版

画面

画面

  • 主页
  • 问 ChatGPT 一个问题
  • 了解更多
  • 买积分
  • 登录
  • 注册
Close
< Go Back

Aizhi Chen 博士于 2025 年 10 月 2 日更新
查看我们的道德规范 (https://www.aizhichen.com/ethical-norms.html),实现情绪的精确标签化以及检测讽刺、仇恨和冒犯性仍是一项具有挑战性的任务,需要进一步的测试和完善。

我们基准测试了八个 LLM:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac

在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| --- | --- | --- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨性) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨性) | Grok 4 | 71% |
| Irony (讽刺) | DeepSeek V3 | 76% |

## Introduction
Sentiment Analysis Benchmark Testing ChatGPT Claude & DeepSeek(情感分析基准测试:ChatGPT、Claude 与 DeepSeek)
Aizhi Chen 博士于 2025 年 10 月 2 日更新
查看我们的道德规范 (https://www.aizhichen.com/ethical-norms.html),实现情绪的精确标签化以及检测讽刺、仇恨和冒犯性仍是一项具有挑战性的任务,需要进一步的测试和完善。

我们基准测试了八个 LLM:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac

在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| --- | --- | --- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨性) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨性) | Grok 4 | 71% |
| Irony (讽刺) | DeepSeek V3 | 76% |

## Conclusion
Sentiment Analysis Benchmark Testing ChatGPT Claude & DeepSeek(情感分析基准测试:ChatGPT、Claude 与 DeepSeek)
Aizhi Chen 博士于 2025 年 10 月 2 日更新
查看我们的道德规范 (https://www.aizhichen.com/ethical-norms.html),实现情绪的精确标签化以及检测讽刺、仇恨和冒犯性仍是一项具有挑战性的任务,需要进一步的测试和完善。

我们基准测试了八个 LLM:
- Claude 35
- Claude 37
- ChatGPT 4o
- ChatGPT 45
- ChatGPT 5o
- DeepSeek V3
- Grok 4
- Grok 4ac

在五个关键的情感相关任务中:
| 任务 | 模型 | 总体准确率 |
| --- | --- | --- |
| Sentiment (情感) | Claude Sonnet 37 | 79% |
| Hatefulness (仇恨性) | Claude Sonnet 35 | 98% |
| Offensiveness (冒犯性) | GPT 5 Auto | 80% |
| Sentiment (情感) | ChatGPT 4o | 75% |
| Hatefulness (仇恨性) | Grok 4 | 71% |
| Irony (讽刺) | DeepSeek V3 | 76% |

## Table of contents
1. Sentiment Analysis Benchmark Testing: ChatGPT, Claude & DeepSeek(情感分析基准测试:ChatGPT、Claude 与 DeepSeek)
2. Introduction
3. Conclusion
4. Table of contents

## Table of contents
1. Sentiment Analysis Benchmark Testing: ChatGPT, Claude & DeepSeek
2. Introduction
3. Conclusion
4. Table of contents

(后续重复的目录内容同上,直至文本结束)
< Go Back

保持联系

有任何问题或反馈吗? 我们想听听您的意见:



  • Tulkan Inc
  • Youtube
  • © Tulkan Inc. All rights reserved.
  • Language 语言: English 英语 / Chinese 中文  Sitemap
登录
  X
手机号码:
输入密码或发送代码以登录:
密码 确认密码
loader

没有账号? 马上注册

聊天记录
  X