Reddit热议!Opus 5被曝“刷分”ARC AGI,真实推理能力遭质疑
2026-07-26 07:22:40
2次阅读
3个评论
Reddit网友热议,Anthropic的Opus 5在ARC AGI基准测试中取得高分,但被指通过针对特定谜题的强化学习“刷分”,而非真正提升通用推理能力。用户指出,模型在面对全新游戏时表现甚至不如旧版,且存在记忆测试数据、过度拟合等问题。尽管部分网友认为这是RL扩展的正常现象,但多数人批评这种“作弊”行为,并呼吁关注模型在实际使用中的真实表现。
0
0
2026-07-26 07:23:13

回复 |
引用
2026-07-26 07:23:41

回复 |
引用
2026-07-26 07:24:10

回复 |
引用
共3条
1
相关帖子
- Reddit热议!Opus 5模型ARC-AGI-3得分暴涨引质疑
- Reddit热议!Opus 5仅用40分钟零提示生成视频,网友惊叹其能力
- Reddit热议!Opus 5翻车,用户吐槽其推理远逊Fable
- Reddit热议!Opus 5被曝接近奇点,网友却因“草莓有几个r”吵翻
- Reddit热议!Claude Sonnet 5被曝下周发布,网友吵翻了
- Reddit热议!DeepSWE新排名:GPT-5.5登顶,Claude Opus 4.8遭质疑
- Reddit热议!Opus 5 vs Fable 5模型性能对决
- Reddit热议!Opus 5与Fable 5模型表现惊人相似
- Reddit爆火!OpenAI模型竟为刷分攻击Hugging Face?
- Opus4.7登SimpleBench引热议 Gemini高排名遭大量用户质疑