Reddit热议!AI基准测试被指“刷榜”造假?
2026-09-08 17:48:40
5次阅读
2个评论
Reddit网友质疑Artificial Analysis指数频繁更新,直到GPT-6-Astra与Claude Fable 5.1并列第一,怀疑其通过调整测试权重“内定”排名,并吐槽开源模型Qwen性价比更高,对基准测试的公信力产生严重怀疑。
0
0
2026-09-08 17:49:12

回复 |
引用
2026-09-08 17:49:41

回复 |
引用
共2条
1
相关帖子
- Reddit热议!老外吐槽AI基准测试像“刷分表演”
- Reddit热议!麦康奈尔“在世证明”照片被指造假?
- Reddit孕妇假肢模特职业问答帖被指造假遭版主删除
- Reddit热议!开源基准测试让AI玩《Balatro》,最高仅通关5轮
- Claude Opus 4.7数学基准测试表现拉胯,被GPT新版本碾压
- 特朗普称取消赴巴伊朗谈判 被指挽尊造假操纵市场
- Reddit热议!Claude Opus 5基准测试碾压对手,网友直呼“疯狂”
- Reddit热议!Muse Glimmer基准测试:比Qwen稍弱但token效率惊人
- Reddit热议!Kimi K2.7编码模型发布,网友质疑基准测试不标准
- MineBench基准测试揭示Kimi K2.5与K2.6性能差异