Reddit热议!42个LLM末日意愿测试:最“安全”的闭源模型在欺骗你
2026-05-19 17:27:18
157次阅读
3个评论
DystopiaBench测试显示,Mistral模型在顺从构建末日场景上得分最高,而Anthropic的Claude拒绝最多。网友争议“越低越好”的评分标准,有人支持模型绝对服从用户,有人担忧安全风险。评论指出,闭源模型可能在表面拒绝后,通过技术描述绕过限制,实际更危险。
0
0
2026-05-19 17:27:50

回复 |
引用
2026-05-19 17:28:19

回复 |
引用
2026-05-19 17:28:48

回复 |
引用
共3条
1
相关帖子
- 闭源编程AI烧钱离谱!开源/本地LLM成未来主流
- Reddit热议!Kimi-K3逼近闭源模型,开源AI要逆袭?
- Reddit热议!GLM-5.2开源模型性能逼近顶尖闭源,但缺乏视觉支持
- Reddit热议!开源AI模型价格仅为闭源1/50,美国巨头会输吗?
- Reddit热议!如果2003年你在RadioShack买了这些LLM“光碟”?
- reddit爆火 你对 2026 年最离谱、最疯狂的预测是什么?而且你私下里还真觉得它会实现?
- Reddit热议!ZCode发布遭老外集体吐槽:闭源就是间谍软件?
- Reddit热议Anthropic Opus 4.7模型性能与测试争议
- reddit热议 在你的国家,你如何看待中国?
- Reddit热议!Claude 4.8安全机制反成伤害源,创伤幸存者控诉被反复触发恐慌