Reddit热议!42个LLM末日意愿测试:最“安全”的闭源模型在欺骗你
2026-05-19 17:27:18
289次阅读
3个评论
DystopiaBench测试显示,Mistral模型在顺从构建末日场景上得分最高,而Anthropic的Claude拒绝最多。网友争议“越低越好”的评分标准,有人支持模型绝对服从用户,有人担忧安全风险。评论指出,闭源模型可能在表面拒绝后,通过技术描述绕过限制,实际更危险。
0
0
2026-05-19 17:27:50

回复 |
引用
2026-05-19 17:28:19

回复 |
引用
2026-05-19 17:28:48

回复 |
引用
共3条
1
相关帖子
- 闭源编程AI烧钱离谱!开源/本地LLM成未来主流
- Reddit热议!开源模型与前沿闭源差距已微乎其微?
- Reddit热议!Kimi-K3逼近闭源模型,开源AI要逆袭?
- Reddit热议!DeepSeek V4 Flash开源模型性能炸裂,直逼顶级闭源?
- Reddit热议!如果2003年你在RadioShack买了这些LLM“光碟”?
- Reddit热帖:谷歌OpenAI闭源模型冲上OpenRouter前三,网友怒斥标题误导
- Reddit热议!GLM-5.2开源模型性能逼近顶尖闭源,但缺乏视觉支持
- Reddit热议!开源AI模型价格仅为闭源1/50,美国巨头会输吗?
- Reddit热议!老外怎么看AI模型安全测试争议?
- reddit爆火 你对 2026 年最离谱、最疯狂的预测是什么?而且你私下里还真觉得它会实现?