Reddit热议!老外怎么看待给AI模型加“犹豫词”惩罚?
2026-09-28 07:23:10
1次阅读
3个评论
有网友在Qwen模型上测试了对“wait”“maybe”等过度思考词汇施加logit惩罚,发现准确率普遍提升,连BF16模型也从74%涨到84%,同时推理token减少。评论区有人感叹大模型调优仍像炼金术,也有人指出这本质是抑制模型陷入死循环,并讨论该方法与Swift微调、量化损失的关联。
收藏 0 赞 0
    小陈 manage advert
    2026-09-28 07:23:42
    回复 |  引用
    小陈 manage advert
    2026-09-28 07:24:11
    回复 |  引用
    小陈 manage advert
    2026-09-28 07:24:40
    回复 |  引用
共3条 1

请 登录 后评论。没有帐号? 注册 一个。

小陈

manage advert
  • 0 回答
  • 0 粉丝
  • 0 关注