OpenAI联合173位科学家推出LifeSciBench基准测试,包含750项专家任务,旨在评估AI在真实生命科学研究中的推理与决策能力,其中GPT‑Rosalind得分超过GPT‑5.5。
网友热议焦点:有人觉得这种贴近真实科研的基准很关键,能推动AI真正落地;也有老外吐槽“造福所有人”是虚伪口号,质疑OpenAI藏着不开源;还有人直接喊话Grok分析这波操作,甚至呼吁把好模型还回来。
请 登录 后评论。没有帐号? 注册 一个。
小陈