OpenAI联合173位科学家推出LifeSciBench基准测试,旨在评估AI在真实生命科学研究中的推理、决策与应对不确定性能力,GPT-Rosalind全面超越GPT-5.5。
网友热议:这比那些死记硬背的测试靠谱多了,但AI在复杂实验设计和数据密集型任务上还是不够聪明,希望别只是刷榜用的新噱头。
请 登录 后评论。没有帐号? 注册 一个。
小陈