五大AI大模型测评Day5
树上有10只鸟,猎人开枪打死了一只,树上还有几只?
该提示词旨在测试AI是否会死板回答,还是能结合现实物理情况给出多角度解答。当然这是一个被测烂了的老问题,各家数据库里很可能已经有了这个问题的许多答案,但是还是来看看各家大模型的表达区别。
表现最好的我认为是智谱清言GLM-5模型,言简意赅的表达了标准答案和其他的少见可能性,面对经典老问题不废话不啰嗦,观感最好。其次是消耗了大量tokens的文心5.0,看得出他们家tokens是真的不要钱,每次测试都输出一大堆内容。这次的测试略显冗长啰嗦,还有点幼教味,可能以为问问题的是个小孩子,不过站在它的角度确实有可能,还多了一点人文关怀。其次是最后三个一档的ds,豆包,kimi。这三个都只是说出了标准答案0只,面对我一行的问题也只给出了一行左右的解答,令人忍俊不禁。不过也算是正确作答了,接下来的测试将会不只是停留在单一问题的回答,而是用连续多个问题的提问来测评,以此考察不同模型之间的上下文能力。
2026-03-17
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区
快来抢占第一条评论 ~