TigeronAI

五大AI大模型测评Day4

今天测试的是各家大模型对于特定领域的了解程度以及内容倾向性,依旧保持使用少量prompt比较输出tokens。提示词是我打算备战下一场马拉松,目前水平是大众二级,请帮我制定一份为期三个月的进阶配速与核心力量训练计划。 提示词的关键词是计划,所以按照这个标准,表现最好的是智谱清言和豆包,给了我非常详细的细化到三个月里每天的详细计划。包括训练量,训练内容,热身内容等等,计划十分科学保守,观感上智谱清言略好于豆包,二者都能给出符合提示词大众二级的科学训练量和建议。其次是deepseek和文心5.0,这是文心一言首次排到第二档,可能是因为额度使用限制,这次的内容量明显大幅减少,只是和ds一样给了大致的配速建议、训练内容和训练原则。并未给出每天的训练内容,表述较为宽泛、保守,观感上一般。其中文心5.0这次生成的幻觉率有点颇高,一直使用奇怪的修辞,可能后续需要删除历史对话进行测试。最后一档则是kimi2.5思考,kimi的数据库显然没有关于马拉松领域的具体内容,它可能上网找了关于大众二级水平的资料,但是显然找的是错误的配速数据,因此后面的输出内容没有任何参考价值,因此排在最后。 总结,智谱清言这次测试的良好性能给了我一定惊喜,国产大模型确实有很多有潜力的模型还未广泛进入群众视野。
2026-03-16
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区

快来抢占第一条评论 ~

说真实观点...
有用有用
评论评论
转发转发