半截的诗_11

文心一言5.0正式版表现与不足

基本情况: 百度是国内少有的几家坚持做原生多模态模型的团队之一,文心一言5.0在11月亮相时,两万亿的体量确实技惊一时,但一周后的Gemini 3 Pro 宣告了当世最强了多模态应该是什么样。在北美那个无限资源环境喂养出来的模型,远不是国内被算力掣肘的团队可以靠勤奋和算法技巧来弥补和追赶的。但这并不代表百度的路线是错误的。 继续打磨2个月的文心一言5.0 正式版,虽然谈不上脱胎换骨,但也算在认真解决预览版的问题,整体可用性有所提升,在国产第二梯队站稳了位置。 不足: 写作:预览版因为推理能力偏弱,空有知识而无法发挥。而正式版则有一些改进,写作类任务输出格式更加规整,但文风呈现一种“有限的发散”的风格。不同于DeepSeek天马行空的奇妙比喻,文心对于严肃主题行文严谨,对于需要开脑洞的话题,也很少一路狂飙到无法控制的程度。之前预览版存在的问题,正式版基本都还有,但部分题目有分化。预览版完全没有读懂题目,而正式版能理解其中部分,做出正确回答。文心的幻觉问题除了设定的温度偏高,可能也与其偏文科的调教风格有关。
2026-03-19
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区

快来抢占第一条评论 ~

说真实观点...
有用有用
评论评论
转发转发