通义千问
今天答主本人详细测评了通义千问在不同方面的表现和其他大模型的测评,通义千问是由阿里巴巴进行开发同时遵守开源路线,旗下多种模型已经在开源模型榜单上取得领先位置。本文从上下文解析和文生图还有代码辅助编辑三个方面进行完整测评。首先是上下解析,从实际体验来说通义千问在上下文解析表现和豆包kimi等水平相当,都具有处理较长上下文的能力同时随着上下文的增长不会出现幻觉的情况。但是和deepseek的百万级的上下文解析还存在一定差距。
通义千问的多模态水平我个人认为是在kimi和豆包之间最强的,尤其是对于图片任务的理解,千问可以较好的将图片中的内容进行文字性的理解并做出针对性的解答。同时在文生图千问也可以较好的理解意思,但相比于图片理解依旧有差距。
在代码辅助任务方面通义千问表现得略低于豆包和Kimi,主要表现在生成长代码错误累计上面,随着代码长度增高,出现错误得可能性更高同时在代码逻辑方面也容易出现问题。总的来说通义千问作为阿里巴巴的大模型基座在各个方面表现有一定优势相比于kimi和豆包这种基座模型表现得也不错。考虑到阿里巴巴未来会将大量得精力投入到agent产品上现阶段通义千问表现可以满足这个未来需求。
2026-02-26
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区
快来抢占第一条评论 ~