通义听悟
今天分享通义听悟,是一款通义千问下属的衍生APP,主要得益通义千问基座模型进行衍生开发,其主要是侧重于音频模态,主要功能是在会议现场进行实时转录,上传音视频进行转文字,同时也可以上传视频来进行文字提取。通义听悟主要是进行以视频为载体,这个和科大讯飞的功能重叠,因为题主原来使用过科大讯飞的相关功能,现在也来测评一下通义听悟。个人觉得音频格式应该是在大模型应用层面比较好处理的,因为音频是一维数据格式,在处理难度上天然较低这个这个也是科大讯飞一直以来领先行业的原因。
本文章首先从实时记录这个方面来进行测评,这个在日常生活中最为常见,同时答主知道豆包模型也可以开启实时转录,这个在办公生活中比较重要,良好的文字转录功能可以记录下工作的重点内容和领导的讲话。整体下来通义听悟针对标准的普通话和英语实现的记录功能比较良好可以比较完整的记录下实时的音频文字,同时进行总结。但是针对比较有口音和不完整的不标准的发言,则会出现比较功能下滑。这个是很多语音大模型的问题,因为不同人类关于相同发音并不一样。回到上传视频的功能,这个通义听悟功能表现较好,但是就是针对长视频会出现上传时间过长这个是未来需要改进的问题总之通义听悟还是表现合格。
2026-03-17
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区
快来抢占第一条评论 ~