K

DeepSeek“视力”实在太差!

今天用DeepSeek帮我改了一个营销脚本,不得不说,她的文笔确实是不错的,可识图能力实在是太差劲了,或许不应该叫识图能力,因为他根本就识别不了图片,只能扫描提取文字。 我特意上传了分镜表格截图,还告诉DeepSeek把第4条"衬衫褶皱特写"的镜头改成钢琴相关画面,并且强调"脚踩开机"之后的顺序不要动。结果它确实改了第4条,但后面的口播顺序全乱了,第8条该保留的"脚踩开机,不用弯腰"被挪了位置。我都特意发了带表格结构的截图,它识别出来的内容却还是忽略单元格对应关系,把空白表格直接跳过,导致画面跟口播全部错乱。图片里的视觉信息比如表格边框、序号排列,它几乎感知不到,纯粹是在"读字"而不是"看图"。我后期修改了提示词,加了很多限定词比如"严格按原表格顺序""只替换第4条画面其余不要修改",效果依然有限,该错还是错。来回跟他掰扯了好几次次,它每次都答应得好好的,输出还是错,简直要把我气吐血 DeepSeek在纯文本对话的场景确实能打,但视力实在太差,识图和图文结合任务目前明显短板。只适合不需要看图的场景,或者只把图片当"文字载体"用。所以如果你需要AI准确理解图片内容再输出,建议直接换一个工具。 星级评分: ⭐⭐⭐
2026-05-25
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区

快来抢占第一条评论 ~

说真实观点...
有用有用
评论评论
转发转发