测试deepseek鲁棒性,揭露其真实信息处理能力
deepseek在复杂文本与多次对话场景下的信息处理能力倒底怎么样呢,今天就测试deepseek的鲁棒性与边界能力,通过简单的两轮的测试之后,deepseek暴露了它在任务理解、前后文记忆以及逻辑上的缺陷。
在第一次测试中,我要求找出文章里第8个英文字母。模型在初始处理中,将文章中出现的英文单词纳入计数,给出了“w”的结论,但是思考过程漫长且混乱,暴露了它在文本扫描还有字符定位方面的短板。
第二次更换文章后,我提问出现最多的人名是谁,模型虽然能识别主角“望”,但整个统计过程逻辑较松散、缺乏系统的整体的梳理,而且对之前提出的任务出现混乱识别,随意切换任务指令,没有效区分两次不同的测试文章,还是说明了它在上下两任务指令和文本中处理的劣势。
整体上面来看,这一次测试明显的体现出deepseek在识别读取文字、长文本中计数还有多次对话中记忆,区分上下文的问题。
2026-05-12
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区
快来抢占第一条评论 ~