GOOD猫柠

deepseek

今天继续来测评基座模型,deepseek是幻方量化开发的基座大模型,其主要的模型创新点是采用了高效稀疏的注意力机制可以减少显卡的使用量,这个创新极大的消弱了关于显卡的依赖和一直以来关于算力堆积直接影响大模型性能争论,同时deepseek采用的强化学习来引导智能涌现也很好的开创了一个新的讨论方向而非单一的训练数据的推积。现在我们从上下文输入的角度和代码编程辅助能力来测试Deepseek并给出评测结果。 首先是上下文输入的文本层面,这个是大模型的核心功能,deepseek宣称可以容纳100Mtoken的上下文输入,即输入一本三体长度的文本也可以很好的处理。在实际测评下来我发现deepseek确实在更长的上下文长度的处理相比于kimi和豆包等同类模型要强。同时deepseek也首先开发了深度思考模式,这个可以使得deepseek可以进行深度推理以来辅佐更长的上下文推理这个和更长的上下文输入是相辅相成的。 最后提一点就是deepseek在代码辅助方面的能力,个人觉得在复杂的问题建模上要比kimi和豆包的要强,但是却在错误累计方面我认为依然存在并且这个和kimi和豆包依然没有明显的优势,这个希望在未来加以改进。
2026-03-02
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区

快来抢占第一条评论 ~

说真实观点...
有用有用
评论评论
转发转发