Kimi测评:长文本与智能体的双重进化
2025年的AI战场,早已不是比谁聊天更“甜”的过家家局了。在这个节点回看月之暗面(Moonshot)的Kimi,你会发现它已经彻底撕掉了早期“只会读长文”的标签,正在进化成一个能听懂人话、甚至能帮你“干活”的全能型选手。
基于最新的K2 Thinking模型和备受瞩目的“OK Computer”功能,这份测评带你看看一个不一样的Kimi。
1. 核心体验:从“陪聊”到“干活”
如果说上一代AI还在比拼谁的文采更好,Kimi现在的策略是:不仅要动嘴,更要动手。
K2 Thinking:像人类一样“拆解”难题
Kimi最新的K2 Thinking模型(基于MoE架构)是其目前的杀手锏。它不再是一问一答的模式,而是拥有了“深度推理”能力。
实测表现: 在处理复杂问题时,它会像一个经验老道的项目经理,将大目标拆解成数百个子任务。在编程领域,它能实现“Vibe Coding”(氛围编程),你只需要描述想要的功能,它能直接生成可运行的网页代码(比如一个五子棋游戏)。在数学和逻辑推理上,它通过多步工具调用(搜索、计算、验证),解决了很多需要“百步推理”的硬核难题。
OK Computer:你的“数字分身”
这是Kimi推出的Agent(智能体)功能,相当于给Kimi配了一台云端电脑。它能独立完成全栈开发、数据分析、PPT制作甚至网站部署。
体验分享: 当我让它做一个“内蒙古自驾游”的手机端网页时,它从搜索攻略、找图、写代码到最终部署上线,一气呵成。虽然生成速度需要10-15分钟(取决于任务复杂度),但这种“交付成品”而非“只给代码”的体验,确实让人感觉它是一个能独立干活的“数字员工”。
不得不提的“槽点”
我们也得聊聊它的短板:
1. 算力“高峰期”的等待: 由于K2 Thinking和OK Computer对算力要求极高,一旦遇到用户访问高峰期,你可能会看到“高峰算力不足,请耐心等待”的提示。这意味着你可能需要错峰使用,或者为它充值会员以获取优先算力(部分高级功能需付费)。
2. 工具调用的“选择性”: 虽然官方宣称能调用200多种工具,但在实际轻量级对话中,它往往只调用网络搜索。只有在开启“Full Agentic Mode”(完整智能体模式)或下达复杂指令时,那些高级工具流才会全开。
2025-12-11
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区
快来抢占第一条评论 ~