五大AI大模型测评Day8
今天的提示词是假设我准备申请工行的暑期实习,目标是金融科技或宏观研究类岗位。请为我梳理近三年ICBC在数字化转型(如AI大模型应用、智能风控等)方面的三大核心落地场景。要求:必须用Markdown表格形式输出。表格只能且必须包含四列:“场景名称”、“核心痛点”、“AI解决方案”和“预期收益”。总体字数严格控制在300字以内,不输出任何表格之外的废话。
这次的提示词相比之前的更为严谨详细。考验大模型的指令遵循和文本质量。
好吧今天的结果有些出乎我的意料,因为五家大模型都严格遵循了我的提示词,也可能是因为提示的足够详尽简单,并且也没有让它们讲废话,从观感上五家大模型差距是在毫厘之间的。硬要分出高低的话从内容质量上看文心5.0和智谱GLM好一些,kimi和豆包相对敷衍,不过都是可以通过进一步的提问来增强模型算力输出,作为日常来说的话已经足够。
接下来考虑不再提问这种区分度低的问题,尽可能通过简单且高质的提问来测试AI的文本质量和幻觉率。
2026-03-23
该文观点仅代表作者本人,36氪平台仅提供信息存储空间服务。
评论区
快来抢占第一条评论 ~