Kimi K3发布:全球首个开源3万亿级模型,长程Agent能力惊艳
Kimi K3发布,开源大模型再上一个台阶 🚀
Kimi最新推出的旗舰模型K3,一亮相就把关注度拉满。它最大的看点有两个:全球首个开源的3万亿级模型,以及在长程Agent任务上的强势表现。
如果只看参数,K3已经站在了当前开源模型的最前排;如果看实际能力,它更像是一个能真正“干活”的模型,而不只是会聊天。
核心亮点一览
K3这次公布的信息非常密集,但重点可以先抓住这几条:
- 总参数达到2.8万亿
- 采用896个专家、每次激活16个的MoE架构
- 原生支持视觉理解
- 支持100万Token上下文
- 引入KDA、Attention Residuals、Stable LatentMoE等结构
这意味着K3不只是“更大”,而是更擅长处理复杂、长链路、跨工具的任务。
为什么K3更受关注?
很多模型在短文本问答里表现不错,但一进入真实工作场景就容易掉链子。比如:
- 代码库太大,前后文接不上
- 终端操作多步执行时容易出错
- 浏览网页、查资料、整理结果时不稳定
- 任务周期一长,模型就开始“忘事”
K3的优势,正体现在这些地方。
它在多个长程Agent测试中,已经超过了部分闭源旗舰模型,说明它不只是“会答题”,而是更能持续执行任务。
编程能力:不是一次性写代码,而是能持续改代码
在编程相关评测里,K3的表现相当突出,尤其适合看重实战的软件开发场景。
关键成绩
- Program Bench:77.8分
- SWE Marathon:42.0分
- Terminal Bench 2.1:88.3分
- FrontierSWE:81.2分
这些成绩传递出的信号很明确:K3的强项不是单轮代码生成,而是围绕代码库、终端、测试环境进行持续工作。
也就是说,它更像一个能配合开发流程的Agent,而不是只会“写一段示例代码”的助手。
通用Agent任务:搜索、自动化、浏览器操作更有优势
K3在通用Agent评测中的表现同样很亮眼。
领先的方向
例如在BrowseComp、Automation Bench、SpreadsheetBench 2中,K3都拿到了非常靠前的结果。
这类能力对实际使用很重要,因为很多人要的不是“答对一道题”,而是“把事情做完”。
和闭源旗舰相比,K3强在哪里?
从综合榜单看,K3目前还不是所有项目都全面第一,尤其在一些更广义的知识工作评测里,依然有差距。
但它的优势已经很清晰:
- 在长链路执行上更稳
- 在工具调用和自动化场景中更强
- 在代码库、终端、浏览器等环境里更实用
换句话说,K3更像一个偏“执行型”的模型。
成本优势,可能是K3最现实的卖点 💡
除了性能,K3还有一个非常实际的优势:性价比。
在Kimi Code Bench V2中,K3 max的得分和成本表现都很有竞争力。相比之下,一些闭源模型虽然分数更高,但单任务成本也明显更高。
这对开发者和企业来说很关键:
- 任务量大时,成本差异会被迅速放大
- 需要频繁调用Agent时,低成本更容易落地
- 在保持较强能力的同时,预算压力更小
对于很多实际项目来说,模型不是“越贵越好”,而是“够强、够稳、够省”才最重要。
适合哪些场景?
如果想判断K3是否适合自己的需求,可以重点看这些场景:
- 代码辅助开发
- 多步骤数据整理
- 网页搜索与信息归纳
- 终端自动化操作
- 长上下文文档分析
- 需要持续执行的Agent流程
如果是短问答、简单写作,很多模型都能胜任;但如果任务复杂、步骤多、需要长期跟进,K3会更有吸引力。
总结
Kimi K3这次发布,最大的意义不只是“参数很大”,而是把开源模型带进了更实用的Agent时代。
它在长程执行、编程、自动化、浏览器任务上展现出很强的竞争力,同时还有不错的成本优势。虽然在部分综合评测上还没全面超越最强闭源模型,但已经足够让人看到一个清晰趋势:开源大模型正在从会说,走向会做。
对于开发者、产品团队和AI应用创业者来说,K3值得重点关注。
创建: 2026-07-17
关联文章推荐
- Google Gemini模型运算量争议引热议,六大新举措应对用户不满
- Claude Fable 5与Mythos 5发布:更强能力、更低价格,企业用户要注意30天留存变化
- ZCode 3.0.0新版发布:GLM5.2免费额度、Agent内核与任务工作区全面升级
- GLM-5.2全球免费6小时:Hugging Face助推国产开源模型出圈
- Codex日志狂写SSD:5M/s烧盘大Bug与止血方法
- Codex日志疯狂写盘怎么办:3个止血办法保护SSD
- step-3.7-flash实测:多模态Agent、代码生成和工具调用到底强不强
- OpenAI收购Ona:Codex升级为24小时持续干活的AI代理
登录后才能发布评论哦
立即登录/注册