Kimi K3发布:全球首个开源3万亿级模型,长程Agent能力惊艳

Kimi K3发布,开源大模型再上一个台阶 🚀

Kimi最新推出的旗舰模型K3,一亮相就把关注度拉满。它最大的看点有两个:全球首个开源的3万亿级模型,以及在长程Agent任务上的强势表现。

如果只看参数,K3已经站在了当前开源模型的最前排;如果看实际能力,它更像是一个能真正“干活”的模型,而不只是会聊天。

核心亮点一览

K3这次公布的信息非常密集,但重点可以先抓住这几条:

  • 总参数达到2.8万亿
  • 采用896个专家、每次激活16个的MoE架构
  • 原生支持视觉理解
  • 支持100万Token上下文
  • 引入KDA、Attention Residuals、Stable LatentMoE等结构

这意味着K3不只是“更大”,而是更擅长处理复杂、长链路、跨工具的任务。

为什么K3更受关注?

很多模型在短文本问答里表现不错,但一进入真实工作场景就容易掉链子。比如:

  • 代码库太大,前后文接不上
  • 终端操作多步执行时容易出错
  • 浏览网页、查资料、整理结果时不稳定
  • 任务周期一长,模型就开始“忘事”

K3的优势,正体现在这些地方。

它在多个长程Agent测试中,已经超过了部分闭源旗舰模型,说明它不只是“会答题”,而是更能持续执行任务。

编程能力:不是一次性写代码,而是能持续改代码

在编程相关评测里,K3的表现相当突出,尤其适合看重实战的软件开发场景。

关键成绩

  • Program Bench:77.8分
  • SWE Marathon:42.0分
  • Terminal Bench 2.1:88.3分
  • FrontierSWE:81.2分

这些成绩传递出的信号很明确:K3的强项不是单轮代码生成,而是围绕代码库、终端、测试环境进行持续工作。

也就是说,它更像一个能配合开发流程的Agent,而不是只会“写一段示例代码”的助手。

通用Agent任务:搜索、自动化、浏览器操作更有优势

K3在通用Agent评测中的表现同样很亮眼。

领先的方向

例如在BrowseComp、Automation Bench、SpreadsheetBench 2中,K3都拿到了非常靠前的结果。

这类能力对实际使用很重要,因为很多人要的不是“答对一道题”,而是“把事情做完”。

和闭源旗舰相比,K3强在哪里?

从综合榜单看,K3目前还不是所有项目都全面第一,尤其在一些更广义的知识工作评测里,依然有差距。

但它的优势已经很清晰:

  • 在长链路执行上更稳
  • 在工具调用和自动化场景中更强
  • 在代码库、终端、浏览器等环境里更实用

换句话说,K3更像一个偏“执行型”的模型。

成本优势,可能是K3最现实的卖点 💡

除了性能,K3还有一个非常实际的优势:性价比

在Kimi Code Bench V2中,K3 max的得分和成本表现都很有竞争力。相比之下,一些闭源模型虽然分数更高,但单任务成本也明显更高。

这对开发者和企业来说很关键:

  • 任务量大时,成本差异会被迅速放大
  • 需要频繁调用Agent时,低成本更容易落地
  • 在保持较强能力的同时,预算压力更小

对于很多实际项目来说,模型不是“越贵越好”,而是“够强、够稳、够省”才最重要。

适合哪些场景?

如果想判断K3是否适合自己的需求,可以重点看这些场景:

  • 代码辅助开发
  • 多步骤数据整理
  • 网页搜索与信息归纳
  • 终端自动化操作
  • 长上下文文档分析
  • 需要持续执行的Agent流程

如果是短问答、简单写作,很多模型都能胜任;但如果任务复杂、步骤多、需要长期跟进,K3会更有吸引力。

总结

Kimi K3这次发布,最大的意义不只是“参数很大”,而是把开源模型带进了更实用的Agent时代。

它在长程执行、编程、自动化、浏览器任务上展现出很强的竞争力,同时还有不错的成本优势。虽然在部分综合评测上还没全面超越最强闭源模型,但已经足够让人看到一个清晰趋势:开源大模型正在从会说,走向会做。

对于开发者、产品团队和AI应用创业者来说,K3值得重点关注。

关联文章推荐

关联问答推荐

文章评论

登录后才能发布评论哦
立即登录/注册
还没有评论,快来抢沙发吧~
消息提醒
Hello, world! This is a toast message.