是 Kable 不是 Fable,Kimi 向全世界证明了四件事

发布时间:2026/7/23 0:42:55
是 Kable 不是 Fable,Kimi 向全世界证明了四件事 作为全球首个开源 3 万亿级大模型总参数 2.8 万亿这个数字足够震撼。从 K2 的万亿参数到今天的 K3中国开源模型再次刷新了模型规模的上限海内外不少网友惊呼这款开源模型性能足以替代昂贵的 Claude Fable 5 和 GPT 5.6 Sol。Kimi K3 发布之后很多人的第一反应都是这个数字3 万亿。作为全球首个开源 3 万亿级大模型总参数 2.8 万亿这个数字足够震撼。从 K2 的万亿参数到今天的 K3中国开源模型再次刷新了模型规模的上限海内外不少网友惊呼这款开源模型性能足以替代昂贵的 Claude Fable 5 和 GPT 5.6 Sol。硅谷知名开发者平台 Vercel 直接在 X 上晒出了一项 Agent 测评的结果Kimi K3 在 Web 工程基准领先于所有模型包括 Fable。甚至有歪果仁感叹中国不到 3 个月就超过了 Fable但如果今天只讨论参数或者超越某款前沿模型反而容易错过 Kimi K3 真正想表达的东西。过去几年大模型行业一直沿着一条熟悉的路径前进参数越来越大、Benchmark 越来越高、模型越来越聪明。进入 2026 年之后一个新的变化开始出现。Anthropic 持续强化长程 AgentOpenAI 不断扩展产品生态Google 把更多能力押注在多模态与世界模型。海内外头部模型的发展方向开始出现明显分化。而 Kimi K3则给出了 Moonshot 自己的答案。继续相信 Scaling Law继续相信预训练同时让模型真正走长程 Agent让大模型参与自身的构建与进化。这也是为什么我认为K3 真正值得关注的并不是 3 万亿参数而是它背后释放出的技术路线。为什么 Kimi 还在坚持把模型做大如果把时间拉回两年前行业讨论最多的问题是Scaling Law 到底还成不成立随着训练成本越来越高不少人认为大模型的发展重点应该转向推理、Agent 或后训练优化而不是继续堆参数。但 Kimi K3 给出的答案非常明确。他们仍然相信更大的预训练模型是未来智能能力的基础。2.8 万亿参数并不仅仅是刷新纪录。它意味着 Moonshot 仍然愿意把资源投入最难、周期最长、风险最高的预训练。在过去 12 个月中的 9 个月里Kimi 模型都保持着开源模型的规模上限。原因其实并不复杂。很多能力并不是通过后训练“调”出来的而是在模型规模跨过某个节点之后自然涌现出来的。从长上下文到复杂推理再到软件工程能力越来越多能力开始依赖模型本身拥有足够高的知识密度和表达能力。这也是为什么目前全球真正能够把模型规模推到万亿参数以上的团队依然屈指可数能够继续向 2 万亿、3 万亿推进的更是凤毛麟角。从 K2 到 K2.5再到今天的 K3Moonshot 一直在做同一件事情不断提高开源模型能力的天花板。真正的变化是大模型开始进入“长程工作”时代如果仔细看 Kimi K3 官方公布的能力你会发现一个很有意思的现象。官方几乎没有把重点放在聊天体验而是反复强调几个关键词100 万 Token 上下文、Long-horizon Coding、Agent、多模态工程。这些能力其实都在服务同一件事情。让模型能够持续完成一项复杂工作而不是回答一个问题。过去大模型完成的是一个对话 Prompt。今天大模型开始完成一个项目。举个简单的例子。写一个登录页面大多数模型都能做到。但如果把整个代码仓库交给模型让它理解项目结构、定位 Bug、修改代码、运行测试、分析日志再根据反馈不断调整方案并连续工作几十个小时这已经不再是“写代码”而是真正参与软件工程。因此100 万 Token 的意义也不只是一次能放进更多文本。整个代码仓库、几十篇论文、历史日志、设计文档都可以成为同一个任务的上下文。对于 Agent 来说超长上下文影响的不只是体验升级而是工作能力本身。这里小编还做两个实测一个是剧本杀游戏网站提出了三个非常苛刻的要求1、 K3 必须严禁失忆须把每一个技术决策、每一次踩坑记录、每一段文件路径都当作“未完结的思考”保留在对话上下文中。2、分阶段交付给我而且只能我同意之后才能继续。3、每阶段必须输出“连续性自检报告”格式以便我监控你的记忆健康度。没想到的是这样一个变态的 token 产出要求K3 很聪明地分析了挑战点不仅第一阶段就给出了长达近 8000 字的剧本设定还在后续自我分析了记忆残存率。第二个案例则是网页版的 3D 单机游戏《仙剑奇侠传 1》可以看出剧情环节怀旧程度很高。每个章节都是满满的回忆杀更关键的是全程只花了我一个小时就完成了本来需要 7 天的开发工作。不过这里帮各位提个醒 K3 的长时程任务完成度很高但要注意不要贪杯因为 token 消耗也是更快的版本但 token 花得真值这一点毋庸置疑。说到这里多提一嘴由于全球用户的疯狂涌入Kimi 不得不在昨天做了一个很坦承的公告由于过去48小时内需求已经逼近公司当前容量的极限。为了保护现有订阅用户的体验将暂停新订阅。这一保证用户体验优先的举动与Anthropic此前频繁的限流举措形成了对比赢得了全球用户的好感很透明别的公司应该学一学。完成长程任务只是第一步K3 想做的是模型参与自己的进化如果说长程 Agent 展现的是 K3 的工作能力那么官方公布的另一个案例则透露出 K3 更大的野心。K3 开始参与 K3 自己的研发。Kimi 官方放出了极具代表性的案例K3 设计了一款高性能芯片用于运行基于 K3 自身架构构建的 nano 模型。在连续 48 小时的自主 Agent 运行中K3 基于开源 EDA 工具和 Nangate 45nm 工艺库独立完成了芯片的构建、优化与验证。这个案例真正恐怖的地方并不在于它优化了多少性能。而在于大模型开始从“帮助人开发软件”迈向“帮助人开发下一代大模型”。过去几年我们更多看到的是 AI 提升程序员效率。而现在一个新的方向开始出现AI 开始参与 AI 本身的研发。从优化模型架构到分析训练实验再到辅助算法迭代大模型正在逐渐进入 AI 科研工作流。这或许也是 Kimi K3 发布中最容易被忽略却最值得关注的一点。它释放出的信号并不是“模型已经能够自主进化”而是模型已经具备参与自身迭代和优化工作的能力。从某种意义上说这也是大模型迈向下一阶段的重要一步。为什么 K3 要重新设计模型架构很多人注意到Kimi K3 采用了全新的Kimi Delta AttentionKDA和Attention Residuals架构。之前很多报道都介绍了它们是什么。但我觉得更值得讨论的是为什么 Kimi 要做这些创新答案其实只有一句话为了让数万亿级别的模型真正能涌现出来更强性能。而这里更强的性能体现不管是各种真实世界任务还是 AI 参与 AI 研发都要面对这三个技术问题模型越来越深上下文越来越长信息在推理过程中很容易不断衰减。一次聊天问题不大。但如果一个 Agent 连续工作十几个小时模型在第 300 步忘记第 20 步的信息整个任务就可能失败。而 Kimi 就是敢于向这些硬骨头发起攻坚。KDA 解决的是长序列效率。Attention Residuals 解决的是长程信息传递。它们共同服务的目标并不是让参数继续增长而是让 3 万亿参数真正转化成现实生产力。这也就不难理解K3 的官方案例几乎全部围绕长程 Agent、软件工程、多模态工作流。比参数更重要的还有开源还有一个细节很多人没有注意到。Kimi K3 并没有在发布当天立即开放模型权重而是宣布将在 7 月 27 日前正式开源。就在这几天海外开发者社区出现了不少讨论。不少人担心中国对于先进模型的监管是否会影响未来开源模型的发布节奏。这种讨论本身其实已经说明了一件事情。过去中国模型努力追赶海外最先进的大模型。今天全球开发者开始担心中国最先进的开源模型还能不能继续开放。这种身份变化本身就是行业格局变化的体现。从 DeepSeek到 Qwen再到今天的 Kimi中国团队已经成为全球开源生态最重要的参与者之一。而 K3 的意义也不仅仅是一款新的模型。它意味着中国团队再一次把全球开源超大模型的竞争真正带到了新的高度。此外Anthropic 更是在 K3 发布 24 小时内就被倒逼发布了“ Fable 5 放开访问令”不止 Max 和团队高级套餐Pro 和 Team 标准用户都可以访问。写在最后如果说 K2 证明了中国能够做出世界级的开源大模型。那么 K2.5 证明了中国开始定义开源模型的新标准。而 K3则第一次让中国团队站到了全球超大模型竞争的牌桌中央。诚然Kimi 很大方地宣布它仍然没有超越 Claude Fable 5也没有刻意喊出“世界第一”。但它释放出的信号已经足够清晰。Kimi 用 K3 向世界证明了四件事一预训练的 Scaling Law 依旧有效二、未来大模型竞争比拼的不再只是参数而是谁能持续完成真实世界里的长时程复杂工作三、Agent 不只是模型发展重点方向让模型自己参与自己的构建将大大加快 AI 世界的进程四、开源模型的竞争中国团队已经不再只是追赶而是开始主动参与定义下一代模型的发展方向。