English
联系我们
网站地图
邮箱
旧版回顾



新视觉

摩尔线程公布万卡级集群训练成绩 称国产芯片可训出前沿模型_我的网站

傲慢与偏见

A |     2026世界人工智能大会(WAIC)期间,摩尔线程披露,一款236B参数的MoE模型基于国产万卡级集群训练,一款具身智能大脑模型,基于国产千卡集群训练,此外,北京大学EvoPhys团队首个全球5D世界模型EvoPhys-World的全栈原生训练,全程由MUSA软件栈提供底层支撑。    

新智元报道

AI 没有抢走任何人的工作。至少到目前为止没有。         其中,MoE-236B模型基于25T+语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过90%。

B | 这个结论来自 Anthropic 经济研究负责人 Peter McCrory 近日发布的一篇长文。

https://x.com/PeterMcCrory/article/2079979321607745905

https://x.com/PeterMcCrory/article/2079979321607745905经质量调整的 AI 产出在 2024 和 2025 年均增长超过 2000%,约五分之一的美国企业已在业务中使用 AI,但美国 6 月失业率仍然是 4.2%,恰好落在充分就业水平上。McCrory 的核心判断是:AI 目前仍是一种「技能偏向型、劳动力增强型」技术,它在放大人的能力,而不是替代人。

C |          “高精度”是摩尔线程反复强调的能力,摩尔线程高级副总裁董龙飞提到,它指的不是单次计算的数值精度,而是模型在不同GPU平台间迁移训练时的结果对齐能力,即相同模型架构、训练数据、超参数下,能否获得稳定、可比的训练结果。         摩尔线程给出的具体数据是,在DeepSeek一类MoE模型上,与国际主流GPU做对比训练,前3万步的平均相对误差控制在万分之六以内。他同时给这个判断标了有效期:12 个月。

D |

数据不撒谎:

连 AI 高暴露岗位都没事McCrory 拉了一整条数据链来证明美国劳动力市场有多稳:失业率 4.2%,职位空缺与失业人数之比刚过 1,25 至 54 岁就业比例接近数十年高位,初请失业金人数连续四年低位运行。摩尔线程还以500B至5T不等规模的数据做过多轮实验,称基于相同卡数、模型配置和训练流程,摩尔线程平台训练所得模型在下游Benchmark评测中的得分与参考平台基本一致,部分指标更高。他认为,总体而言,美国就业形势稳中向好。

E |          摩尔线程与北京大学EvoPhys团队合作训练的5D世界模型EvoPhys-World,基于MTT S5000完成全栈原生训练,在WorldScore“世界生成”维度连续37天排名第一,该项目获得摩尔线程“灯塔计划”支持,这是国内第一次由中国科学家在中国算力设备上完成的原创世界模型工作,也是“国芯训国模”的一个分水岭。总量数据只是起点,分组对照才见真章。         此外,北京智源研究院的RoboBrain 2.5具身大脑模型,基于FlagOS-Robo框架,依托摩尔线程MTT S5000千卡智算集群,双方成功完成RoboBrain 2.5的全流程训练。首次验证了国产算力集群在具身智能大模型训练中的高可用性与效率。

F | McCrory 与同事 Maxim Massenkoff 此前做过一项分析:把 Claude 被大量用来自动化的任务所对应的岗位单独拎出来,看它们的失业率是否比其他岗位恶化更快。

G | 答案是没有。

H |          摩尔线程创始人、董事长兼首席执行官张建中将AI产业按功能拆分为三类“工厂”:模型训练工厂、词元生产工厂、智能体生产工厂。三者共用同一套全功能GPU架构,这也是摩尔线程与专用芯片路线(ASIC)厂商的核心分野。

I |          词元生产工厂方向,摩尔线程重点展示了基于MTT S5000的PD分离异构推理方案,将算力需求大的Prefill(预填充)计算放在S5000上,将带宽需求高的Decode(生成)计算放在国际主流GPU上,两者异构分池部署。用最新的劳动统计局数据更新,结论不变。软件工程类职位的招聘帖自 2025 年 5 月起反弹,涨幅甚至高于其他岗位的平均水平。唯一值得留意的是年轻劳动者。         张建中在演讲中给出的数据是,异构组合后整体吞吐量较原有方案提升近2倍,并给出算式,“3台S5000+2台国际主流GPU≈9台国际主流GPU”。董龙飞补充表示,这类异构方案的性能比任何同构方案都要高50%以上,其中很大一部分收益来自KV Cache的调度优化,在类似OpenClaw这样反复调用本机命令行工具的场景下,缓存命中率可达90%,相当于节省90%的算力。

J |          据悉,过去一年,国产大模型发布后到完成硬件适配的周期已从“数月”压缩到“发布即适配”(Day 0适配),部分大模型厂商现在会在模型规划部署阶段就与摩尔线程同步“共研”,而不是等模型发布后才启动适配工作。McCrory 承认,年轻人在 AI 高暴露岗位上求职确实变难了,斯坦福数字经济实验室的论文提供了类似证据。         在具身智能方面,早期VLA/VLM类模型参数在5B至14B之间,主要部署于端侧;当前的世界模型路线不再依赖语言输入,直接处理物理世界,参数跨度更大,实现高质量具身控制大致需要10亿参数级别模型在端侧运行,同时配合千亿级(1000B)及以上模型在云端协同。但他也指出一个容易被忽略的背景:2022 年至今,美国经历了有记录以来最大幅度的非衰退式劳动力市场降温,「低招聘、低裁员」格局本就最先挤压早期职业者。摩尔线程正基于自有万卡级集群持续进行万亿参数模型的训练验证,但未公布具体进展和时间表。         提及算力供应话题,董龙飞表示,中国的算力建设是面向未来十至二十年的基础设施投入,短期供不应求属于正常现象,以铁路、高速公路等基建类比,中国GPU或算力企业远未发展到“供过于求”的地步。(本文作者 | 张帅,编辑 | 杨林)          更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App。

K | 把这笔账全算到 AI 头上,证据不够。

为什么没抢走工作:

每个岗位都有 AI 搞不定的环节McCrory 的解释建立在 Anthropic 过去 18 个月多份研究报告的事实基础上,逻辑链条是这样的:第一层事实:在美国劳工部 O*NET 的全部职业分类中,没有任何一个岗位的所有关联任务被 Claude 系统性地完成。每个岗位都存在 AI 搞不定的环节:人际协调、面对面互动、与物理世界打交道。这些环节像木桶的短板,既限制了 AI 对整体生产力的提升幅度,也让能补上短板的人变得更值钱。第二层事实:AI 越强,对操控它的人的要求也越高。

L | Anthropic 今年 1 月的 Economic Primitives 报告发现,Claude 产出越复杂,背后用户的输入专业度越高。模型做出复杂经济模型时,往往是一个能给出精准指令的专业用户在指挥。

M |

https://www.anthropic.com/research/economic-index-primitives3 月的 Learning Curves 报告显示,用 Claude 六个月之后,用户更多地把它当思维伙伴来用,交互成功率更高。如果 AI 已经强到能独立完成工作,这种学习效应不该出现。

https://www.anthropic.com/research/economic-index-march-2026-report第三层事实:即便到了 Agent 时代,人的价值依然稳固。Anthropic 分析了 Claude Code 七个月的使用数据,发现任务价值在持续攀升,但人类专业能力的回报没有下降:用户负责规划,把实现委派给 Claude;专业能力更强的用户,任务成功率更高,Claude 犯错时恢复也更快。

N | 纯编程实现的溢价可能正在缩水,但规划、判断和纠错的价值反而上升了。一个有趣的佐证来自用户自己的感受。Anthropic 6 月的经济指数调查里,超过三分之一的受访者预期 AI 在 12 个月内能完成自己大部分工作,但预期自己因此失业的比例明显更低。

o | 用 AI 自动化程度更高的那批用户,对薪资和工作安全感反而更乐观。

https://www.anthropic.com/research/economic-index-june-2026-report

三种「奇点」和一道防线McCrory 对当下的判断是乐观的,但他没有回避三种可能打破现有格局的未来场景。

p | 它们在学术文献和行业讨论中分别被称为软件奇点、经济奇点和科斯奇点。

https://x.com/MTSlive/status/2090610614154764509软件奇点指的是 AI 自动化创新本身。过去的通用技术再强大,内燃机造不出新的交通方式;但 AI 被直接赋予了通用认知能力,理论上可以反过来加速自身迭代。McCrory 原文明确讨论了这一场景:递归自我改进(RSI)一旦成立,AI 能力的提升将脱离人类控制的节奏。经济奇点是软件奇点的经济学后果。

q | McCrory 援引 Aghion、Jones 和 Jones 2017 年的模型指出,如果创新过程本身被自动化,标准经济模型会预测出「有限时间内的无限增长」。这个结论听起来像科幻,但它是严格的数学推演。科斯奇点则瞄准另一个维度。NBER 2025 年的一篇论文(Shahidi、Rusak、Manning 等人合著)提出,当 Agent 把搜索、谈判、签约和监督等交易成本压到接近零时,Ronald Coase 1937 年的经典问题就会被重新激活——市场协调的成本一旦消失,企业存在的理由也就动摇了。

https://www.nber.org/system/files/chapters/c15309/c15309.pdfMcCrory 讨论的 Agent 场景天然与这一框架对话:如果 Agent 不只改变生产方式,还改变组织形态,劳动力市场的影响将远不止「谁丢了工作」这么简单。面对三种奇点,McCrory 给出的防线是同一道:「弱环节」。这个概念来自 Aghion、Jones 和 Jones 的论文——经济增长的上限不由做得最好的环节决定,而由那些不可或缺却难以改进的环节决定。

https://www.nber.org/system/files/working_papers/w23928/w23928.pdf只要存在始终无法被自动化的关键任务,无论是技术瓶颈还是社会约束,劳动收入份额就不会崩塌,企业形态也不会彻底解体。编程 Agent 的现状已经在验证这条逻辑。McCrory 引用的数据显示,引入编程 Agent 后代码行数增长了 10 到 20 倍,但软件发布量只增加了 30%,应用实际使用量没有任何增长。代码只是软件生产的一环,测试、架构设计、产品判断这些环节仍然卡在人手上,它们就是当前的「弱环节」。McCrory 给出了明确的预测:一年后美国的失业率不会因为 AI 而明显上升。这个判断的有效期是 12 个月,验证信号也很清晰——观察 AI 高暴露岗位的失业率是否开始偏离其他岗位,以及 Agent 场景中人类专业能力的回报是否开始下降。两个指标同时转向的那天,他自己搭建的这套分析框架也需要被修正。

Current article:http://wr381oi.zhaoliebengkuaiwaigeqi.bond/jsehkm/bsrgci.html

Published on:20:32:09


专题推荐

相关新闻


© 1996 - 我的网站 版权所有   联系我们

地址:北京市三里河路52号 邮编:100864