功夫2

摩尔线程公布万卡级集群训练成绩 称国产芯片可训出前沿模型_我的网站

龙的天空

一 |     2026世界人工智能大会(WAIC)期间,摩尔线程披露,一款236B参数的MoE模型基于国产万卡级集群训练,一款具身智能大脑模型,基于国产千卡集群训练,此外,北京大学EvoPhys团队首个全球5D世界模型EvoPhys-World的全栈原生训练,全程由MUSA软件栈提供底层支撑。         其中,MoE-236B模型基于25T+语料,在摩尔线程国产万卡级集群上从零起步完成预训练到长窗口训练的全流程,有效训练时长占比超过90%。    실종자 대부분 여행객…한국 국적인은 수력발전 건설팀                   [누와코트=AP/뉴시스] 26일(현지 시간) 네팔 누와코트 지역에서 돌발 홍수로 물이 불어난 트리슐리강 주변 2026.08.26.[서울=뉴시스] 김재영 기자 = 26일 네팔과 중국 티베트 간 국경선 강을 따라 돌발 홍수 범람과 산사태가 발생해 최소한 17명이 죽고 400명에 가까운 사람들이 실종 상태에 있다.이날 오전 9시께 네팔 수도 카트만두 바로 북쪽인 라수와 지방에서 갑작스런 홍수로 여러 마을이 휩쓸여 사라지고 도로와 인프라가 파괴되었다. 히말라야 산맥 부근의 국경선으로 티베트에 빙하 호수가 있다. 눈이 녹아 내린 물이 국경선의 보테코시강으로 흘러들어 갔으며 또 지진까지 있어 산사태를 촉발했다는 초기 진단이 있다고 BBC는 전하고 있다.수색 구조 작업이 중국 티베트와 네팔 양쪽에서 진행 중이며 12명이 구조되었다. 네팔 당국은 "엄청난 피해"가 우려된다고 말했다. 중국 관영 언론도 상당한 인명 피해가 있다고 전했다.특히 네팔 관광 당국은 홍수가 터질 때 해당 지역에 있던 384명의 여행객들의 행방을 추적하는 데 힘을 기울이고 있다. 일단 실종 상태로 접수된 여행자들은 가이드를 포함 네팔 국적 93명과 외국 국적인 291명 등으로 이뤄졌다. 외국 여행자들은 인도 105명을 비롯 미국, 영국, 말레이시아, 남아공 국적으로 알려졌다.가장 피해가 심한 라수와 지역은 지난해 8월에도 비슷한 돌발 홍수가 났다. 이웃 티베트의 빙하 호수가 산악 지대의 기온 상승으로 넘쳐 네팔 쪽 마을서 9명이 숨졌다.한편 한국 외교부는 네팔 라수와 지역 발생 홍수로 한국 국민 8명이 연락 두절된 상황이라고 밝혔다. 해당 지역에서 수력발전소를 건설 중이던 한국남동발전 및 두산에너빌리티 소속의 직원들이다.AP 통신은 이날 홍수와 산사태로 여러 마을이 물에 휩쓸려 떠내려가고 또 도로 그리고 '수력발전 프로젝트'가 파손 파괴되었다고 말했다.범람한 보테코시강은 티베트에서 네팔로 흘러가며 하류의 여러 지역이 최고 경계 상태에 놓여 있으며 통신과 전력이 중단되었다. 수도로 가는 도로는 폐쇄되었다.。         “高精度”是摩尔线程反复强调的能力,摩尔线程高级副总裁董龙飞提到,它指的不是单次计算的数值精度,而是模型在不同GPU平台间迁移训练时的结果对齐能力,即相同模型架构、训练数据、超参数下,能否获得稳定、可比的训练结果。         摩尔线程给出的具体数据是,在DeepSeek一类MoE模型上,与国际主流GPU做对比训练,前3万步的平均相对误差控制在万分之六以内。摩尔线程还以500B至5T不等规模的数据做过多轮实验,称基于相同卡数、模型配置和训练流程,摩尔线程平台训练所得模型在下游Benchmark评测中的得分与参考平台基本一致,部分指标更高。

二 |          摩尔线程与北京大学EvoPhys团队合作训练的5D世界模型EvoPhys-World,基于MTT S5000完成全栈原生训练,在WorldScore“世界生成”维度连续37天排名第一,该项目获得摩尔线程“灯塔计划”支持,这是国内第一次由中国科学家在中国算力设备上完成的原创世界模型工作,也是“国芯训国模”的一个分水岭。         此外,北京智源研究院的RoboBrain 2.5具身大脑模型,基于FlagOS-Robo框架,依托摩尔线程MTT S5000千卡智算集群,双方成功完成RoboBrain 2.5的全流程训练。首次验证了国产算力集群在具身智能大模型训练中的高可用性与效率。

三 |          摩尔线程创始人、董事长兼首席执行官张建中将AI产业按功能拆分为三类“工厂”:模型训练工厂、词元生产工厂、智能体生产工厂。三者共用同一套全功能GPU架构,这也是摩尔线程与专用芯片路线(ASIC)厂商的核心分野。         词元生产工厂方向,摩尔线程重点展示了基于MTT S5000的PD分离异构推理方案,将算力需求大的Prefill(预填充)计算放在S5000上,将带宽需求高的Decode(生成)计算放在国际主流GPU上,两者异构分池部署。         张建中在演讲中给出的数据是,异构组合后整体吞吐量较原有方案提升近2倍,并给出算式,“3台S5000+2台国际主流GPU≈9台国际主流GPU”。董龙飞补充表示,这类异构方案的性能比任何同构方案都要高50%以上,其中很大一部分收益来自KV Cache的调度优化,在类似OpenClaw这样反复调用本机命令行工具的场景下,缓存命中率可达90%,相当于节省90%的算力。         据悉,过去一年,国产大模型发布后到完成硬件适配的周期已从“数月”压缩到“发布即适配”(Day 0适配),部分大模型厂商现在会在模型规划部署阶段就与摩尔线程同步“共研”,而不是等模型发布后才启动适配工作。         在具身智能方面,早期VLA/VLM类模型参数在5B至14B之间,主要部署于端侧;当前的世界模型路线不再依赖语言输入,直接处理物理世界,参数跨度更大,实现高质量具身控制大致需要10亿参数级别模型在端侧运行,同时配合千亿级(1000B)及以上模型在云端协同。

四 | 摩尔线程正基于自有万卡级集群持续进行万亿参数模型的训练验证,但未公布具体进展和时间表。         提及算力供应话题,董龙飞表示,中国的算力建设是面向未来十至二十年的基础设施投入,短期供不应求属于正常现象,以铁路、高速公路等基建类比,中国GPU或算力企业远未发展到“供过于求”的地步。

五 | (本文作者 | 张帅,编辑 | 杨林)          更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App。

六 |

Current article:http://www.minpinpengcemiuanjiuxuan.pics/news/20260826_256.html

Published on:20:49:25


关于我的网站 | 我的网站动态 | 联系我们 | 法律声明 | 我的网站员工 | 我的网站邮箱 | 网站地图

我的网站版权所有