🤖 AI 资讯

每日 05:00 更新 · 09-24 · 主站 liuch.name ↗
全部标签 →
筛选标签:MoE架构 · 返回个性化推荐 · 清空筛选

Meta Unveils 3 Smart Glasses With Built-In A.I. - The New York Times

Google News AI (英文)Meta Unveils 3 Smart Glasses With Built-In A.I.  The New York Times
· Google,Meta,MoE架构,招聘HR
AI 资讯

Naegleria amoebae seek confinement and crawl persistently through narrow spaces

PNASProceedings of the National Academy of Sciences, Volume 123, Issue 38, September 2026.
SignificanceThe “brain-eating amoeba”Naegleria fowlericauses a devastating brain infection with a ~95% fatality rate, yet how these normally harmless pond-dwellers invade the human brain remains mysterious. Using the model speciesN. gruberi, we show ...
2026-09-10 07:00:00 · MoE架构,招聘HR
AI 资讯

KITE: KV-Invariant Transformer Expansion for Efficient Agentic LLM Scaling

arXiv cs.LGarXiv:2609.27294v1 Announce Type: new Abstract: Scaling a language model is not only a question of final quality: the architectural choice determines how much computation is spent during training, prompt processing, and autoregressive decoding to achieve certain model quality. An ideal model architecture should lower all above computation costs to facilitate scaling to a larger model, while ensure the larger model indeed outperforms smaller baselines. We introduce KV-Invariant Transformer Expansion (KITE), a scaling paradigm that achieves this goal. It trains the model from a smaller size to a larger size (i.e., saving training costs via upcycling), while places newly added parameters in regions that do not affect attention KV. Consequently, during inference, prefilling KV only relies on the smaller part of the model, so the inference costs are saved. As a concrete instantiation, we present Step Scale Transformer (SST), a two-tower decoder in which one tower produces KV and the other reads them. At comparable cumulative training compute, SST, a 67B MoE model with 2.15B active body parameters per decode token, achieves lower training loss than 47B and 63B MoE Transformers with 1.48B and 2.02B active body parameters, respectively, while reducing estimated inference cost by 6.7% and 31.6%.
2026-09-24 04:00:00 · 大模型,AI应用,Agent智能体,Transformer,MoE架构,提示工程,论文
AI 资讯

Routing-Aware Expert Calibration for Machine Unlearning in Mixture-of-Experts Language Models

arXiv cs.CLarXiv:2606.10338v2 Announce Type: replace Abstract: Machine unlearning is increasingly important for large language models, yet unlearning in Mixture-of-Experts (MoE) architectures remains underexplored. Unlike dense models, MoE architectures employ a router at each layer to assign each token to a sparse subset of experts. In this work, we observe that forget data often activates a small subset of experts disproportionately, while these experts may receive much weaker activation from retain data. This forget--retain routing mismatch can leave forget-critical experts under-regularized during unlearning. To address this, we propose \textbf{TRACE}, Targeted Routing-Aware Calibration of Experts, for MoE unlearning. TRACE first detects forget-critical experts from offline activation statistics, and then calibrates retain regularization by reweighting token-level retain losses so that each selected expert's retain-side activation frequency better matches its forget-side counterpart. Experiments on WMDP and MUSE-BOOKS across multiple MoE LLMs show that TRACE consistently improves the forget-utility trade-off, yielding a 9\% relative utility improvement over the strongest baseline under comparable forgetting quality and the best performance on three out of four MUSE-BOOKS metrics.
2026-09-24 04:00:00 · 大模型,MoE架构,招聘HR,论文
AI 资讯

Exact Quantile Balancing and Load-Error Injection for Mixture-of-Experts

arXiv cs.CLarXiv:2609.28053v1 Announce Type: cross Abstract: Mixture-of-Experts (MoE) training requires global load balance to prevent expert under-utilization and local balance for efficient expert-parallel execution. Existing distributed Quantile Balancing (QB) uses shard-dependent or approximate global quantiles, while token-independent expert biases cannot ensure microbatch-level balance. We introduce Exact Quantile Balancing (EQB), which computes exact global-batch BF16 quantiles with negligible communication, and Load-Error Injection (LEI), which injects local load errors directly into router-score gradients. On 7.5B-parameter MoEs trained for up to 500B tokens, EQB improves global balance and downstream performance over naive QB, while LEI improves local balance and outperforms the GShard loss at comparable quality.
2026-09-24 04:00:00 · MoE架构,论文

深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 万条轨迹才是底牌

雷锋网代码、视觉、安全共用一套 RL,奖励机制也被重新设计。

    作者丨郑佳美

    编辑丨岑   峰

                                                                                                       

刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。雷峰网当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。图片

01


1M 上下文背后

Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollou
2026-09-23 04:07:00 · 大模型,AI应用,开源,政策监管,小米,语音音频,代码生成,Agent智能体,搜索RAG,设计创意,教育学习,Transformer,MoE架构,强化学习,预训练,提示工程,长上下文,传媒内容,网络安全,模型发布,产品更新,榜单评测

为了智能体AI,高通「新造」了第六代骁龙8超级至尊版

雷锋网

“我们正在从以手机为中心的模式,转向以智能体为中心的新体验。手机、PC、眼镜、可穿戴设备以及汽车,都将成为智能体的终端入口。”2026骁龙峰会上,高通公司总裁兼CEO安蒙说。

过去二十年,智能手机围绕App运转。智能体则需要持续感知、理解上下文、调用工具,并在用户没有操作手机时代表用户执行任务。

“这是一次令人兴奋的技术变革,智能体AI会创造一种全新的终端工作流程。”安蒙表示,“我们需要重新思考计算引擎的设计。CPU需要更强的性能来完成智能体编排,NPU加速器负责高效的AI推理,GPU负责高度并行的计算,连接能力也比以往任何时候都更加重要。”

高通为智能体AI首次同时推出两款2nm制程移动旗舰平台——第六代骁龙8超级至尊版和第六代骁龙8至尊版。

高通技术公司高级副总裁兼手机业务总经理Chris Patrick解释说:“单一标准,已经无法定义旗舰。保持领导力需要不止一条前进道路。”

两款平台共享多项核心技术,第六代骁龙8超级至尊版位于产品组合顶端,拥有高通最顶级的配置,包括业界首个最高主频达到5GHz的移动CPU、GPU中首次加入的Matrix Cores(矩阵核心),以及可以运行300亿参数MoE模型的NPU。

这些升级背后,藏着一个核心问题,智能体全天运行,到底需要怎样的计算平台?高通给出的答案,是从智能体AI需求出发重新设计SoC。

高通到底如何围绕AI,“新造”第六代骁龙8超级至尊版?

智能体撞上「内存墙」,高通给CPU、GPU、NPU同时「动刀」

第六代骁龙8超级至尊版最醒目的数字是5GHz。

但Chris Patrick强调,“速度只是其中一部分,CPU还需要快速访问数据。”

这指向AI难以绕开的内存墙。“端侧智能体的主要问题其实还是内存和续航的限制,而非性能的限制。”高通公司产品技术专家朱元堃对雷峰网表示。

模型推理需要持续读取模型权重、上下文、KV-cache和中间结果。当数据在系统内存与片上存储之间频繁往返,数据搬运所需的时间和电量也会影响实际性能。

内存墙的挑战同时存在于CPU、GPU和NPU,第六代骁龙8超级至尊版如何打破内存墙?

最高主频达到5GHz的Oryon CPU引入全新Oryon FlexCache,让8个核心访问同一个共享L2缓存池,并根据工作负载动态分配资源。智能体处理一连串任务时,数据不必在每次任务交接时都从系统内存重新加载,从而减少任务切换和等待时间。

这也解释了5GHz对智能体的真正价值。CPU不仅要快速完成单个任务,还要缩短整条决策链中每一次调度和交接的等待时间。频率决定计算速度,缓存则决定高频率有多少时间真正用于计算。

Adreno GPU拥有第二代18MB独立高速显存HPM,用于保存渲染瓦片、帧缓冲和中间结果,减少图形管线对系统内存的反复访问,可实现功耗降低12%。

高通Hexagon NPU的共享内存增加50%,让模型状态、上下文和KV-cache更多留在片上,降低外部DDR的访问频率。

第六代骁龙8超级至尊版还采用LPDDR6内存和UFS 5.0闪存。片上空间无法容纳全部模型和长期数据,模型权重可以保存在闪存中,再根据任务加载到内存。

从片上缓存、系统内存到闪存,高通正在从系统维度解决内存墙挑战。但减少数据等待,只解决了智能体计算的一半问题。

什么是为智能体而生的移动计算平台? 

智能体需要持续完成“感知—理解—规划—执行”的循环,在模型、应用服务、终端设备与云端资源之间选择路径,无法由单一计算单元完成。

全天运行的智能体,需要系统级协同。

2026-09-23 23:08:00 · 大模型,算力芯片,AI应用,开源,政策监管,Microsoft,Agent智能体,推理思考,设计创意,MoE架构,端侧AI,招聘HR,网络安全,模型发布,产品更新,榜单评测

智能体重写手机,高通骁龙换挡“双旗舰平台”

钛媒体

(本文作者为 志读科技,钛媒体经授权发布)

当智能手机的角色从信息终端向个人智能体中枢演进,上游芯片的设计逻辑也在被改写。过去十年,旗舰芯片的竞争围绕主频、制程、跑分等硬参数展开。而在智能体浪潮下,芯片设计的核心目标转向了端侧推理效率、多引擎协同能力、内存带宽瓶颈突破与全场景功耗控制,这对上游厂商的技术架构与产品战略都提出了全新要求。

“我认为我们终于步入了一个可以清晰看见AI智能手机形态的阶段。”高通公司总裁兼CEO安蒙在2026骁龙峰会上明确指出,智能体时代已经到来,推理成为关键,边缘侧将发挥重要作用,而骁龙正是面向智能体时代的处理器。

面向AI Agent时代的新竞争,高通改变了过往了产品策略,正式推出第六代骁龙8至尊版与第六代骁龙8超级至尊版两款旗舰移动平台。值得一提的是,这是高通首次在旗舰产品线采用双平台策略,背后既是对智能体时代终端分化的回应,也标志着骁龙旗舰芯片正式从“性能驱动”迈入“智能体原生”的全新阶段。

智能体时代,手机不会消失

相比较往年,今年的骁龙峰会AI味儿更浓。这点倒不是说全场AI出现的高频率,而是在确定的共识下,整个消费电子终端都在关心高通的落地答案。

过去很短一段时间里,AI领域发生了许多变化,发展速度前所未有,比如混合专家模型(Mixture of Experts)、规划器和全新模型架构的发展,MCP协议开始大规模普及,使智能体能够连接互联网中的各种服务。同时,智能体和各类Skills生态也在不断发展。

谷歌设备高级副总裁Rick Osterloh经历过很多计算技术的变革,但仍直言从来没有哪一次像AI计算变革这样。“目前,用户规模和增长速度迎来了爆发。变化之大令人难以置信,而且我认为这真的只是个开始。”

正是这些技术的共同发展,推动着智能手机向AI智能手机加速演进。峰会的一开始,高通也给出了一组数据:70%的受访者表示对个性化智能体感兴趣,66%的受访者表示对多台以个人智能体为核心打造的设备感兴趣。

在高通看来,智能体时代的到来并非一蹴而就,而是移动AI持续演进的必然结果。过去,AI进入智能手机,是以影像辅助的角色出现,本质上是对单一功能的效率提升。而今天,AI正在从根本上重塑智能手机的使用方式,正式迈入智能体的全新阶段。

这一阶段的核心范式转变,是体验的中心从手机转向智能体,交互的起点从App转向意图。安蒙指出,“我们正在从以App和助手为中心的时代,迈向智能体时代。未来体验的核心将不再只是手机,而是智能体,这也将改变智能手机在整个系统中的角色。”

值得一提的是,早在3年前,消费电子市场就在期待新的超级终端的诞生,但事实证明,手机的地位非常稳固。伴随着智能体时代的到来,安蒙也是再一次强调了智能手机不会被取代。

在他看来,手机不仅不会消失,反而会成为智能体时代的控制中枢。核心原因在于,智能手机是最贴近用户的个人终端:它全天候伴随用户,经过深度个性化定制,积累了最完整的用户使用习惯与情境数据。这些数据是智能体实现个性化体验的基础,而手机天然承担了情境汇集、体验融合的枢纽角色。

在交流中,高通高级副总裁兼手机业务总经理Chris Patrick同时指出,随身、情境感知、连接,这些是智能体AI的基础,而智能手机是唯一能够以如此大规模将这三个要素融为一体的终端。

只不过,过去二十多年的智能手机体验几乎一直围绕着App展开。而在智能体时代,体验的起点不再是App,而是意图本身。

移动芯片的新命题,高通用双旗舰回答

要让智能体从概念走向真正可用的体验,行业有着统一的价值标尺。

第一是可信,智能体代表用户行动,必须保障安全、保护隐私,且让用户始终掌握控制权;第二是毫不费力,智能体必须比用户手动操作更简单、更高效,否则就失去了存在的意义;第三是个性化与主动性,智能体需要理解用户所处的情境,主动提供服务而非打扰用户,在需要的时刻及时响应,并且能够跨不同终端持续运转。

这一切体验的落地,都对底层硬件体系提出了颠覆性的要求,需要重新思考如何设计计算引擎。智能体工作流具备多任务并发、异构核心频繁调度、模型参数量大、对内存带宽高度敏感的特点,它要求芯片从底层架构层面实现计算、内存、传感与连接的全系统协同。

这也正是高通新一代旗舰芯片的出发点:不再追求单点参数的极致,而是围绕智能体的真实工作流,做全链路的系统性优化。“单一标准,已经无法定义旗舰,保持领导力需要不止一条前进道路。”安蒙说道,因此今天,高通推出两款骁龙8至尊版平台。

其中,第六代骁龙8超级至尊版移动平台搭载全新Qualcomm® Oryon™ CPU、下一代Qualcomm® Adreno™ GPU和重新设计的Qualcomm® Hexagon™ NPU,并配备LPDDR6内存与高速存储通道。

定制Qualcomm Oryon CPU峰值频率高达5GHz,并引入全新的可扩展缓存架构Qualcomm Oryon FlexCache,实现更加强大的智能体多任务处理和系统规划能力;Adreno GPU引入针对AI负载打造的Adreno Matrix Cores,并支持全新Adreno Neural Fusion特性,将AI和图形处理更加紧密结合。

Hexagon NPU则面向智能体AI的Transformer工作负载引入全新的Element Accelerator,并将大容量共享内存扩容50%,实现端侧推理性能的进一步突破,可支持300亿参数级别的MoE混合专家模型。

在会后的交流中,谈及5GHz的高频,高通技术公司执行副总裁兼技术规划、边缘解决方案和数据中心业务总经理马德嘉表示,这是基于当前智能体AI任务特点而决定的,Agent AI工作负载必须确保编排过程非常快速地完成,这样的设计是为了满足Agent AI在设备和数据中心对CPU算力日益增长的需求。

第六代骁龙8至尊版同样采用2纳米制程工艺,搭载定制的Qualcomm Oryon™ CPU、全新架构的高通® Adreno™ GPU和高通® Hexagon™ NPU。谈及二者之间的差异,Chris Patrick表示,主要还是在封装上面。至尊版采用传统封装堆叠(PoP)方案,超级至尊版采用Offset PoP封装方案,可以更好的优化散热能力,带来更持久的峰值性能。

“随着智能体AI时代持续演进,我们的多旗舰策略有助于扩展移动体验的边界,同时将最新的AI创新技术引入更广泛的旗舰终端中。通过打造两款创新的平台,我们为OEM厂商提供更丰富的选择,并共同塑造下一代智能、个性化移动体验的能力上限。”

长跑才刚开始

在高通的战略路线中,智能体将成为体验的中心,用户的手机、PC、眼镜、可穿戴设备、以及汽车,都将成为智能体的终端入口。

除了手机旗舰新品,高通还推出了第二代骁龙音频平台至尊版,与前代平台相比,AI能力提升高达2倍,并支持多种智能体验同时运行,平台功耗降低高达40%、平台尺寸缩小达30%。

“AI要为你服务,并与你息息相关,否则你根本不会使用它。如果AI与你的需求和情境不相关,你就会选择自己完成这些事情。”安蒙说道。

只是,尽管智能体时代的技术蓝图已经清晰,但落地之路仍面临多重挑战。

从行业环境看,全球智能手机大盘增长趋缓,无形中成了智能体手机的阻碍;从技术落地看,端侧大模型的内存与功耗瓶颈仍存,智能体应用生态碎片化,消费者对AI 手机的感知仍停留在概念层面;从商业层面看,前沿技术的研发与制造成本高企,如何在高端突破的同时实现技术下沉,覆盖更广泛的用户群体,也是全行业的共同课题。

当然,高通也认识到了这一点,个人计算的未来不是某个终端决定的,规模化有挑战,公司首席营销官莫珂东直言,“没有任何一家公司能够独自构建这样的未来。当企业各展所长,并在打造人们信赖且愿意使用的体验方面达成共识时,创新自然水到渠成。”

为此,在峰会现场,你会看到舞台上不单是高通的技术宣讲,还有合作伙伴的落地成果展示。从小米、荣耀到努比亚再到千问,中国公司几乎成了端侧智能体落地的航向标。与此同时,小米和摩托罗拉还来到现场站台。

其中,小米集团高级副总裁曾学忠宣布,小米将全球首发第六代骁龙8超级至尊版和第六代骁龙8至尊版处理器,并现场展示了小米18 Pro系列真机,将于年内登陆全球市场。目前,搭载这两款旗舰芯的手机也已经在国内发布。

摩托罗拉移动业务首次向全球展示最新一代AI旗舰智能手机产品,搭载骁龙8 Elite Extreme Gen 6移动平台,围绕端侧AI体验、移动影像品质和性能稳定性等方面进行了升级,并首次引入Bang & Olufsen音频技术,预计于2026年在全球市场上市。

从技术路演,到与合作伙伴一同定义未来,智能体时代的大幕才刚刚拉开,下一个落子也并非由一方独自打造。而唯一可以确定的一点是,移动芯片的竞争已经从参数比拼进入体验定义的新阶段。

高通此次的双旗舰布局,既是对当下行业变革的回应,也是对未来十年移动计算的押注。对于消费者来说,真正的AI手机或许还在路上,但底层的技术基石,已经在这一代芯片中悄然成型。(本文首发于钛媒体APP,文 | 志读科技,作者 | 杜志强,编辑 | 杨林)

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

2026-09-24 02:31:34 · 大模型,算力芯片,AI应用,政策监管,阿里巴巴,小米,语音音频,对话助手,Agent智能体,推理思考,设计创意,Transformer,扩散模型,MoE架构,模型评测,端侧AI,工业制造,传媒内容,营销广告,招聘HR,基础设施,模型发布,产品更新,合作

2026 骁龙峰会高通高管群访:双旗舰策略、行业首超 5GHz、和小米合作关系、AI 手机未来...

IT之家

IT之家 9 月 24 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会主题演讲结束后,高通公司高级副总裁兼手机业务总经理克里斯 · 帕特里克(Chris Patrick)在内的诸多高通高管接受了IT之家等媒体采访。

在本次媒体群访中,出席的高通高管有以下几位:

  • 高通技术公司高级副总裁兼手机业务总经理 Chris Patrick

  • 高通技术公司产品管理副总裁 Judd Heape

  • 高通技术公司产品管理副总裁 Vinesh Sukumar

  • 高通技术公司产品管理总监 Amandeep Dhaliwa

  • 高通技术公司 CPU 产品管理高级总监 Manju Varma

  • 高通技术公司高级副总裁兼旗舰移动平台总经理 Dino Bekis

问:第一个问题,第六代骁龙 8 至尊版和超级至尊版的 GPU,在硬件上有什么具体区别?能详细讲讲吗?另外,频率是否一致?第二个问题,这一代 8 Elite 有两款,还会有非 Elite 的第六代骁龙 8 吗?还是以后都会走双 Elite 路线?是否依旧会有非 Elite 的 8 系列?

答:

今年,我们首次对骁龙 8 至尊版产品组合进行了进一步细分,推出两个不同的 SKU,也就是两款骁龙 8 至尊版平台。

其中,定位更高的第六代骁龙 8 超级至尊版,重点引入了一系列新兴能力。例如,它支持 VVC 编解码技术,稍后还会进一步谈到。它还支持 LPDDR6。

此外,第六代骁龙 8 超级至尊版还支持更多 AI 能力。并且采用了一种全新的、针对散热进行优化的 Offset PoP 封装,这也是第六代骁龙 8 超级至尊版所独有的。

我们的初衷,是先打造一款出色的平台,作为第五代骁龙 8 至尊版真正的继任者,也就是第六代骁龙 8 至尊版。

在此基础上,我们打造了第六代骁龙 8 超级至尊版,通过加入更多全新的前沿能力,以全新方式引领行业发展。

从影像角度,我简单介绍一下第六代骁龙 8 至尊版和第六代骁龙 8 超级至尊版之间的区别。只有超级至尊版支持用于专业视频拍摄的 APV 专业视频编解码器;同时,8K 60fps 视频拍摄和 4K 240fps 超级慢动作视频拍摄也只有超级至尊版支持。

正如 Chris 提到的,也只有超级至尊版支持 VVC 解码。除此之外,两款平台在影像方面的能力基本相同。

刚才还有一个关于频率的问题。实际上,这两款平台的共同点多于差异。比如,两者采用相同的 CPU 架构、实现方式和频率;两者也采用相同的 GPU 架构和实现方式,仅在部分规格上有所差异。

接下来的问题是,第六代骁龙 8 系未来是否还会推出非至尊版的产品,我们始终会从整个行业发展和需求出发,评估需要重点投入哪些产品层级,以及哪些产品层级能够带来最大的影响,希望大家可以持续关注。

问:我有两个问题。第一个问题是,第六代骁龙 8 超级至尊版的 CPU 主频首次达到 5GHz。不过,目前许多 AI 工作负载对时延的敏感度正在降低,对吞吐量则更为敏感。您认为 CPU 时延目前仍是主要瓶颈吗?哪些具体用例能够真正受益于 5GHz 的 CPU 主频?第二个问题是,安蒙今天上午提到了 HBC 没有展开介绍。我们是否可以将其理解为一种近存计算架构,类似于英伟达 GPU 所采用的 HBM 理念?

答:

好的,我先回答第一个关于 CPU 的问题。我们的 Qualcomm Oryon CPU 是首个最高主频达到 5GHz 的移动 CPU。

不过,在设计 CPU 时,我们关注的不只是时钟频率,还包括 CPU 在实际工作负载下的 IPC 表现。我们的缓存层级设计也着重提升实际工作负载下的响应速度。

因此,在设计 CPU 时,我们也充分考虑了智能体 AI 工作负载的需求。时钟频率是提升响应速度的关键因素之一,因为智能体 AI 工作负载需要快速完成任务规划,同时还要确保任务能够在 CPU、NPU 和 GPU 之间高效切换与协同。

我们的 CPU 正是基于这些需求进行设计,以更好地应对如今的智能体 AI 工作负载。

第二个问题是关于 HBC。我们介绍了这个产品概念,但目前还没有具体的产品发布。正如你所说,如果能扩大处理器可用的带宽,我们就有机会在边缘侧 AI 上实现一些非常重要的突破。

因为,许多 AI 工作负载都受限于带宽和数据传输。因此,目前分享的概念是:如果能够让内存与处理器进行协同设计,就可能为 AI 带来一些非常特别的能力。但现阶段仍只是一个概念,更多细节将于后续公布。

再补充一点。我们与生态合作伙伴以及全球多个地区的前沿 AI 实验室保持着良好合作,他们一直在向我们提出新的挑战,例如如何进一步降低端到端时延,以及如何更好地支持多模态上下文生成。

面对这些越来越复杂的需求,关键在于如何跳出既有思路,在边缘侧解决这些挑战。目前 HBC 还只是一个概念方向。我们只是提前分享了一些思考。而正如 Cristiano 提到的,预计到 MWC,大家还会看到更多消息。

问:我想问一个关于旗舰级 SoC 竞争态势的问题。今年整个旗舰级 SoC 的进步都非常大,尤其是你们最关键的竞争对手。目前双方产品的差异化主要体现在哪里?对于消费者体验更关键的因素,高通在哪些方面更占优势?

答:

对于友商的产品我们不便进行评论。我们对自己在高通所做的工作感到自豪。我认为,高通在研发深度以及内部自主设计的技术数量方面,在行业中具有独特性。

我们拥有定制的 CPU,针对消费者需要的应用和使用场景打造;我们的 GPU 技术也是自主设计的,完全定制。AI 技术同样基于数十年的研发和积淀。

例如,今天我们介绍了 Adreno Neural Fusion 架构和系统,这里面的各个组件经过协同设计,最终实现了出色的游戏画质、保真度、分辨率和帧率,同时借助 AI 能力与图形管线的融合,在低功耗下实现这些效果。这种能力只有在各项技术协同设计的前提下才能实现,而这正是高通的核心优势。

问:我这边会有一个问题是关于小米与高通关系。我们都知道,小米自己也有在研发自己的芯片,那同时它的旗舰产品也有在用高通的芯片。那我们会想知道,小米玄戒 O3 的进步,会不会影响到它与高通之间的关系?现在小米与高通的关系是类似于是竞争呢,还是说双方之间会分享一些芯片开发中的经验?

答:

高通与小米之间保持着紧密的合作关系,我们的合作覆盖多个产品领域,包括平板、手机和汽车等,并且还在持续深化。客户拥有自研 SoC 的情况并不罕见。

回顾高通的发展历史,很多与我们合作的公司同时也拥有自己的自研 SoC。这更多是出于技术战略和技术能力展示的考虑,同时也希望针对一部分特定应用进行更深度的定制。

总体而言,我们非常高兴能够与小米保持深度合作,也很高兴今天能够与小米同台;对于未来的合作,我们同样期待。

问:今天这一代的超级至尊版,它堆叠了很多技术,但我们也了解,它其实推高了整个晶圆的成本。那我想知道的就是说在这个整个手机市场大盘比较趋缓的时候,你怎么去游说你的这些利润变薄的手机厂商去采购这个高溢价的 AI 芯片,这是第一个问题。

答:

如果看任何一家 OEM 厂商的产品组合,通常都会有标准版、Pro 和 Ultra ;在整个产品线中,不同机型对应不同价位,也具备不同的性能配置。

以影像为例。定位最高的机型通常会配备极其精密的变焦和高分辨率镜头,以及协同工作的多传感器阵列。

而在入门级或标准机型上,厂商可能会更侧重于打造差异化的用户体验。毕竟,手机产品本身就涵盖非常丰富的层级。

例如,有的客户希望终端针对 4K 30 帧进行优化,按相应方式控制成本;另一些客户则愿意增加投入,支持 4K 60 帧,获得完整的最高规格能力。

我们提供多个层级,就是为了支持 OEM 定制产品能力和成本结构,匹配自身需求,从而为终端用户带来真正有价值的体验。

问:今天上午的演讲可以看到,无论是 CPU、GPU 还是 NPU,都有了更大的内存。系统级内存是不是也同时增大了?有了更强的 CPU、GPU 和 NPU 的 AI 性能之后,如何从系统层面把它们更好地协同起来,让整个 SoC 的性能更好?这包括硬件之间的调度,以及软件层面的工作。

答:

正如之前提到的,手机 AI 经历了从感知、生成式到智能体 AI 工作负载的演进。而智能体 AI 工作负载本身,也在发生从基于指令的模型到基于推理的模型的转变。

当转向基于推理的模型后,模型本身的规模本身非常大,比较典型的就是混合专家(MoE)模型。

MoE 模型的计算开销较高,需要把激活值保存在本地。如果把它们放在 SDRAM 中,再从 SDRAM 搬运到本地计算资源,会导致功耗提升。

正因如此,我们显著增加了与 Hexagon NPU 紧密耦合的 SRAM 本地内存容量,以支持更高的激活值存储,并暂存这些数学运算过程中的中间数据。

关于第二个问题,按我的理解,在设计这类系统时,我们始终会从端到端的软件赋能去考量,寻找提升服务质量、提升效率,并支持更大规模的模型的机会。

基于这个思路,我们对内存模块做了分区设计;软件层面也会做适配,以此实现最优的每瓦性能(或者说每焦耳输出的词元数),在 HDP 上尤其如此。

我就 GPU 这部分再补充一点。大家应该还记得,此前我们引入了 Adreno 独立高速显存(HPM),今年,我们又在 GPU 中加入了 Matrix Cores。

对于神经网络渲染、超级分辨率、帧生成这类先进工作负载,渲染管线必须与 GPU 紧密结合,因此内存就成为其中的关键一环。

以 Adreno Neural Fusion 为例,它是一个多卷积模型,卷积运算的输出会存储在 HPM 中,完全无需访问 DDR,从而在游戏过程中进一步提升能效。

所以,回到 Vinesh 刚才谈到的内容:从内存的角度看,一方面是平台层面的整体考量,另一方面是面向具体用例的优化,HPM 就是这类针对用例优化的好例子。

问:今天骁龙发布的全新平台在底层架构上实现了诸多创新,为终端厂商和软件生态提供了强大的底层能力。请问高通在生态方面会增加哪些投入?在软件栈方面是否会提供更多工具?针对中国市场,在模型和应用开发者支持方面又会有哪些投入?

答:

举个例子,借助 Matrix Cores,开发者可以通过 llama.cpp 这类标准框架来调用它们,运行常规的 AI 工作负载;此外还有通过 Vulkan 提供的扩展,开发者也可以借此进行调用。

另外,在性能分析工具方面,我们也在持续增强 Snapdragon Profiler 的相关能力。因此从工具的角度看,开发者可以使用 Snapdragon Profiler,查看开启与未开启 Adreno Neural Fusion 时不同的渲染帧,并在此基础上开展大量的工作与开发。

我也从 AI 的角度补充几点。在 AI 领域,我们与中国合作伙伴的关系逐年深化。起初,我们与大多数独立软件供应商(ISV)建立了深度合作;在此基础上,我们也开始与阿里等这些前沿的 AI 实验室紧密协作。

我们与他们保持合作,能够较早接触到 Qwen 3、Qwen 3.5 和 Qwen 3.8 等模型,并努力推动这些模型在高通芯片上实现完整的 Day 0 支持,尤其是在阿里生态相关模型方面。

同样,随着向智能体工作流演进,我们也需要支持 MoE 模型。Chris 今天在交流中提到了那个推理演示。

我们与一家中国生态合作伙伴建立了非常紧密的合作,对方得以展示自身的能力,我们也很快完成了集成。

这样的合作也在随着时间不断扩展。而且,合作对象已不只是传统的 ISV。我们此前聚焦于检测、分类和分割,这些固然很重要,但我们也开始与一批伙伴展开合作,他们高度专注于智能体方向,以及用生成式 AI 生成合成数据。

最后同样重要的一点是,我们也在扩展工具和性能分析子系统,让许多生态合作伙伴能够独立开展工作,自行查找瓶颈所在,尤其是在带宽优化和算力优化方面。

这方面的能力同样通过高通 AI 软件栈得到了增强,所有人都完全可以使用,通过高通开发者网站下载即可。

我再补充一点。在考虑开发者、考虑如何让这个平台的能力真正被调动起来时,我们主要从两个方面来看。

一方面,我们希望确保平台确实是为终端用户和那些将为平台增值的人而设计的。举个例子,刚才有一个问题问到,我们如何协调 CPU、GPU 和 NPU 之间的工作。答案其实是, 我们之所以有多个 AI 引擎,一定程度上正是因为存在多个不同的开发者生态。

比如,以游戏为核心的开发者,希望 AI 能力内嵌在 GPU 之中;一些基于 CPU 的开发者,希望 AI 与 CPU 深度绑定;还有一些开发者,希望使用大规模、高性能的中央 NPU 能力。因此,面向这些不同的开发者,我们尽可能让各类软件生态都能便捷地使用我们的平台。

另一方面,无论在中国还是在全球,我们都开展了非常活跃的合作伙伴项目,与关键技术厂商合作,把他们的技术引入我们的平台,并提供给 OEM 厂商使用。影像技术尤其如此,在这一领域,我们与整个生态建立了非常深入的合作。

我认为在任何技术生态系统中,影像领域的 ISV(独立软件开发商)合作关系可能是最丰富的,尤其是在中国。

我们已经加大了相关支持力度,不仅帮助 OEM 厂商,也帮助当地的 ISV,而且成效已经显现。如果大家今天晚些时候或者本周去演示区看看,就会看到大量来自中国的 ISV 和合作伙伴带来的影像和视频方面的技术演示。

问:大家好,我有两个问题,过去的计算产业的价值是围绕着设备和芯片分布的,但是现在 Agent 成为计算主体了,计算也开始围绕着 Agent 动态的调整分布式的计算资源。那我的问题是,您觉得未来的异构计算还是应该以 SoC 为边界吗,还是说这种 agentic 的方式会催生出一种新的算法和计算架构或者去改变我们现在理解的一种计算形式?

答:

本质上来说,你是对的 —— 智能体可能确实属于更上层的架构,不管是从行业标准层面看,还是从 OEM 厂商层面看。但在我看来,SoC 之所以仍然是整个解决方案的核心,有一个非常突出的原因:我们必须解决一系列非常基础的问题。

比如,计算到底在哪里运行?如何路由选中模型?传感器中枢如何协同所有这些不同的传感器输入?内存和情景信息如何管理?功耗如何优化?如何实现安全的跨设备通信?以及最终如何决策 —— 哪些数据留在端侧处理,哪些需要上传到云端?所以我认为,在智能体时代,SoC 的价值和重要性,它的架构, 我们做出的这些选择反而变得更加关键了。

问:第二个问题就是,我们今天已经可以在端侧上跑很大的后端模型了,然后也有了 Agent,也有了持续性理解用户的能力。那为什么现在我们理想中的 AI phone 还没有出现?你觉得当前的一些技术瓶颈在哪里?然后到了 2026 年,你觉得像 AI phone 这样的形态产品应该真正向消费者传递的一些核心的变化和体验应该是什么?谢谢。

答:

我认为,当我们讨论 AI 手机时,核心问题始终是:你到底想解决什么样的问题?你是想解决某个特定的时延挑战?还是想确保有一组合适的模型能够部署在边缘侧,从而真正带来你所期望的体验?

我认为,过去几个月 —— 或者说过去一年 —— 小模型领域取得了巨大进步。我们已经从 30 亿参数的稠密模型,发展到能够支持 300 亿参数级的 MoE 模型。

在此之前,并没有成熟的技术能够支持这类 MoE 模型在终端侧运行,而现在我们已经具备了这样的能力。

智能体体验还需要一类能够快速判断、即时响应并采取行动的模型。这类能力在过去是不具备的。

所以我认为,纵观模型能力的演进、系统概念能力的演进、算法的演进,现在我们已经拥有了大量的基础构建模块。我相信我们的大多数生态合作伙伴将会利用这些基础能力,催生出大量创新应用 —— 而这在过去是无法实现的。

此前行业虽然大力推动,但最终落地效果并不理想。我期待随着高通在生态系统中赋能这些重大创新,未来我们将看到更多智能体形态涌现。

2026-09-24 04:08:21 · 大模型,算力芯片,AI应用,政策监管,OpenAI,Meta,NVIDIA,阿里巴巴,小米,多模态,Agent智能体,推理思考,搜索RAG,设计创意,游戏,MoE架构,端侧AI,招聘HR,网络安全,模型发布,合作,财报,开发者生态
AI 资讯

Unlocking Cross-Scenario Physical Layer Security: A Mixture-of-Experts Framework with Generative Diffusion Models

arXiv cs.LGarXiv:2609.26598v1 Announce Type: cross Abstract: The future 6G networks are expected to incorporate a proliferation of wireless services in diverse environments, which presents a significant challenge for information security. Conventionally optimization always requires recalculation and learning strategy often suffers poor generalization, which are thus incapable for the security provisioning with wide scenario coverage. In this paper, we propose an adaptive and robust learning framework that leverages a mixture-of-experts (MoE) architecture to achieve cross-scenario physical layer security guarantee. Specifically, we first select a few representative scenarios and establish the scenario-specific generative diffusion model (GDM)-based experts for secure transmission beamforming with artificial noise. The diffusion nature of experts learns the overall probability distribution of security strategy solution landscape and the Transformer-based denoising process enhances the ability to generalize across varying network configurations. Then, a lightweight gating network is constructed to identify the scenarios by engineering the channel features and select the most relevant experts. Finally, an attention-based combiner is introduced to synthesize the security proposals from the top-rated experts to produce a high-fidelity security strategy to cover the unseen scenarios. Simulation results demonstrate that the proposed GDM-based MoE framework can accurately recognize the scenarios and properly select the experts, maintaining near-optimal secrecy rates across a continuum of wireless scenarios and outperforming traditional single-model paradigms.
2026-09-23 04:00:00 · AI应用,搜索RAG,Transformer,扩散模型,MoE架构,榜单评测,论文
AI 资讯

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

arXiv cs.CLarXiv:2605.26842v2 Announce Type: replace-cross Abstract: The Muon optimizer has recently offered a promising alternative to AdamW for large language model training, leveraging matrix orthogonalization to produce geometry-aware updates. However, like all first-order methods, Muon can become trapped in sharp local minima. In this work, we present MONA, an optimizer that bridges Muon's orthogonalization framework with curvature-aware acceleration. MONA adds an acceleration term directly into Muon's gradient processing pipeline. This term is calculated from the exponential moving average of gradient differences. We provide a detailed convergence analysis for MONA, showing that the acceleration term introduces curvature-sensitive corrections while preserving Muon's spectral-norm regularization. Empirically, MONA achieves better convergence and downstream task performance compared to both Muon and AdamW across three scales of Mixture-of-Experts pretraining, spanning from 1B to 68B parameters, with the largest model trained on 1 trillion tokens. Furthermore, we conduct supervised fine-tuning on the MOE-68B-A3B model and evaluate it on general capability, mathematical reasoning, and code generation benchmarks, where MONA achieves SOTA performance.
2026-09-23 04:00:00 · AI应用,推理思考,搜索RAG,MoE架构,微调蒸馏,预训练,模型评测,招聘HR,论文
AI 资讯

TopoCompress: Topology Aware Token Compression Algorithm for Distributed Edge MoE Inference

arXiv cs.CLarXiv:2609.26061v1 Announce Type: cross Abstract: Mixture-of-experts (MoE) models improve capacity with moderate overhead by sparsely activating experts per token. However, deploying MoE across resource-constrained edge servers incurs substantial cross-server communication as experts are distributed across heterogeneous servers. Existing placement methods optimize for raw token traffic, while conventional compression considers semantics but ignores topology-dependent routing costs. Consequently, independent optimization leads to inefficient communication and resource utilization. This paper proposes TopoCompress, a deployment- and topology-aware token compression framework for communication-efficient distributed edge MoE inference. It jointly optimizes token compression, expert deployment/replication, GPU-CPU residency, and collaborative routing to balance cross-server transmission, quality, and resource use. To address the coupling between token-level compression and epoch-level deployment, TopoCompress employs a two-timescale alternating optimization. In the online fast loop, it identifies and compresses low-importance, high-routing-cost tokens and jointly routes surviving expert activations. In the offline slow loop, it updates expert placement, replication, and GPU-CPU residency according to post-compression traffic accumulated during online inference. We establish the feasibility, optimality, convergence, and computational complexity. Simulations demonstrate that TopoCompress effectively reduces cross-server traffic and deployment resource consumption while maintaining controllable inference quality, enabling efficient distributed MoE inference over bandwidth- and resource-constrained edge infrastructures.
2026-09-23 04:00:00 · 算力芯片,MoE架构,榜单评测,论文
AI 资讯

Combining Hierarchical Cognitive Process with Process Supervision for Interpretable Scene Safety Understanding

arXiv cs.CLarXiv:2609.26399v1 Announce Type: new Abstract: Scene safety understanding plays a life-or-death role in situational awareness in various critical domains. Traditional methods that rely on learning direct mappings between scenes and safety levels often lack interpretability, limiting their reliability in critical applications. An effective approach to overcoming this challenge lies in interpreting human cognitive processes and equipping machine models with analogous cognitive capabilities. This work explores an effective way of integrating scene safety cognitive process modeling and process supervision. Specifically, we first construct a hierarchical cognitive safety structure, which motivates the development of a novel, high-quality scene safety understanding dataset based on multi-step reasoning with process labels. This dataset serves both as a benchmark and a resource to improve the safety reasoning capabilities of Large Language Models (LLMs), while also enabling a granular analysis of intermediate reasoning steps through information flow and saliency-based techniques. Building upon this foundation, we introduce a modular and flexible process supervision framework that reflects the hierarchical nature of human cognition. This framework leverages LLMs as the core architecture and incorporates Low-Rank Adaptation(LoRA) and Mixture-of-Experts (MoE) strategies to enable specialization and collaboration among expert modules, each tasked with specific sub-processes of the overall reasoning chain. Systematic experimental evaluations and analyses confirm that our framework exhibits superior interpretability and performance characteristics compared to traditional approaches.
2026-09-23 04:00:00 · 大模型,AI应用,推理思考,搜索RAG,扩散模型,MoE架构,微调蒸馏,模型评测,招聘HR,论文
AI 资讯

HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing

arXiv cs.CLarXiv:2609.26368v1 Announce Type: new Abstract: Long-horizon and multi-turn agents typically generate short actions and process long observations from tools and environments. This growing context demands efficient prefill, compact KV-cache storage, and accurate long-context retrieval. To meet these demands, we introduce HySparse2, a hybrid sparse attention architecture with two-level KV sharing. At the outer level, KV Bridging adopts a YOCO-style self-decoder and cross-decoder structure, but bridges only full-attention layers. The self-decoder uses hybrid sliding-window attention (SWA), while the cross-decoder uses hybrid sparse attention. The KV caches for full-attention layers in the cross-decoder are generated from the hidden states of full-attention layers in the self-decoder. At the inner level, HySparse2 retains HySparse's core KV Reuse design with two refinements. First, it replaces block-level sparsity with token-level sparsity for finer long-context retrieval. Second, it removes the separate SWA branch from sparse layers and instead forces a sliding window of recent tokens into the sparse selection. This two-level KV sharing allows all cross-decoder KV caches to be constructed from self-decoder hidden states. Prefill can therefore exit after the self-decoder, skipping all cross-decoder layers. On an 80B-A3B MoE model, HySparse2 outperforms HySparse and Hybrid SWA on long-context retrieval and multi-turn agentic tasks, while substantially reducing prefill computation and KV-cache storage.
2026-09-23 04:00:00 · AI应用,Agent智能体,搜索RAG,Transformer,MoE架构,论文
AI 资讯

Qwen3.8-Omni: Towards Native Omni-Modal Agents

arXiv cs.CLarXiv:2609.25611v1 Announce Type: new Abstract: We introduce Qwen3.8-Omni-Flash, a natively multimodal agentic model for real-world multimodal productivity. Compared with previous omni models, which primarily emphasized perception and interaction, Qwen3.8-Omni-Flash substantially improves multimodal understanding and reasoning, as well as performance on long-horizon agentic tasks. These capabilities are supported by a native multimodal co-training strategy that preserves strong text-domain capabilities while facilitating the transfer of agentic capabilities from text to audio and video tasks. The model inherits the sparse mixture-of-experts (MoE) architecture of Qwen3.8-Next and extends the context window to one million tokens, supporting long-context multimodal reasoning and long-horizon planning. These advances enable integration into production workflows as a primary agent or a specialized sub-agent, supporting video editing, long-form audio and video translation, music-conditioned music video or movie generation, and video-based note or omni-skill creation. To address the lack of native audio and video support in existing agent harnesses, we release Qwen-MM-Plugins, a lightweight open-source plugin framework for multimodal productivity. We further frame real-time multimodal interaction as a system-level challenge requiring orchestration of context and memory management, tool use, and sub-agent delegation. Accordingly, we release Qwen-Live-Harness, an open-source framework for building responsive, real-time multimodal agents based on Qwen3.8-Omni-Flash. Extensive evaluations demonstrate that Qwen3.8-Omni-Flash achieves strong performance across multimodal understanding, reasoning, long-horizon agentic execution, and video productivity tasks. These results and the accompanying open-source tools support Qwen3.8-Omni-Flash as a practical foundation for deploying natively multimodal agents in research and production.
2026-09-23 04:00:00 · 大模型,AI应用,阿里巴巴,多模态,Agent智能体,推理思考,扩散模型,MoE架构,强化学习,长上下文,论文
AI 资讯

You Only Need 2/3 of the Chosen Experts: An Empirical Study of Dynamic Expert Pruning in Fine-Grained MoE LLMs

arXiv cs.AIarXiv:2609.25809v1 Announce Type: cross Abstract: Fine-grained mixture-of-experts (MoE) architectures have become a mainstream design for open-weight LLMs, with hundreds of experts and increasingly many selected per token. This shift makes dynamic expert pruning an attractive route to cheaper inference. Yet existing evidence comes largely from coarser architectures and likelihood-scored multiple-choice benchmarks, leaving three central questions open in the fine-grained regime: how redundant per-token expert selection is, how effectively existing pruning methods exploit that redundancy, and what governs a model's sensitivity to pruning. We fill this gap with a systematic empirical study of twelve fine-grained MoE checkpoints spanning nine architecture families, with a core suite of eleven benchmarks covering knowledge QA, mathematics, code generation, and general reasoning. We find that expert selection is far more redundant than the field's operating points assume: uniformly retaining about two thirds of the selected experts preserves 98.8% of unpruned performance on average, requiring only a one-integer change and delivering 1.2-1.7x measured speedup across two serving backends. This simple baseline leaves little room for dynamic allocation at conservative budgets: even the best published rules differ from it by under 1% at matched expert budgets. Their value emerges under aggressive pruning, where the best rules recover up to 3.0% over uniform truncation, with gains concentrated in the generative tasks that suffer the sharpest degradation. Sensitivity to aggressive pruning also depends on the model: larger and thinking models are more resilient, whereas multimodal models are more vulnerable. Together, these findings reveal how much expert computation fine-grained MoEs can dispense with, and establish when dynamic allocation earns its complexity, informing both practical deployment and future pruning methods.
2026-09-23 04:00:00 · 大模型,AI应用,多模态,推理思考,搜索RAG,MoE架构,模型评测,招聘HR,论文
AI 资讯

From Experts to Sub-experts: Fine-grained Parameter-Efficient Fine-Tuning for MoE LLMs

arXiv cs.AIarXiv:2609.25655v1 Announce Type: cross Abstract: As large language models (LLMs) scale rapidly, dense full-parameter adaptation becomes increasingly expensive, motivating sparse and modular architectures such as Mixture-of-Experts (MoE) models. This shift raises a key question for parameter-efficient fine-tuning (PEFT): at what granularity should parameters be selected and updated? Existing PEFT methods such as LoRA operate on predefined weight matrices, while expert-level sparse tuning methods update entire selected experts. However, we observe that activated experts are internally sparse, with only a small fraction of intermediate channels strongly responding to downstream tasks, indicating that expert-level adaptation is still too coarse. We propose NSFT (Neural Sub-expert Fine-Tuning), a fine-grained PEFT framework that refines MoE adaptation from experts to sub-experts. NSFT decomposes each expert along the intermediate dimension into structured channel groups and selects task-relevant sub-experts by combining routing importance with intra-expert activation saliency. To optimize sparse partial updates, NSFT further introduces learning-rate scaling and dynamic gradient scaling to compensate for the reduced effective update magnitude. Experiments on OLMoE and Ling-mini-2.0 across challenging domain-specific tasks and general benchmarks show that NSFT consistently outperforms representative PEFT and expert-level sparse tuning baselines, while using substantially fewer trainable parameters and preserving competitive general capability. These results suggest that sub-expert-level adaptation is a more precise and efficient PEFT paradigm for MoE LLMs.
2026-09-23 04:00:00 · 大模型,MoE架构,微调蒸馏,模型评测,论文,开发者生态

[分享创造] 做了 104 个 DeepSeek 大肥鱼动态表情包

V2EX

源文件: https://github.com/DejavuMoe/deepseek_wale_girl 提供 Telegram 贴纸: https://t.me/addstickers/deepseek_whale_girl 静态图生成:Mimo v2.6 Pro 动态图生成 + 抠图 GPT 6 Sol

2026-09-23T04:30:18Z · 大模型,开源,DeepSeek,MoE架构,招聘HR

Semianalysis硬核拆解:AI回答你一句话,背后发生了什么

华尔街见闻MoE架构将推理拆解为预填充、中间填充、解码注意力与解码专家四个阶段,各阶段硬件需求截然不同。Semianalysis认为内存带宽比内存容量更值钱,堆容量不如提速度。聚合式与分离式架构之争本质是"全能芯片"能否实现的赌注。调度层成为隐形价值洼地,KV缓存分级存储管理将催生新兴存储赛道机会。
· 算力芯片,推理思考,MoE架构
AI 资讯

Improving Parameter Utilization by Sharing Neural Experts Across Layers in Transformers

arXiv cs.LGarXiv:2609.22199v1 Announce Type: new Abstract: Transformer-based large language models often suffer from inter-layer parameter redundancy, where functional transformations are redundantly learned across network depths. We propose CS-MoE, a novel Transformer architecture featuring cross-layer expert sharing to address this inefficiency. Deviating from the widely used Mixture-of-Experts (MoE) architecture that terminates each Transformer block with layer-isolated experts, CS-MoE combines layer-independent experts with concurrent access to a centralized, globally shared expert pool. This \textit{Global Experts Sharing} mechanism enables elastic control over token-level parameter activation and computational consumption (FLOPs). Experiments demonstrate that CS-MoE achieves lower perplexity than equal-scale dense Transformers while activating only 55\% of parameters. Furthermore, its performance scales monotonically with an increased number of activated experts and approaches MoE counterparts that consume more FLOPs by expanding the shared pool with a fixed FLOPs budget. CS-MoE also establishes a flexible Pareto frontier between computational cost and model capacity, offering an efficient alternative for computation-constrained environments.
2026-09-22 04:00:00 · 搜索RAG,Transformer,MoE架构,论文
继续滚动加载更多…