Meta Unveils 3 Smart Glasses With Built-In A.I. - The New York Times
Naegleria amoebae seek confinement and crawl persistently through narrow spaces
SignificanceThe “brain-eating amoeba”Naegleria fowlericauses a devastating brain infection with a ~95% fatality rate, yet how these normally harmless pond-dwellers invade the human brain remains mysterious. Using the model speciesN. gruberi, we show ...
KITE: KV-Invariant Transformer Expansion for Efficient Agentic LLM Scaling
Routing-Aware Expert Calibration for Machine Unlearning in Mixture-of-Experts Language Models
Exact Quantile Balancing and Load-Error Injection for Mixture-of-Experts
深度拆解 MiMo-V2.6:1M 上下文只是表面,2.5 万条轨迹才是底牌
代码、视觉、安全共用一套 RL,奖励机制也被重新设计。 作者丨郑佳美
编辑丨岑 峰
刚刚,小米正式发布并开源 MiMo-V2.6。Pro 拥有 1.02T 总参数、42B 激活参数,Flash 为 309B 总参数、15B 激活参数,两款模型支持 1M token 上下文,并覆盖文本、图像、视频和音频输入。如果只看这些数字,第一反应或许会觉得这又是一次模型规模升级。但这次小米投入更多篇幅讨论的,其实是模型完成预训练之后,能力还能怎样继续往上推。
这也是为什么后训练成了 MiMo-V2.6 的核心部分。小米把代码、通用 Agent、视觉和网络安全任务放进同一套强化学习系统,单次 RL 更新使用 1568 个 prompt,每个 prompt 生成 16 条 rollout。和普通问答不同,Agent 在这些任务里不是生成一段文本就结束,而是要不断读取环境、搜索信息、调用工具、执行操作,再根据返回结果调整下一步行动。训练对象因此不再只是最终答案,而是一整条包含状态、决策和反馈的行为轨迹。雷峰网
当强化学习开始围绕这种长轨迹展开,问题自然也变了。模型不仅要承担更长上下文和持续生成带来的计算开销,还要同时处理大量执行时间完全不同的任务,等轨迹数量真正上来以后,单纯依靠成功或失败这样的奖励,又很难判断两条都完成任务的路径,哪一条更值得模型学习。所以 MiMo-V2.6 后面的架构、异步训练和奖励设计,基本都是从这些实际问题里一步步长出来的。
01
1M 上下文背后
Agent 一旦开始长期停留在环境里,模型面对的计算形态就发生了变化。以软件工程任务为例,模型可能先读取大量代码,随后搜索文件、修改函数、运行测试,再根据 terminal 返回继续行动。早期读取的内容需要留在上下文里,但当前一次决策真正频繁使用的,往往只是正在处理的代码、最近几轮工具结果以及局部状态。MiMo-V2.6-Pro 的注意力结构正好利用了这种特征。70 层 Transformer 中,60 层采用 Sliding Window Attention,窗口只有 128 token,另外 10 层使用 Global Attention。也就是说,绝大多数层只处理附近信息,隔一段距离再由全局层完成长距离通信。
这样设计之后,1M 上下文并不意味着每一层、每一个 token 都要重新和完整上下文进行交互。当前操作需要的局部信息可以高频流动,远处的信息则通过少量全局层重新汇合。对于长时间运行的 Agent,这比把完整注意力铺满整个网络更符合实际工作负载。参数侧采用了类似思路。Pro 虽然拥有 1.02T 总参数,每个 token 实际只激活约 42B 参数,每个 MoE 层有 384 个 routed expert,其中只调用 8 个。模型因此可以维持较大的专家容量,又不需要让每个 token 穿过全部参数。这里的意义放到 RL 阶段会更明显。一次回答多算几个 token,成本差异有限,一次训练里同时生成数万条 rollou
为了智能体AI,高通「新造」了第六代骁龙8超级至尊版

“我们正在从以手机为中心的模式,转向以智能体为中心的新体验。手机、PC、眼镜、可穿戴设备以及汽车,都将成为智能体的终端入口。”2026骁龙峰会上,高通公司总裁兼CEO安蒙说。
过去二十年,智能手机围绕App运转。智能体则需要持续感知、理解上下文、调用工具,并在用户没有操作手机时代表用户执行任务。
“这是一次令人兴奋的技术变革,智能体AI会创造一种全新的终端工作流程。”安蒙表示,“我们需要重新思考计算引擎的设计。CPU需要更强的性能来完成智能体编排,NPU加速器负责高效的AI推理,GPU负责高度并行的计算,连接能力也比以往任何时候都更加重要。”
高通为智能体AI首次同时推出两款2nm制程移动旗舰平台——第六代骁龙8超级至尊版和第六代骁龙8至尊版。

高通技术公司高级副总裁兼手机业务总经理Chris Patrick解释说:“单一标准,已经无法定义旗舰。保持领导力需要不止一条前进道路。”
两款平台共享多项核心技术,第六代骁龙8超级至尊版位于产品组合顶端,拥有高通最顶级的配置,包括业界首个最高主频达到5GHz的移动CPU、GPU中首次加入的Matrix Cores(矩阵核心),以及可以运行300亿参数MoE模型的NPU。

这些升级背后,藏着一个核心问题,智能体全天运行,到底需要怎样的计算平台?高通给出的答案,是从智能体AI需求出发重新设计SoC。
高通到底如何围绕AI,“新造”第六代骁龙8超级至尊版?
智能体撞上「内存墙」,高通给CPU、GPU、NPU同时「动刀」
第六代骁龙8超级至尊版最醒目的数字是5GHz。

但Chris Patrick强调,“速度只是其中一部分,CPU还需要快速访问数据。”
这指向AI难以绕开的内存墙。“端侧智能体的主要问题其实还是内存和续航的限制,而非性能的限制。”高通公司产品技术专家朱元堃对雷峰网表示。
模型推理需要持续读取模型权重、上下文、KV-cache和中间结果。当数据在系统内存与片上存储之间频繁往返,数据搬运所需的时间和电量也会影响实际性能。
内存墙的挑战同时存在于CPU、GPU和NPU,第六代骁龙8超级至尊版如何打破内存墙?
最高主频达到5GHz的Oryon CPU引入全新Oryon FlexCache,让8个核心访问同一个共享L2缓存池,并根据工作负载动态分配资源。智能体处理一连串任务时,数据不必在每次任务交接时都从系统内存重新加载,从而减少任务切换和等待时间。

这也解释了5GHz对智能体的真正价值。CPU不仅要快速完成单个任务,还要缩短整条决策链中每一次调度和交接的等待时间。频率决定计算速度,缓存则决定高频率有多少时间真正用于计算。
Adreno GPU拥有第二代18MB独立高速显存HPM,用于保存渲染瓦片、帧缓冲和中间结果,减少图形管线对系统内存的反复访问,可实现功耗降低12%。

高通Hexagon NPU的共享内存增加50%,让模型状态、上下文和KV-cache更多留在片上,降低外部DDR的访问频率。

第六代骁龙8超级至尊版还采用LPDDR6内存和UFS 5.0闪存。片上空间无法容纳全部模型和长期数据,模型权重可以保存在闪存中,再根据任务加载到内存。
从片上缓存、系统内存到闪存,高通正在从系统维度解决内存墙挑战。但减少数据等待,只解决了智能体计算的一半问题。
什么是为智能体而生的移动计算平台?
智能体需要持续完成“感知—理解—规划—执行”的循环,在模型、应用服务、终端设备与云端资源之间选择路径,无法由单一计算单元完成。
全天运行的智能体,需要系统级协同。

智能体重写手机,高通骁龙换挡“双旗舰平台”
(本文作者为 志读科技,钛媒体经授权发布)

当智能手机的角色从信息终端向个人智能体中枢演进,上游芯片的设计逻辑也在被改写。过去十年,旗舰芯片的竞争围绕主频、制程、跑分等硬参数展开。而在智能体浪潮下,芯片设计的核心目标转向了端侧推理效率、多引擎协同能力、内存带宽瓶颈突破与全场景功耗控制,这对上游厂商的技术架构与产品战略都提出了全新要求。
“我认为我们终于步入了一个可以清晰看见AI智能手机形态的阶段。”高通公司总裁兼CEO安蒙在2026骁龙峰会上明确指出,智能体时代已经到来,推理成为关键,边缘侧将发挥重要作用,而骁龙正是面向智能体时代的处理器。
面向AI Agent时代的新竞争,高通改变了过往了产品策略,正式推出第六代骁龙8至尊版与第六代骁龙8超级至尊版两款旗舰移动平台。值得一提的是,这是高通首次在旗舰产品线采用双平台策略,背后既是对智能体时代终端分化的回应,也标志着骁龙旗舰芯片正式从“性能驱动”迈入“智能体原生”的全新阶段。
智能体时代,手机不会消失
相比较往年,今年的骁龙峰会AI味儿更浓。这点倒不是说全场AI出现的高频率,而是在确定的共识下,整个消费电子终端都在关心高通的落地答案。
过去很短一段时间里,AI领域发生了许多变化,发展速度前所未有,比如混合专家模型(Mixture of Experts)、规划器和全新模型架构的发展,MCP协议开始大规模普及,使智能体能够连接互联网中的各种服务。同时,智能体和各类Skills生态也在不断发展。
谷歌设备高级副总裁Rick Osterloh经历过很多计算技术的变革,但仍直言从来没有哪一次像AI计算变革这样。“目前,用户规模和增长速度迎来了爆发。变化之大令人难以置信,而且我认为这真的只是个开始。”
正是这些技术的共同发展,推动着智能手机向AI智能手机加速演进。峰会的一开始,高通也给出了一组数据:70%的受访者表示对个性化智能体感兴趣,66%的受访者表示对多台以个人智能体为核心打造的设备感兴趣。

在高通看来,智能体时代的到来并非一蹴而就,而是移动AI持续演进的必然结果。过去,AI进入智能手机,是以影像辅助的角色出现,本质上是对单一功能的效率提升。而今天,AI正在从根本上重塑智能手机的使用方式,正式迈入智能体的全新阶段。
这一阶段的核心范式转变,是体验的中心从手机转向智能体,交互的起点从App转向意图。安蒙指出,“我们正在从以App和助手为中心的时代,迈向智能体时代。未来体验的核心将不再只是手机,而是智能体,这也将改变智能手机在整个系统中的角色。”
值得一提的是,早在3年前,消费电子市场就在期待新的超级终端的诞生,但事实证明,手机的地位非常稳固。伴随着智能体时代的到来,安蒙也是再一次强调了智能手机不会被取代。
在他看来,手机不仅不会消失,反而会成为智能体时代的控制中枢。核心原因在于,智能手机是最贴近用户的个人终端:它全天候伴随用户,经过深度个性化定制,积累了最完整的用户使用习惯与情境数据。这些数据是智能体实现个性化体验的基础,而手机天然承担了情境汇集、体验融合的枢纽角色。
在交流中,高通高级副总裁兼手机业务总经理Chris Patrick同时指出,随身、情境感知、连接,这些是智能体AI的基础,而智能手机是唯一能够以如此大规模将这三个要素融为一体的终端。

只不过,过去二十多年的智能手机体验几乎一直围绕着App展开。而在智能体时代,体验的起点不再是App,而是意图本身。
移动芯片的新命题,高通用双旗舰回答
要让智能体从概念走向真正可用的体验,行业有着统一的价值标尺。
第一是可信,智能体代表用户行动,必须保障安全、保护隐私,且让用户始终掌握控制权;第二是毫不费力,智能体必须比用户手动操作更简单、更高效,否则就失去了存在的意义;第三是个性化与主动性,智能体需要理解用户所处的情境,主动提供服务而非打扰用户,在需要的时刻及时响应,并且能够跨不同终端持续运转。
这一切体验的落地,都对底层硬件体系提出了颠覆性的要求,需要重新思考如何设计计算引擎。智能体工作流具备多任务并发、异构核心频繁调度、模型参数量大、对内存带宽高度敏感的特点,它要求芯片从底层架构层面实现计算、内存、传感与连接的全系统协同。
这也正是高通新一代旗舰芯片的出发点:不再追求单点参数的极致,而是围绕智能体的真实工作流,做全链路的系统性优化。“单一标准,已经无法定义旗舰,保持领导力需要不止一条前进道路。”安蒙说道,因此今天,高通推出两款骁龙8至尊版平台。

其中,第六代骁龙8超级至尊版移动平台搭载全新Qualcomm® Oryon™ CPU、下一代Qualcomm® Adreno™ GPU和重新设计的Qualcomm® Hexagon™ NPU,并配备LPDDR6内存与高速存储通道。
定制Qualcomm Oryon CPU峰值频率高达5GHz,并引入全新的可扩展缓存架构Qualcomm Oryon FlexCache,实现更加强大的智能体多任务处理和系统规划能力;Adreno GPU引入针对AI负载打造的Adreno Matrix Cores,并支持全新Adreno Neural Fusion特性,将AI和图形处理更加紧密结合。
Hexagon NPU则面向智能体AI的Transformer工作负载引入全新的Element Accelerator,并将大容量共享内存扩容50%,实现端侧推理性能的进一步突破,可支持300亿参数级别的MoE混合专家模型。
在会后的交流中,谈及5GHz的高频,高通技术公司执行副总裁兼技术规划、边缘解决方案和数据中心业务总经理马德嘉表示,这是基于当前智能体AI任务特点而决定的,Agent AI工作负载必须确保编排过程非常快速地完成,这样的设计是为了满足Agent AI在设备和数据中心对CPU算力日益增长的需求。

第六代骁龙8至尊版同样采用2纳米制程工艺,搭载定制的Qualcomm Oryon™ CPU、全新架构的高通® Adreno™ GPU和高通® Hexagon™ NPU。谈及二者之间的差异,Chris Patrick表示,主要还是在封装上面。至尊版采用传统封装堆叠(PoP)方案,超级至尊版采用Offset PoP封装方案,可以更好的优化散热能力,带来更持久的峰值性能。
“随着智能体AI时代持续演进,我们的多旗舰策略有助于扩展移动体验的边界,同时将最新的AI创新技术引入更广泛的旗舰终端中。通过打造两款创新的平台,我们为OEM厂商提供更丰富的选择,并共同塑造下一代智能、个性化移动体验的能力上限。”
长跑才刚开始
在高通的战略路线中,智能体将成为体验的中心,用户的手机、PC、眼镜、可穿戴设备、以及汽车,都将成为智能体的终端入口。
除了手机旗舰新品,高通还推出了第二代骁龙音频平台至尊版,与前代平台相比,AI能力提升高达2倍,并支持多种智能体验同时运行,平台功耗降低高达40%、平台尺寸缩小达30%。

“AI要为你服务,并与你息息相关,否则你根本不会使用它。如果AI与你的需求和情境不相关,你就会选择自己完成这些事情。”安蒙说道。
只是,尽管智能体时代的技术蓝图已经清晰,但落地之路仍面临多重挑战。
从行业环境看,全球智能手机大盘增长趋缓,无形中成了智能体手机的阻碍;从技术落地看,端侧大模型的内存与功耗瓶颈仍存,智能体应用生态碎片化,消费者对AI 手机的感知仍停留在概念层面;从商业层面看,前沿技术的研发与制造成本高企,如何在高端突破的同时实现技术下沉,覆盖更广泛的用户群体,也是全行业的共同课题。
当然,高通也认识到了这一点,个人计算的未来不是某个终端决定的,规模化有挑战,公司首席营销官莫珂东直言,“没有任何一家公司能够独自构建这样的未来。当企业各展所长,并在打造人们信赖且愿意使用的体验方面达成共识时,创新自然水到渠成。”
为此,在峰会现场,你会看到舞台上不单是高通的技术宣讲,还有合作伙伴的落地成果展示。从小米、荣耀到努比亚再到千问,中国公司几乎成了端侧智能体落地的航向标。与此同时,小米和摩托罗拉还来到现场站台。

其中,小米集团高级副总裁曾学忠宣布,小米将全球首发第六代骁龙8超级至尊版和第六代骁龙8至尊版处理器,并现场展示了小米18 Pro系列真机,将于年内登陆全球市场。目前,搭载这两款旗舰芯的手机也已经在国内发布。

摩托罗拉移动业务首次向全球展示最新一代AI旗舰智能手机产品,搭载骁龙8 Elite Extreme Gen 6移动平台,围绕端侧AI体验、移动影像品质和性能稳定性等方面进行了升级,并首次引入Bang & Olufsen音频技术,预计于2026年在全球市场上市。
从技术路演,到与合作伙伴一同定义未来,智能体时代的大幕才刚刚拉开,下一个落子也并非由一方独自打造。而唯一可以确定的一点是,移动芯片的竞争已经从参数比拼进入体验定义的新阶段。
高通此次的双旗舰布局,既是对当下行业变革的回应,也是对未来十年移动计算的押注。对于消费者来说,真正的AI手机或许还在路上,但底层的技术基石,已经在这一代芯片中悄然成型。(本文首发于钛媒体APP,文 | 志读科技,作者 | 杜志强,编辑 | 杨林)
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
2026 骁龙峰会高通高管群访:双旗舰策略、行业首超 5GHz、和小米合作关系、AI 手机未来...
IT之家 9 月 24 日消息,夏威夷时间 9 月 22 日 9 点(北京时间 9 月 23 日 3 点)召开的 2026 骁龙峰会主题演讲结束后,高通公司高级副总裁兼手机业务总经理克里斯 · 帕特里克(Chris Patrick)在内的诸多高通高管接受了IT之家等媒体采访。

在本次媒体群访中,出席的高通高管有以下几位:
高通技术公司高级副总裁兼手机业务总经理 Chris Patrick
高通技术公司产品管理副总裁 Judd Heape
高通技术公司产品管理副总裁 Vinesh Sukumar
高通技术公司产品管理总监 Amandeep Dhaliwa
高通技术公司 CPU 产品管理高级总监 Manju Varma
高通技术公司高级副总裁兼旗舰移动平台总经理 Dino Bekis
问:第一个问题,第六代骁龙 8 至尊版和超级至尊版的 GPU,在硬件上有什么具体区别?能详细讲讲吗?另外,频率是否一致?第二个问题,这一代 8 Elite 有两款,还会有非 Elite 的第六代骁龙 8 吗?还是以后都会走双 Elite 路线?是否依旧会有非 Elite 的 8 系列?
答:
今年,我们首次对骁龙 8 至尊版产品组合进行了进一步细分,推出两个不同的 SKU,也就是两款骁龙 8 至尊版平台。
其中,定位更高的第六代骁龙 8 超级至尊版,重点引入了一系列新兴能力。例如,它支持 VVC 编解码技术,稍后还会进一步谈到。它还支持 LPDDR6。
此外,第六代骁龙 8 超级至尊版还支持更多 AI 能力。并且采用了一种全新的、针对散热进行优化的 Offset PoP 封装,这也是第六代骁龙 8 超级至尊版所独有的。
我们的初衷,是先打造一款出色的平台,作为第五代骁龙 8 至尊版真正的继任者,也就是第六代骁龙 8 至尊版。
在此基础上,我们打造了第六代骁龙 8 超级至尊版,通过加入更多全新的前沿能力,以全新方式引领行业发展。
从影像角度,我简单介绍一下第六代骁龙 8 至尊版和第六代骁龙 8 超级至尊版之间的区别。只有超级至尊版支持用于专业视频拍摄的 APV 专业视频编解码器;同时,8K 60fps 视频拍摄和 4K 240fps 超级慢动作视频拍摄也只有超级至尊版支持。
正如 Chris 提到的,也只有超级至尊版支持 VVC 解码。除此之外,两款平台在影像方面的能力基本相同。
刚才还有一个关于频率的问题。实际上,这两款平台的共同点多于差异。比如,两者采用相同的 CPU 架构、实现方式和频率;两者也采用相同的 GPU 架构和实现方式,仅在部分规格上有所差异。
接下来的问题是,第六代骁龙 8 系未来是否还会推出非至尊版的产品,我们始终会从整个行业发展和需求出发,评估需要重点投入哪些产品层级,以及哪些产品层级能够带来最大的影响,希望大家可以持续关注。
问:我有两个问题。第一个问题是,第六代骁龙 8 超级至尊版的 CPU 主频首次达到 5GHz。不过,目前许多 AI 工作负载对时延的敏感度正在降低,对吞吐量则更为敏感。您认为 CPU 时延目前仍是主要瓶颈吗?哪些具体用例能够真正受益于 5GHz 的 CPU 主频?第二个问题是,安蒙今天上午提到了 HBC 没有展开介绍。我们是否可以将其理解为一种近存计算架构,类似于英伟达 GPU 所采用的 HBM 理念?
答:
好的,我先回答第一个关于 CPU 的问题。我们的 Qualcomm Oryon CPU 是首个最高主频达到 5GHz 的移动 CPU。
不过,在设计 CPU 时,我们关注的不只是时钟频率,还包括 CPU 在实际工作负载下的 IPC 表现。我们的缓存层级设计也着重提升实际工作负载下的响应速度。
因此,在设计 CPU 时,我们也充分考虑了智能体 AI 工作负载的需求。时钟频率是提升响应速度的关键因素之一,因为智能体 AI 工作负载需要快速完成任务规划,同时还要确保任务能够在 CPU、NPU 和 GPU 之间高效切换与协同。
我们的 CPU 正是基于这些需求进行设计,以更好地应对如今的智能体 AI 工作负载。
第二个问题是关于 HBC。我们介绍了这个产品概念,但目前还没有具体的产品发布。正如你所说,如果能扩大处理器可用的带宽,我们就有机会在边缘侧 AI 上实现一些非常重要的突破。
因为,许多 AI 工作负载都受限于带宽和数据传输。因此,目前分享的概念是:如果能够让内存与处理器进行协同设计,就可能为 AI 带来一些非常特别的能力。但现阶段仍只是一个概念,更多细节将于后续公布。
再补充一点。我们与生态合作伙伴以及全球多个地区的前沿 AI 实验室保持着良好合作,他们一直在向我们提出新的挑战,例如如何进一步降低端到端时延,以及如何更好地支持多模态上下文生成。
面对这些越来越复杂的需求,关键在于如何跳出既有思路,在边缘侧解决这些挑战。目前 HBC 还只是一个概念方向。我们只是提前分享了一些思考。而正如 Cristiano 提到的,预计到 MWC,大家还会看到更多消息。

问:我想问一个关于旗舰级 SoC 竞争态势的问题。今年整个旗舰级 SoC 的进步都非常大,尤其是你们最关键的竞争对手。目前双方产品的差异化主要体现在哪里?对于消费者体验更关键的因素,高通在哪些方面更占优势?
答:
对于友商的产品我们不便进行评论。我们对自己在高通所做的工作感到自豪。我认为,高通在研发深度以及内部自主设计的技术数量方面,在行业中具有独特性。
我们拥有定制的 CPU,针对消费者需要的应用和使用场景打造;我们的 GPU 技术也是自主设计的,完全定制。AI 技术同样基于数十年的研发和积淀。
例如,今天我们介绍了 Adreno Neural Fusion 架构和系统,这里面的各个组件经过协同设计,最终实现了出色的游戏画质、保真度、分辨率和帧率,同时借助 AI 能力与图形管线的融合,在低功耗下实现这些效果。这种能力只有在各项技术协同设计的前提下才能实现,而这正是高通的核心优势。
问:我这边会有一个问题是关于小米与高通关系。我们都知道,小米自己也有在研发自己的芯片,那同时它的旗舰产品也有在用高通的芯片。那我们会想知道,小米玄戒 O3 的进步,会不会影响到它与高通之间的关系?现在小米与高通的关系是类似于是竞争呢,还是说双方之间会分享一些芯片开发中的经验?
答:
高通与小米之间保持着紧密的合作关系,我们的合作覆盖多个产品领域,包括平板、手机和汽车等,并且还在持续深化。客户拥有自研 SoC 的情况并不罕见。
回顾高通的发展历史,很多与我们合作的公司同时也拥有自己的自研 SoC。这更多是出于技术战略和技术能力展示的考虑,同时也希望针对一部分特定应用进行更深度的定制。
总体而言,我们非常高兴能够与小米保持深度合作,也很高兴今天能够与小米同台;对于未来的合作,我们同样期待。

问:今天这一代的超级至尊版,它堆叠了很多技术,但我们也了解,它其实推高了整个晶圆的成本。那我想知道的就是说在这个整个手机市场大盘比较趋缓的时候,你怎么去游说你的这些利润变薄的手机厂商去采购这个高溢价的 AI 芯片,这是第一个问题。
答:
如果看任何一家 OEM 厂商的产品组合,通常都会有标准版、Pro 和 Ultra ;在整个产品线中,不同机型对应不同价位,也具备不同的性能配置。
以影像为例。定位最高的机型通常会配备极其精密的变焦和高分辨率镜头,以及协同工作的多传感器阵列。
而在入门级或标准机型上,厂商可能会更侧重于打造差异化的用户体验。毕竟,手机产品本身就涵盖非常丰富的层级。
例如,有的客户希望终端针对 4K 30 帧进行优化,按相应方式控制成本;另一些客户则愿意增加投入,支持 4K 60 帧,获得完整的最高规格能力。
我们提供多个层级,就是为了支持 OEM 定制产品能力和成本结构,匹配自身需求,从而为终端用户带来真正有价值的体验。
问:今天上午的演讲可以看到,无论是 CPU、GPU 还是 NPU,都有了更大的内存。系统级内存是不是也同时增大了?有了更强的 CPU、GPU 和 NPU 的 AI 性能之后,如何从系统层面把它们更好地协同起来,让整个 SoC 的性能更好?这包括硬件之间的调度,以及软件层面的工作。
答:
正如之前提到的,手机 AI 经历了从感知、生成式到智能体 AI 工作负载的演进。而智能体 AI 工作负载本身,也在发生从基于指令的模型到基于推理的模型的转变。
当转向基于推理的模型后,模型本身的规模本身非常大,比较典型的就是混合专家(MoE)模型。
MoE 模型的计算开销较高,需要把激活值保存在本地。如果把它们放在 SDRAM 中,再从 SDRAM 搬运到本地计算资源,会导致功耗提升。
正因如此,我们显著增加了与 Hexagon NPU 紧密耦合的 SRAM 本地内存容量,以支持更高的激活值存储,并暂存这些数学运算过程中的中间数据。
关于第二个问题,按我的理解,在设计这类系统时,我们始终会从端到端的软件赋能去考量,寻找提升服务质量、提升效率,并支持更大规模的模型的机会。
基于这个思路,我们对内存模块做了分区设计;软件层面也会做适配,以此实现最优的每瓦性能(或者说每焦耳输出的词元数),在 HDP 上尤其如此。
我就 GPU 这部分再补充一点。大家应该还记得,此前我们引入了 Adreno 独立高速显存(HPM),今年,我们又在 GPU 中加入了 Matrix Cores。
对于神经网络渲染、超级分辨率、帧生成这类先进工作负载,渲染管线必须与 GPU 紧密结合,因此内存就成为其中的关键一环。
以 Adreno Neural Fusion 为例,它是一个多卷积模型,卷积运算的输出会存储在 HPM 中,完全无需访问 DDR,从而在游戏过程中进一步提升能效。
所以,回到 Vinesh 刚才谈到的内容:从内存的角度看,一方面是平台层面的整体考量,另一方面是面向具体用例的优化,HPM 就是这类针对用例优化的好例子。
问:今天骁龙发布的全新平台在底层架构上实现了诸多创新,为终端厂商和软件生态提供了强大的底层能力。请问高通在生态方面会增加哪些投入?在软件栈方面是否会提供更多工具?针对中国市场,在模型和应用开发者支持方面又会有哪些投入?
答:
举个例子,借助 Matrix Cores,开发者可以通过 llama.cpp 这类标准框架来调用它们,运行常规的 AI 工作负载;此外还有通过 Vulkan 提供的扩展,开发者也可以借此进行调用。
另外,在性能分析工具方面,我们也在持续增强 Snapdragon Profiler 的相关能力。因此从工具的角度看,开发者可以使用 Snapdragon Profiler,查看开启与未开启 Adreno Neural Fusion 时不同的渲染帧,并在此基础上开展大量的工作与开发。
我也从 AI 的角度补充几点。在 AI 领域,我们与中国合作伙伴的关系逐年深化。起初,我们与大多数独立软件供应商(ISV)建立了深度合作;在此基础上,我们也开始与阿里等这些前沿的 AI 实验室紧密协作。
我们与他们保持合作,能够较早接触到 Qwen 3、Qwen 3.5 和 Qwen 3.8 等模型,并努力推动这些模型在高通芯片上实现完整的 Day 0 支持,尤其是在阿里生态相关模型方面。
同样,随着向智能体工作流演进,我们也需要支持 MoE 模型。Chris 今天在交流中提到了那个推理演示。
我们与一家中国生态合作伙伴建立了非常紧密的合作,对方得以展示自身的能力,我们也很快完成了集成。
这样的合作也在随着时间不断扩展。而且,合作对象已不只是传统的 ISV。我们此前聚焦于检测、分类和分割,这些固然很重要,但我们也开始与一批伙伴展开合作,他们高度专注于智能体方向,以及用生成式 AI 生成合成数据。
最后同样重要的一点是,我们也在扩展工具和性能分析子系统,让许多生态合作伙伴能够独立开展工作,自行查找瓶颈所在,尤其是在带宽优化和算力优化方面。
这方面的能力同样通过高通 AI 软件栈得到了增强,所有人都完全可以使用,通过高通开发者网站下载即可。
我再补充一点。在考虑开发者、考虑如何让这个平台的能力真正被调动起来时,我们主要从两个方面来看。
一方面,我们希望确保平台确实是为终端用户和那些将为平台增值的人而设计的。举个例子,刚才有一个问题问到,我们如何协调 CPU、GPU 和 NPU 之间的工作。答案其实是, 我们之所以有多个 AI 引擎,一定程度上正是因为存在多个不同的开发者生态。
比如,以游戏为核心的开发者,希望 AI 能力内嵌在 GPU 之中;一些基于 CPU 的开发者,希望 AI 与 CPU 深度绑定;还有一些开发者,希望使用大规模、高性能的中央 NPU 能力。因此,面向这些不同的开发者,我们尽可能让各类软件生态都能便捷地使用我们的平台。
另一方面,无论在中国还是在全球,我们都开展了非常活跃的合作伙伴项目,与关键技术厂商合作,把他们的技术引入我们的平台,并提供给 OEM 厂商使用。影像技术尤其如此,在这一领域,我们与整个生态建立了非常深入的合作。
我认为在任何技术生态系统中,影像领域的 ISV(独立软件开发商)合作关系可能是最丰富的,尤其是在中国。
我们已经加大了相关支持力度,不仅帮助 OEM 厂商,也帮助当地的 ISV,而且成效已经显现。如果大家今天晚些时候或者本周去演示区看看,就会看到大量来自中国的 ISV 和合作伙伴带来的影像和视频方面的技术演示。
问:大家好,我有两个问题,过去的计算产业的价值是围绕着设备和芯片分布的,但是现在 Agent 成为计算主体了,计算也开始围绕着 Agent 动态的调整分布式的计算资源。那我的问题是,您觉得未来的异构计算还是应该以 SoC 为边界吗,还是说这种 agentic 的方式会催生出一种新的算法和计算架构或者去改变我们现在理解的一种计算形式?
答:
本质上来说,你是对的 —— 智能体可能确实属于更上层的架构,不管是从行业标准层面看,还是从 OEM 厂商层面看。但在我看来,SoC 之所以仍然是整个解决方案的核心,有一个非常突出的原因:我们必须解决一系列非常基础的问题。
比如,计算到底在哪里运行?如何路由选中模型?传感器中枢如何协同所有这些不同的传感器输入?内存和情景信息如何管理?功耗如何优化?如何实现安全的跨设备通信?以及最终如何决策 —— 哪些数据留在端侧处理,哪些需要上传到云端?所以我认为,在智能体时代,SoC 的价值和重要性,它的架构, 我们做出的这些选择反而变得更加关键了。
问:第二个问题就是,我们今天已经可以在端侧上跑很大的后端模型了,然后也有了 Agent,也有了持续性理解用户的能力。那为什么现在我们理想中的 AI phone 还没有出现?你觉得当前的一些技术瓶颈在哪里?然后到了 2026 年,你觉得像 AI phone 这样的形态产品应该真正向消费者传递的一些核心的变化和体验应该是什么?谢谢。
答:
我认为,当我们讨论 AI 手机时,核心问题始终是:你到底想解决什么样的问题?你是想解决某个特定的时延挑战?还是想确保有一组合适的模型能够部署在边缘侧,从而真正带来你所期望的体验?
我认为,过去几个月 —— 或者说过去一年 —— 小模型领域取得了巨大进步。我们已经从 30 亿参数的稠密模型,发展到能够支持 300 亿参数级的 MoE 模型。
在此之前,并没有成熟的技术能够支持这类 MoE 模型在终端侧运行,而现在我们已经具备了这样的能力。
智能体体验还需要一类能够快速判断、即时响应并采取行动的模型。这类能力在过去是不具备的。
所以我认为,纵观模型能力的演进、系统概念能力的演进、算法的演进,现在我们已经拥有了大量的基础构建模块。我相信我们的大多数生态合作伙伴将会利用这些基础能力,催生出大量创新应用 —— 而这在过去是无法实现的。
此前行业虽然大力推动,但最终落地效果并不理想。我期待随着高通在生态系统中赋能这些重大创新,未来我们将看到更多智能体形态涌现。
Unlocking Cross-Scenario Physical Layer Security: A Mixture-of-Experts Framework with Generative Diffusion Models
MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training
TopoCompress: Topology Aware Token Compression Algorithm for Distributed Edge MoE Inference
Combining Hierarchical Cognitive Process with Process Supervision for Interpretable Scene Safety Understanding
HySparse2: Hybrid Sparse Attention with Two-Level KV Sharing
Qwen3.8-Omni: Towards Native Omni-Modal Agents
You Only Need 2/3 of the Chosen Experts: An Empirical Study of Dynamic Expert Pruning in Fine-Grained MoE LLMs
From Experts to Sub-experts: Fine-grained Parameter-Efficient Fine-Tuning for MoE LLMs
[分享创造] 做了 104 个 DeepSeek 大肥鱼动态表情包
源文件: https://github.com/DejavuMoe/deepseek_wale_girl 提供 Telegram 贴纸: https://t.me/addstickers/deepseek_whale_girl 静态图生成:Mimo v2.6 Pro 动态图生成 + 抠图 GPT 6 Sol
Semianalysis硬核拆解:AI回答你一句话,背后发生了什么