🤖 AI 资讯

每日 05:00 更新 · 09-23 · 主站 liuch.name ↗
全部标签 →
筛选标签:世界模型 · 返回个性化推荐 · 清空筛选
AI 资讯

Lifelong Learning of Video Diffusion Models From a Single Video Stream

arXiv cs.LGarXiv:2406.04814v4 Announce Type: replace-cross Abstract: Video diffusion models can enable embodied agents to anticipate plausible futures from the recent past, but they are typically trained offline on curated datasets--a mismatch with the agents' learning setup at deployment: online, from a single video stream that sequentially outputs one frame at a time. We bridge this training gap and demonstrate that training autoregressive video diffusion models from such a stream, resembling the experience of embodied agents, is not only possible but can also perform comparably to standard offline training given the same number of gradient steps. We find that this robustness to video stream autocorrelation and nonstationarity can be achieved using experience replay methods that retain a subset of the video stream. To support training and evaluation in this setting, we introduce five new datasets for streaming lifelong generative video modeling: Lifelong Bouncing Balls (O), Lifelong Bouncing Balls (C), Lifelong 3D Maze, Lifelong Drive, and Lifelong PLAICraft, each consisting of one million consecutive frames from environments of increasing complexity. Together, our datasets and experiments lay the groundwork for video generative models and world models that continuously learn from single-sensor video streams rather than fixed datasets.
2026-09-23 04:00:00 · 算力芯片,AI应用,具身智能,Google,Agent智能体,扩散模型,强化学习,世界模型,论文
AI 资讯

Orthogonal JEPA: Factorized Predictive States for Latent World Models

arXiv cs.LGarXiv:2608.20065v2 Announce Type: replace Abstract: World models construct latent states that support prediction, planning, and reasoning about an underlying system. Joint-embedding predictive architectures (JEPAs) offer a direct way to learn such states by predicting targets in representation space instead of reconstructing every detail of the observation. Standard JEPAs, however, organize all predictable content through one target embedding and one prediction pathway. In complex systems, this monolithic state can allocate redundant capacity to dominant signals while providing weak or conflicting gradients to less dominant predictive structure. We introduce \method, a latent world-modeling framework based on orthogonal predictive factorization. Learned basis matrices analyze each target state into multiple components, and a dedicated prediction branch estimates each component from a shared context representation. Predictive regression preserves the factor magnitudes required for state synthesis, an orthogonality objective discourages repeated directions, factor-activity regularization maintains variation in projected targets, and online variance regularization discourages coordinate-wise encoder collapse. Predicted components are synthesized into a complete latent state that can be used by a readout, decoder, planner, or autoregressive rollout. The same predictive-state mechanism applies when the target is temporally future, spatially hidden, or another partial observation of the same system. Experiments on controlled vision, single-cell transcriptomics, longitudinal health records, continuous control, and molecular dynamics evaluate representation quality, forecasting, planning, and long-horizon stability.
2026-09-23 04:00:00 · AI应用,推理思考,搜索RAG,强化学习,世界模型,向量数据库,招聘HR,论文
AI 资讯

Bridging the Data Gap: Digital Twin as a New Paradigm for AI-based Radio Sensing

arXiv cs.LGarXiv:2609.26214v1 Announce Type: new Abstract: We present a methodology that places a 3D digital twin (DT) of the environment as the main enabler behind the development of radio sensing at scale. The DT acts as a world model, providing geometry, materials, and transmitter/receiver placements to a ray-tracing engine that generates time-indexed channel impulse responses (CIRs) for large numbers of plausible scenes (moving people and objects, layout variants, seasonal/weather conditions, etc). From these synthetic sequences, we train a sequential neural network that maps CIR time series to spatial occupancy estimates, enabling device-free localization (DFL) without instrumented targets. We posit that sensing is best approached as an environment-conditioned learning problem: rather than seeking a single global model, we advocate training or fine-tuning local models specialized to a site-specific DT. As a first experiment, we introduce a novel State Space Model architecture, trained and evaluated across multiple room geometries. The localization performances obtained demonstrate the potential of the approach.
2026-09-23 04:00:00 · 扩散模型,微调蒸馏,世界模型,论文
AI 资讯

Simulate to Generalize: Scaling Stateful Supervision for API-calling Agents using LLM World Models

arXiv cs.AIarXiv:2607.16900v3 Announce Type: replace Abstract: Training agents that generalize to unseen, stateful environments requires a massive dataset of state-changing trajectories covering a vast and diverse set of APIs. However, scaling this broad supervision is severely bottlenecked by the immense effort required to implement and populate fully-executable environments across a broad spectrum of domains. To bypass this barrier, we introduce a data generation pipeline that decouples data synthesis from environment construction by leveraging LLMs as digital world models. Starting from only a list of broad domain names, our automated pipeline synthesizes diverse APIs and tasks. To produce trajectories, a teacher agent iteratively solves these tasks while an LLM simulator dynamically tracks state and provides coherent API responses on-the-fly. Finally, an automated judge filters the trajectories for quality. Fine-tuning on our broad synthetic dataset yields significant performance gains on AppWorld and OfficeBench, two challenging stateful benchmarks featuring environments completely unseen during training. These results establish our LLM world model-based synthesis approach as a highly scalable path for training generalizable, stateful API-calling agents.
2026-09-23 04:00:00 · 大模型,AI应用,Agent智能体,搜索RAG,微调蒸馏,模型评测,世界模型,论文,开发者生态
AI 资讯

QuantWM: Temporally Consistent 2-Bit KV Cache Quantization for World Models and Video Generation

arXiv cs.AIarXiv:2609.26425v1 Announce Type: cross Abstract: KV cache memory has become a major deployment bottleneck for video generation and world models, which motivates low-bit quantization study for efficiency. Existing 2-bit KV cache quantization methods can achieve nearly lossless performance on video benchmarks such as VBench, however, we find that they still cause severe temporal flickering and visual degradation. Meanwhile, deeper investigates show that Key quantization produces smaller reconstruction errors than Value, but surprisingly leads to much larger output degradation. We trace this discrepancy to attention: small Key perturbations can change the attention logits, i.e., QK^\top, and shift the temporal-spatial tokens selected by Queries. These observations motivate us to explicitly preserve attention logits and temporal-spatial token selection during KV cache quantization to alleviate the visual degradation problem. To address this issue, we present QuantWM, a training-free and strictly causal 2-bit KV cache quantization framework. QuantWM introduces two complementary techniques to mitigate the attention shifts. Firstly, quantization-sensitivity-aware clustering (QSAC) jointly considers historical Query sensitivity and residual ranges to select INT2-friendly Key centroids, which reduces quantization errors in channels that are more critical to attention. In addition, principal-subspace attention compensation (PSAC) restores the remaining Key errors along the dominant Query subspace using low-rank projections, which provides a direct and efficient correction to stabilize attention logits. Extensive experiments on Causal-Forcing, LingBot-World-v2, HY-World 1.5, Matrix-Game-2 and Longcat-Video demonstrate that QuantWM significantly improves visual quality and temporal consistency, while outperforming existing methods across image and video quality metrics with up to 6.20x KV cache memory compression and limited additional overhead.
2026-09-23 04:00:00 · 算力芯片,Google,Transformer,扩散模型,微调蒸馏,模型评测,世界模型,榜单评测,论文
AI 资讯

TriWorldBench: A Tri-View Consistency Perspective on Embodied World Models

arXiv cs.AIarXiv:2609.26314v1 Announce Type: cross Abstract: Embodied world models predict the outcomes of robot actions to support learning and planning. For robots equipped with head and wrist cameras, this requires complementary views: the head view captures the overall task, while wrist views reveal local gripper-object interactions. However, evaluating these views independently cannot determine whether they describe the same action and object state. We introduce TRIWORLDBENCH, a benchmark for evaluating embodied world models through synchronized head, left-wrist, and right-wrist videos. It contains 500 episodes across 50 bimanual manipulation tasks and uses 19 metrics to assess tri-view consistency, task alignment, physical and 3D coherence, motion quality, temporal consistency, and visual quality. By combining cross-view checks with measurements tailored to each camera, the benchmark evaluates whether plausible individual videos also form a consistent prediction of the intended task. We summarize overall performance with TWB-Score and retain per-view results to identify where predictions fail. This extends world-model evaluation beyond single-view visual quality. Code, data, and metric definitions are available at https://github.com/TriWorldBench/TriWorldBench.
2026-09-23 04:00:00 · 具身智能,开源,强化学习,模型评测,世界模型,模型安全对齐,招聘HR,论文
AI 资讯

Skytopia: Monocular Drone Navigation with Action-Conditioned Latent World Models

arXiv cs.AIarXiv:2609.26007v1 Announce Type: cross Abstract: Monocular drone navigation requires reaching a goal in an unseen environment from a single forward-facing camera, which offers few cues for depth and scale. World models address this by modelling how observations evolve under actions, but they are built to be executed: the prediction is produced at deployment and fed back into action generation at every control step. We argue that what a policy needs from a world model is not the prediction but the representation required to produce it: in flight the executed action explains almost all of the change between observations, so prediction reduces to reprojecting a static scene under a known displacement. We therefore introduce skytopia, a policy built on an action-conditioned latent world model, and the 3D Gaussian Splatting platform on which it is trained. A forward objective predicts the representation of the next observation from the intended motion, and an inverse objective recovers that motion from the predicted transition. Because the prediction never reaches action generation, the predictor is discarded and one policy serves point-goal, image-goal, and goal-free navigation. Simulation experiments show that skytopia outperforms every baseline under all three specifications, attaining 57.8%, 66.0%, and 49.0% success rate, while discarding the predictor removes 59.4% of the inference cost. The same policy is subsequently deployed on a physical drone without fine-tuning and reaches goals in indoor, open outdoor, and woodland environments.
2026-09-23 04:00:00 · 扩散模型,微调蒸馏,世界模型,招聘HR,榜单评测,论文
AI 资讯

Dual-Frontier: When Can an Agent Trust Its World Model?

arXiv cs.AIarXiv:2609.26293v1 Announce Type: new Abstract: Learned world models are becoming essential to general-purpose agents: by predicting action consequences, they support planning and decision-making while reducing reliance on costly trial and error. This reliance creates a fundamental ambiguity: when a world-model-guided decision fails, the trajectory alone may not reveal whether the agent's decision rule or the world model caused the loss. We formalize this failure-attribution problem as a counterfactual decomposition of return loss and prove that its components are not identifiable from passive interaction, even for finite-horizon planners. This obstruction motivates Dual-Frontier, a learning principle that admits a world-model-guided decision only when its predicted advantage exceeds a certified bound on decision-relevant world-model error; otherwise, evidence is allocated to world-model verification. Action-conditioned value bounds and a closed-loop extension guarantee non-decreasing return for admitted decisions. Calibrated gates and simultaneous confidence sequences support adaptive evidence reuse, with sufficient and necessary verification bounds. Controlled learned-model experiments validate the predicted failure modes and certification behavior, while cross-backbone tool-use benchmarks instantiate the same verify-then-promote rule in realistic agent world-model pipelines, consistently improving decision quality and reliability.
2026-09-23 04:00:00 · AI应用,Agent智能体,扩散模型,强化学习,模型评测,世界模型,论文

At AI Day Singapore, NVIDIA and Partners Showcase AI Advancements Across Southeast Asia

NVIDIA Blog

NVIDIA AI Day Singapore, which takes place Sept. 22-23 at the Raffles City Convention Centre, is offering attendees opportunities to explore the hands-on training, expert-led sessions and advanced tools to accelerate their work in AI and high-performance computing.

At the event, NVIDIA and its partners are showcasing breakthrough AI advancements across the Southeast Asia region at large.

Read more about these announcements below.


NVIDIA Accelerates Public Sector AI from Pilot to Production in Southeast Asia 🔗

AI is becoming a matter of national strategy, with governments looking to move from pilots to production and deliver impact at scale, while building trusted AI capabilities that reflect local languages, cultures, priorities and economic needs. 

NVIDIA is working to enable all nations to be AI nations — providing the technology, infrastructure, ecosystem and expertise needed to make this possible.

To accelerate this transition across Southeast Asia, NVIDIA is helping nations move AI from experimentation to production-scale deployment through open models, developer tools and a broad partner ecosystem. 

Together, NVIDIA and its partners are focusing on four key areas: 

  • Enhancing government operations and service delivery.
  • Developing accessible AI-powered citizen services, and empowering local businesses.
  • Strengthening critical infrastructure and public safety.
  • Supporting startups, developers and researchers to strengthen national AI capabilities and innovation in each country. 

Singapore’s HTX (Home Team Science and Technology Agency) is embarking on research using the NVIDIA Nemotron 3 Super and Nemotron 3 Nano Omni models to advance AI for public safety. Nemotron Super has the potential to support the agency’s complex reasoning and agentic workflows, while Omni’s unified vision, audio and language capabilities could help HTX develop multimodal applications grounded in real-world operational data. Together, the models could strengthen HTX’s ability to deploy secure, locally controlled AI across Singapore’s Home Team.

NCS is advancing agentic AI adoption across enterprises and the public sector, using Nemotron models and the NVIDIA Blueprint for video search and summarization (VSS), while advancing physical AI for practical humanoid robotics applications, to address security, responsiveness and data governance requirements. ST Engineering is using NVIDIA NeMo tools and NVIDIA cuOpt software to develop its AI Studio platform and deploy agentic AI solutions across its businesses such as Marine MRO.

Beyond Singapore, similar work is already underway across the region. Malaysia’s YTL AI Labs is fine-tuning Nemotron models for enterprise and citizen services, while Viettel AI is doing the same for Vietnamese-language applications. 

In Thailand, the Big Data Institute and iApp Technology, as members of the ThaiLLM Collaboration, are exploring Nemotron as a foundation model. With an initial focus on legal applications, iApp Technology is adapting Nemotron 3 Nano by fine-tuning OpenThai 2.0 Legal with Thai-language legal data using the NVIDIA NeMo framework. 

The model is released as open source for the Thai developer community and serves as the engine for Thanoy, the company’s legal-assistant chatbot, which already serves approximately 43,000 users. 

In Brunei, Antrique built an AI innovation platform to help boost productivity across the nation’s food sector.  

Across the region, NVIDIA Cosmos open world models and the NVIDIA VSS Blueprint are advancing smart city solution development. Malaysia’s ITMAX uses Cosmos with VSS to improve city traffic operations, while Thailand’s AS-TECH applies the same stack to improve passenger flow in airports. 

Learn more about NVIDIA

2026-09-23 02:30:22 · 大模型,算力芯片,AI应用,具身智能,开源,NVIDIA,对话助手,多模态,Agent智能体,推理思考,强化学习,微调蒸馏,世界模型,图神经网络,招聘HR

苹果高管称不建议给iPhone贴膜!网友:免费换屏幕我就信你;高德地图成「职场版大众点评」?回应来了;Muse大火,扎克伯格身价暴涨1700亿

雷锋网要闻提示
1.苹果高管称不建议给iPhone贴膜!网友:免费换屏幕我就信你2.知情人士:DeepSeek将向联合国安理会介绍AI风险,月之暗面等中国企业也受邀参会3.高德地图成“职场版大众点评”?回应来了4.字节通报二季度违规案例:114名员工被辞退,其中8人被移交司法机关处理5.阿里Qwen4和下代视频模型均在训练中,新一代AI芯片将于2027年一季度上市6.曝华为还将推出新形态手机7.Meta 再次上桌!个人AI产品 Muse 爆红,扎克伯格身价一日暴涨近1700亿

8.特斯拉最新版FSD翻车:误判眩光为摄像头污渍,官方承认是Bug

今日头条

苹果高管称不建议给iPhone贴膜!网友:免费换屏幕我就信你

9月22日消息,近日,苹果硬件工程副总裁 Tom Marieb 在公开采访中明确表态,不建议普通用户给 iPhone 额外贴屏幕保护膜。他坦言,每次看到有人给 iPhone 屏幕贴保护膜的时候,自己都会感到浑身不自在,因为团队在屏幕耐刮和耐磨方面进行了大量研发,希望用户直接体验原厂屏幕。

此番言论引发网友热议。不少数码爱好者直接指出,无论消费级手机玻璃的材料性能再怎么迭代升级,至今都没有哪家厂商能做出完全扛住环境里无处不在的石英颗粒的玻璃。

也有围观网友调侃:“用户担心的是摔,不是磨!”“碎坏的多了,能增厚额外的净利润。”“我建议你们应该给碎屏的客户免费保修几次。”“终身免费换屏幕。我就信你说的。”

据了解,第二代超瓷晶面板玻璃首次应用于 iPhone 17 系列,其抗刮擦能力是前一代的三倍。iPhone 18 Pro 和 iPhone Duo 的正面屏幕均配备了这种第二代超瓷晶面板。(21世纪经济报道)国内资讯

知情人士:DeepSeek将向联合国安理会介绍AI风险,月之暗面等中国企业也受邀参会

9月22日消息,据外媒报道,两位知情人士透露,中国人工智能初创企业DeepSeek将于本周向联合国安理会通报人工智能带来的风险。

联合国安理会将于当地时间9月23日召开会议,讨论人工智能与国际安全问题。此前几周,多位人工智能行业领袖呼吁协调放缓日益强大的人工智能系统的发展步伐,并警告称,这些系统可能很快实现自我改进,从而脱离人类控制。

外媒上周报道,OpenAI首席执行官萨姆·奥尔特曼计划在会上作简报,外交官们还预计Anthropic的高级代表也将出席。据一位消息人士称,DeepSeek以及包括月之暗面在内的其他中国人工智能企业也受邀发表声明。该消息人士还表示,DeepSeek创始人梁文锋不打算出席,但相关安排仍存在变数,可能在最后一刻改变。DeepSeek和月之暗面并未立即回复置评请求。(中新经纬)

高德地图成“职场版大众点评”?回应来了

9月22日消息,近期,不少网友发帖称,高德地图成了“职场版大众点评”,即通过搜索用人单位地址,可以看到既往员工或求职者留下的评价,以此作为是否面试或入职的参考。有网友呼吁高德不要下架这一功能,9月22日,高德地图客服接线工作人员告诉媒体,地点评价功能一直都有,未来是否会下架并不确定。

多条网帖显示,求职网友在高德地图搜索即将面试或入职的公司地址时,无意中发现地点评价功能里,出现了不少自称是求职者或前员工对公司的全方位评价,“用高德看工作靠不靠谱,太实用了”。有网友称:“周一要去这家公司面试,想搜路线,无意间看见这条差评,免了时间精力和路费,谢谢。”还有求职网友表示, 如果有人面试被骗过,会有人在高德地图里面评论,可以直接避雷。

不少网友表示,希望高德不要下架这一功能,也期待更多求职者在地点下留下评价,方便他人判断。但也有网友担心,有些公司是否会找高德删除评价或安排人员刷好评,从而混淆真实评论。(极目新闻)

雷军回应打新宇树科技挣100亿元:不是我投的,不是打新

9月21日,雷军在直播中澄清“打新宇树科技赚了100多亿元”传闻。他回应称,该投资并非其个人投资,而是顺为资本投资;也并非打新,而是支持早期创业者的天使投资。雷军称,大家报道的时候一定不要为流量夸大其词:“雷军打新挣100多亿,我勒个天呐,全是爆点,但你说公司投资哪是我个人的?”

8月19日,宇树科技登陆科创板,发行价150.80元/股。上市首日,股价开盘达到1100元,较发行价上涨约6.3倍。但随后股价一路下滑,截至9月22日上午,宇树科技最新股价495.65元,较高位跌去约55%,股价腰斩过半。(21世纪经济报道)

字节通报二季度违规案例:114名员工被辞退,其中8人被移交司法机关处理

9月22日消息,据媒体报道,字节跳动企业纪律与职业道德委员会发布中国大陆地区2026年3号通报,集中通报了2026年二季度内部违规违纪案例的处理结果。通报显示,共有114名员工因触犯公司红线被辞退,其中8人因涉嫌刑事犯罪被移交司法机关处理,6人因严重损害公司利益被提起民事诉讼。

通报称,多名员工因违规查询、外发内部保密信息被处理:有员工利用系统权限违规查询内部保密信息后,通过社交软件、现场展示等方式,将信息泄露给外部同行企业;也有员工出于炫耀目的,对外披露自身员工身份后,主动协助外部人员查询并泄露内部保密信息。上述涉事员工均被辞退或解除实习协议,其中部分人员被实名通报、同步行业联盟,并被提起民事诉讼追责。

继2025年9月首次通报后,字节跳动在本轮通报中再次披露社交媒体泄密与造谣典型案例。通报显示,一名实习生在外部社交平台发布不实言论,恶意编造关于公司文化与工作氛围的谣言,并以多个贬损性标签攻击同事。该帖互动量极高,迅速扩散至多个外部社交平台,对公司雇主品牌造成严重负面影响。鉴于其行为违反公司社交媒体政策,公司已解除其实习协议。(鞭牛士)

拓竹发布消费级 CO₂激光切割机R1,独家搭载自动光路校准功能

9月22日晚10点,拓竹科技发布首款消费级激光产品R1,一款55W高功率CO₂ 激光加工设备,主要面向创客、小微商家、手作爱好者。

据悉,该设备独家搭载了自动光路校准功能,将过去耗时十几分钟的手动调试,简化为一键即可完成的自动操作,开机后最高雕刻速度达1000mm/s、加速度达20000mm/s²。随着谷子、潮玩、周边定制等新消费趋势兴起,激光加工正加速从工业场景向消费级市场渗透。

阿里Qwen4和下代视频模型均在训练中,新一代AI芯片将于2027年一季度上市

9 月 22 日消息,2026云栖大会上,阿里巴巴公布了大模型一系列进展,大模型递归自我改进(RSI)已初步进入模型训练、推理及芯模协同等环节中,基于新一代架构的 Qwen4 已在训练中,未来 Qwen4.5、Qwen5 等版本将扩展至 5-10T 参数。

同时,阿里的视频生成模型、语音模型、图像模型、世界模型、音乐模型以及全模态模型等均在当天或近期推出新版本。此外,阿里全新的下一代视频生成模型将于 11 月发布,朝着更长、更可控、更完整、更智能的方向演进。

值得注意的是,阿里还发布了新一代AI芯片真武V900,阿里巴巴CEO吴泳铭表示,这是目前真武算力性能最强的AI芯片,性能达到m890的三倍,计划于2027年第一季度量产售卖。据悉,平头哥AI芯片的年出货量将大幅提升。(新浪科技、IT之家)

赛力斯董事长回应与华为合作生变

9月22日,在半年度业绩会上,赛力斯董事长张兴海在回应公司与华为合作模式变化时表示,双方的跨界合作进一步升级为问界专属专营模式,通过专属渠道、专属服务团队、专属品牌运营等多维度提升品牌价值与销量,这也是全球高端豪华品牌的通行做法。新的合作模式是双方跨界融合,持续加强合作的基础上的又一次创新,是体系和协同机制的进一步升级,也是资源的聚焦和渠道的提质增效,有利于推动问界高质量可持续发展。(第一财经)

DeepSeek迎来首任CFO!高瓴90后合伙人严文韬正式入职

9月22日消息,据媒体报道,原高瓴创投合伙人严文韬已于9月21日正式加入DeepSeek,出任首席财务官(CFO)。这是DeepSeek成立三年来首次设立CFO岗位。

2026-09-23 00:35:00 · 大模型,算力芯片,AI应用,具身智能,自动驾驶,融资,政策监管,OpenAI,Anthropic,Meta,字节跳动,阿里巴巴,华为,DeepSeek,月之暗面,小米,文生视频,语音音频,对话助手,推理思考,搜索RAG,办公效率,世界模型,工业制造,AI for Science,招聘HR,模型发布,产品更新,合作,财报,裁员,版权诉讼

Yann LeCun 万字演讲:「预测像素」是伪命题,JEPA 也并非凭空而来 | ECCV 2026

雷锋网只靠语言和 token,AI 永远跨不过物理世界这道门槛!

    作者丨幸丽娟

    编辑丨岑   峰

                                                                                                       

AI 行业的主叙事,曾被 Scaling Law 垄断:更大的模型、更多的 token,更强的文本推理,仿佛只要把语言模型继续堆大,通用人工智能就会自动到来。但这条路线撞上了天花板:预训练的边际收益肉眼可见地递减;模型一旦部署到真实世界,漏洞百出。2026 年,“世界模型”接棒 Scaling Law,成了牌桌上最拥挤的筹码。然而,这个词本身,同时被四条技术路线认领,而它们对“理解世界”这件事,几乎各说各话。第一条赌涌现:Sora、Genie 这类视频生成路线相信,只要下一帧逼得够真,物理规律就会自己从像素里长出来。第二条赌几何:李飞飞联合创立的 World Labs,从底层表征就锁死三维一致性,直接生成可自由探索的虚拟世界。第三条赌仿真:英伟达 Cosmos、Omniverse,把显式物理引擎当作机器人的练兵场。第四条路最孤峭,也最反常识:2018 年图灵奖得主、深度学习三位“教父”之一 Yann LeCun,押注 JEPA(联合嵌入预测架构),它不生成未来,只在抽象表征的空间里预测未来四条路的根本分歧,本质上在于一个问题:机器要“懂”物理世界,究竟该去复刻它,还是去推理它?前三条都在不同程度上试图让机器“看见并重建”世界;JEPA 却选择另一条路——编码器先丢掉那些根本不可预测的细节,只保留可预测、可规划的结构,然后在抽象表征空间里预测未来。在 LeCun 眼里,连“预测像素”这件事本身都是伪命题:你把摄像头对准房间一角开始录像,下一帧会拍到什么,取决于镜头外有没有人走进来、光线会不会变化。而这些信息,在“当前帧”里根本不存在。在 ECCV 2026  Keynote 演讲《World Models: Enabling the next AI revolution》中,LeCun 给出的,是一个比“Scaling Law 还能撑多久”更根本的判断:只靠语言和 token 训练,AI 到不了人类水平智能,也跨不过物理世界这道门槛。在 LeCun 看来,如果我们要通往真正的通用人工智能(AGI),就必须打破对“生成式”的崇拜。真正的下一章,是让 AI 系统从视频、传感器与交互中,学习并构建世界模型;再用 JEPA 去理解世界,去预测行动后果,去规划出实现目标的动作序列。在Keynote的最后,LeCun给出了三个与众不同、甚至堪称“暴论”的建议:1.别再死磕生成式模型了。2.别再去研究 LLM 了。
2026-09-23 01:49:00 · 大模型,算力芯片,AI应用,具身智能,OpenAI,Meta,NVIDIA,文生视频,代码生成,推理思考,教育学习,游戏,预训练,世界模型,向量数据库,传媒内容,榜单评测

独家对话大咖机器人王坤:具身智能这条路,谁也不能保证“涌现”一定会出现

钛媒体

2026年8月19日,世界机器人大会开幕当天,一名女记者跨坐在一台红黑配色的四足机器马上,在展馆通道里稳稳穿行,身后跟着一群追着拍照的观众,社交平台上相关话题迅速升温,围观视频被大量转发。三天后,第二届世界人形机器人运动会开幕,天工3.0骑乘大咖机器马担任旗手、高擎会旗稳健绕场,这一幕也成为这一届运动会第一个被广泛传播的落点。许多人第一次听说大咖机器人,就是从这两个爆款视频开始的。

但这匹出圈的机器马,在大咖机器人创始人兼CEO王坤的表述里,却只是个意外的产物:本为解决双足人形机器人易摔倒问题而设计的“超负载关节”(扭矩超2000Nm),因为难以在人形上直接应用,于是选择先落地为机器马的形态。而本为应对特种消防、救援这些极端场景的机器马一经曝光,却发现人们真正想干的事,却只是“骑上它”。

成立于2025年5月的大咖机器人,其实并不是一家专注于四足机器人的公司,其真正的主业是生产力型人形机器人和具身大脑的开发。创始人王坤是京东无人车项目的早期创始团队,拥有12年机器人和智驾行业从业经历,大咖是他的第三次创业。联合创始人兼CTO的徐文强,是中科大少年班出身,上海交大吴文俊人工智能荣誉博士,新加坡国立博士后,Nature子刊共同一作、机器人顶会IROS最佳论文获得者。

成立一年内,大咖机器人共完成四轮总计数亿元的融资,机构含金沙江创投、云时资本、盛世投资、灵心巧手、上市公司CVC等。更是朱啸虎在2025年“批量退出人形机器人公司”风波之后新入局的第一家通用具身智能公司。目前,大咖机器人的第五轮融资也有多家机构完成了尽调,近一两个月正在组织过会。

当年对人形机器人商业化抱有极度悲观态度的朱啸虎与王坤的第一次见面只聊了15分钟,问的全是机器人到底有没有真正的客户价值之类的问题。仅三四天后,朱啸虎就带着团队去了大咖的项目现场,一个细节一个细节地过,最后他给出的评价是:用户在哪儿、场景在哪儿、怎么赚钱,都想得很清楚。

而大咖机器人在订单开拓上的超快进度也印证了朱啸虎的判断。据多家媒体报道,大咖机器人成立6个月内,就在真实场景里完成百台级交付、累计意向订单超1300台。还在与多家头部具身智能厂商的正面PK中,拿下京东项目唯一供货的资格。

在王坤的主动叙事里,模型从来不会单独出场,永远绑在场景、验收和算账后面。这与他的一段经历直接相关:他曾是国内最早一批从事机器人大脑云端部署的团队成员之一,那是云端部署叙事最热闹的几年,而他亲历了最好的技术故事被十几秒的传输延时和数据合规问题无情地拦在商用大门之外。从此他认定:技术本身并不存在绝对壁垒,能越积越厚的只有端侧工程和现场数据。

而其实在CTO徐文强的带队下,大咖机器人在具身大脑的开发上也成果显著。公司自研的DaxBrain-WM(Dualis)两仪具身世界模型(简称:两仪具身世界模型),模型分阴、阳两层,阴模型融合视觉、触觉、力觉及本体感知信息,负责环境感知和动作闭环,阳模型负责任务拆解、异常处理、多机调度及资源分配,系统主要在端侧运行,可减少对云端算力的依赖。无论是公司主推的X7系列人形机器人,还是意外爆火的机器马都是在这套模型体系下驱动的。

与王坤近2个小时的对话中我们发现,他不但对商业订单有着超乎常人的执着和独到的思考,在对技术趋势和行业发展的判断上,也和当下具身行业的主流叙事大相径庭,而这一切似乎都可以在他过去的履历中找到印证的影子。

以下为与王坤的对话全文,略有删减:

不堆数据、不赌涌现

创投家:您介意在公开场合说“只堆数据是一条错误的路径”这个观点吗?

王坤:不介意,这是我们的判断。而且这不是立场,是我们复现出来的结果。

我们把市面上主流的模型几乎全部复现过一遍,测试结果都指向同一个结论:单一模型靠堆数据出技能,但即使数据量堆到千万级,离技术涌现还是差得远。

如果要用数据量填满这个差距,那么100亿的投入也可能远远达不到人们对于AGI的预期。而如果这个数量级需要更高,别说创业公司,那些巨头也投不动。最重要的是,即使投了,“涌现”也只是个概率性的事件,谁也不能保证它一定会出现。

所以技术涌现在我看来,只是一部分人的信仰。我们跟很多模型公司交流过,他们希望出来一个很性感的模型,一下子就完成所有事情,所有场景都可以直接使用了,现在不少具身智能公司讲的全是这套模型故事,其实很多时候他们已经没有办法了,必须得相信这个事儿。

创投家:你说堆数据这条路不对,那什么路径是正确的呢?

王坤:行业里的公司其实在走两条路:

一类喜欢把模型参数往大了做,原来7B、8B,现在十几B甚至更大,追求的是投放到任何一个场景都能干点事。这种模型本地放不下,成立的逻辑前提必须是技术涌现,这个前提达不成就全成了demo。

另一类就是先结合本体,用端侧部署模型驱动,扎到场景里去干活。像我们这种过去被商业化“毒打”了很多年的团队,还是会选择先扎到最终的客户场景里。

作为一家成立仅一年的新公司,我们跟很多主流具身大脑公司都在客户端打过很多次pk,客户那边几乎感受不到模型之间明显差异或领先。

所以模型本身不存在绝对的壁垒,只有时间是壁垒。一旦很强的复购浪潮来袭,两年时间可能上百万台机器就出去了。那个时候,你再说涌现也没有任何意义了,因为你能涌现,其他的模型也可以涌现。

模型这件事在我看来没有那么神秘,如果明天大咖真实场景使用量超过1万台了,那大咖一定就是最好的脑子。

这个问题在自动驾驶时代也有过先验,一旦有了市场占有率,技术话语权就特别高。现在无人车公司谁还讲自己是L4还是L5?都在讲市占率,市占率领先的,技术一定是领先。

创投家:会有人认为你们是在走捷径吗?

王坤:这不是捷径,其实这条路远比大家想象的辛苦。

学术型的团队往往不愿意干现场那种苦活,我们的团队得在客户现场苦哈哈一干几个月,处理各种counter case、补采数据。而counter case的数据是买不到的,让机器人能完成一个动作可能只需要几分钟的数据,但场景扎根的过程中,针对现场counter case的补采可能要上百倍的高质量数据,那些数据只能在一个一个客户现场长出来。

所以大咖不是学术驱动型的公司,是产品交付驱动型,说穿了就是复购驱动型,所有事情都被一个目标牵动:给客户交付一个可靠的结果,让客户算得过账。

创投家:为什么坚持端侧部署模型?这会是一个长期存在的主流方案吗?

王坤:我有一段约三年基于云端大脑交付机器人产品的经历,云端路线的坑我们吃够了:基站覆盖和建筑遮挡就让延时能差出十几秒,用户的交付效率根本上不来;出海更是麻烦,云端服务的法规限制非常多。所以我们从第一天起,就对云端零依赖,本地部署,训练好了直接上岗。

这条路线的核心竞争维度在算力成本上,大咖从成立第一天起就把ROI当作铁律,本体和模型都要计算ROI。我们一直坚持在万元级的算力上完成所有事,每一代模型都控制在2-3B,这是量化到成本上的红线,每一代研发人员都要遵循。成本超了就得查冗余、优化,这种工程经验的积累,也让这项技术壁垒越建越高。

其他产品用高算力在机器人上跑更大的模型,需要数倍的本地算力,产品定价远离用户所承受的范围,这种产品你就没法谈ROI了。

至于端侧部署模型会不会是长期占据市场主流的方案,我的回答是:对,它一定会是主流。

模型分阴阳

创投家:两仪模型到底是个什么样的架构?为什么要取这样的名字?

王坤:两仪模型是我们自研的第三代模型,分阴模型和阳模型。

阴模型就是行业里大家都在做的单一模型,从VLA到VA,本质是个黑盒,靠数据和激励让它输出一个相对收敛的技能结果,中间的过程不可解,所以我们叫“阴”模型。

阳模型包含了很多小模型,通过一个多agent的OS操作系统来调度他们,补充了很多能力:从灵巧手的单独训练、力控模型、局部空间的构建、再到多机协作、多机调度,各种响应层面、交互层面,全在里边。

这套阴阳模型架构给具体任务的执行提供了有非常强的成功率和可靠性的保障。

创投家:从实际效果看来,成功率的差别有多大?

王坤:我们给这套架构定下的交付目标是99%的成功率和99%的可靠性,这个目标光靠阴模型是怎么都达不到稳定作业的。

我们测试下来,开源模型在执行某个具体任务的成功率大部分在40%-60%左右,闭源模型大概能到80%,我们自己的阴模型能做到90%,而从90%到99%的差距就是靠阳模型的能力补出来的。谷歌前阵子发布的VLA+ER(具身推理)两层架构也是为了解决这个问题。

举个例子,模型训练拿可乐罐,90%的成功率意味着每拿100个件,就会有10个拿不到,如果每天要拣1000个件,就会有100个拣不到。阳模型在这个状态下实时监测,实用调用各种Agent能力,把任务成功率补到客户要求的水平。

创投家:那两仪模型也会追求泛化能力吗?

王坤:两仪模型在泛化性上有两个维度的追求。

一个是任务的难度,比如从能分拣,到能打包贴标,再到能做家务,这是任务难度本身的升级。

另一个就是跨场景的数量。我们现在已经跨了六大类场景:医药零售、物流、上下料、汽车生产线、快递等。而这个过程中,跨场景的门槛在不断降低:从物流拣选到外卖药店、门诊药房,再到汽车生产线,模型训练时间在变短,阳模型的能力越来越丰富之后,进新场景要解决的问题也越来越少。

创投家:投资人会对咱们的技术路线选择提出质疑吗?

王坤:资本也有质疑:专门投纯模型公司的投资人会觉得,要么只搞模型、要么只搞本体,你本体和模型都做,怎么做得过那些纯模型的公司?

我的回应是:两仪模型是开放生态,第三方模型可以通过接口接在阳模型上,你觉得哪个模型厉害,把他的模型放在我们阳模型上面,既可以大大缩短模型与商业场景的距离,又可以检验出模型真实的能力。

 被毒打出来的商业原则

创投家:大咖在商业化进度上如此之快,有没有什么特别的方法论?

王坤:大咖从第一天起就定下了三条原则线:

第一,交付给任何客户,必须保证客户能够在12到15个月内回本,这是解决用户商业价值和复购的第一个核心点;

第二,机器人上岗的任何一个岗位,必须百分之百把原来人工岗位的工作全干了,而不能只是替代部分功能;

第三,聚焦生产力,只做真正降本增效的事,锦上添花的事情一概不做。

这些原则直接决定了我们机器人的售价,再用售价减去毛利目标就得出了成本红线,从硬件的算力预算到关节方案,我们做的所有工程优化都是以成本红线为最终目标。

创投家:这套原则是怎么来的?

王坤:大咖是我创办的第三家公司,之前的12年里,我从服务机器人做到自动驾驶无人车,量产过多款产品,在市场上的销售总额累计十多亿,某些产品在当时的赛道里出货量第一。

但现在回头看看,其实很多场景做的都很失败。像安保机器人、快递无人车这些产品,最后的复购率都不好。复购也成为困扰了我十多年的问题:机器人在场景中到底能发挥多大的作用,用户的复购意愿才能提上来?最底层的因素还是降本和增效,这两个点必须完成,而且价值必须可以量化。

而过去这些反复的失败和各种场景里的不断尝试,也是大咖目前最宝贵的财富,让我们得以把技术开发-工程化-量产-客户交付-测试闭环整个技术栈都跑通了。虽然大咖机器人是第一代产品,但是在硬件素质和交付能力上,我们已经很有信心了。

创投家:咱们的交付的模式是怎样的?目前合作了哪些客户?

王坤:我们尽可能提供物理服务,按工作量计费,客户相当于雇佣了一个机器人。机器人的所有权留在大咖,对客户来讲是一个零风险的事情,对我们来讲也是长效健康的。有客户想买断也可以。我们现在合作的客户有科捷物流、健麾信息、京东等。

创投家:咱们目前的战略需要大规模的销售团队么?

王坤:其实是不需要的,我们的策略是把场景打透。

拿无人车头部公司举例,从2023年到2025年这三年间,销量翻了近百倍,但销售人员规模并不大,最关键的一点就是他们把场景打透了,复购率自然提升。因此没有复购你就别谈规模化,打透场景本身可以一定程度上替代销售的堆积。

反过来:如果没有形成复购,假如今年卖了两个亿,明年哪怕维持同样的销售额,必须用数倍的销售团队拼命拉新客户,对公司的反噬会非常巨大,其实业内还存在很多这样的现象和风险。

 一个意外开创一个新品类

创投家:我们已经知道机器马的诞生其实是一个意外的产物,但为什么当时会想到要去做重载关节呢?

王坤:我们创业第一天就定了两条路径:整机做身体和脑子完成商业化闭环,零部件做第二曲线。

当时轻载关节又趋于成熟,已经没什么可做的。于是我们走访了一线所有双足人形公司,发现双足人形不能大规模商用,除了算法之外还有严重的安全问题:当机器人受外力一只脚离地时,整个身体重量会压在一个髋关节上,力量不足以平衡全身的重量,在台阶、坑洼处很容易摔倒,这里面就存在一个重载关节的缺位。

我们当时测算人类最强大力士的力量极限是不可能超过2000Nm,所以将重载关节的起点就定在2000Nm。研发持续了将近一年,是我们投入时间最久的一个研发。但做完之后我们发现,如果要用在双足人形上,这个关节还要降维出髋、臂、肘三个型号,而如果先用在四足机器人上,一个型号就够了,机器马就这么来的。

但机器马做出来发现能力太夸张了,能负载1吨,以前人们都抠体重,现在可以随便放100多公斤的电池在上面。

创投家:那又是怎么改为骑行款的呢?

王坤:我们4月我们发布的是物资载重款,面向特种消防、灭火、应急编队、救援这些极端场景,消防很感兴趣,但商业周期很长。

这个时候有很多客户找我们,希望能够推出一款骑行款给人们体验,其实是市场在拉着我们走,于是7月我们就发布了骑行款。

机器马的做法与机器人不同,是按新能源汽车、无人车的车规方式来设计的,相当于把无人车的系统塞进一个机器人里。

我们希望机器马能成为未来出行的一个新物种,而路权、保险、车辆规划这些无人车时代积累的经验也正好用得上,至少大家担心的那些问题,我们都轻车熟路。

(本文首发于钛媒体APP,作者|Terry,编辑|杨林)

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

2026-09-23 03:43:47 · 大模型,算力芯片,AI应用,具身智能,自动驾驶,开源,融资,政策监管,京东,对话助手,Agent智能体,推理思考,设计创意,医疗健康,金融,扩散模型,微调蒸馏,世界模型,端侧AI,工业制造,零售电商,传媒内容,营销广告,物流供应链,模型发布,产品更新,合作,榜单评测,论文

零售成了“机器人练兵场”

钛媒体

(本文作者为 巨潮WAVE,钛媒体经授权发布)

文 | 巨潮WAVE,作者|Tiya,编辑|杨旭然

宏大叙事正在不可避免地退潮。

具身智能作为一个行业的讨论焦点,已经从技术能做什么,转向讨论如何在更具体的场景中真正转起来、持续迭代,并最终实现盈利。

叙事的转向是一种对现实的真实映照,也是对资本诉求的回应。2026年下半年,多家主流厂商在机器人+零售领域搞了大动作,从一线城市商圈到社区便利店,“机器人员工”正以肉眼可见的速度渗入多元业态。

工业产线和展会舞台之外,零售门店正在成为具身智能落地最密集的方向。一个信号已然清晰:零售不再是具身智能的“试验田”,而是成了检验其商业价值的直接场景。

这意味着在当下的具身智能市场,价值的定义几乎已经被重构:“技术可行”与“商业向实”缺一不可。所有已经进入零售场景“打工”的机器人,都在竭力兼顾这两点。

零售场景中悄然泛起的机器人热潮,不该被简单视为短期风口,它像是一面镜子,更具体地映照出整个行业正在从单纯的“能力炫技”走向“价值兑现”。

探索

从场景验证的历程看,零售场景顺承了舞台表演、工厂作业两大重要场景下机器人融入人类工作的基本路径,但也在某种程度上跳出,甚至超越了原有场景验证的局限。

无论是舞台表演、工业生产,亦或是零售服务,机器人在多元场景中的落地,本质上都是在重塑这个世界的生产生活形态。整个过程的深层逻辑并非简单追求“无人化”,而是以机器人为枢纽,构建一种人机互补的新型协作模式。

从技术和产品层面看,这三个场景对具身智能的要求已经出现了分化。

大部分的工业生产机器人受限于横向、纵向,或是“格子式”的封闭空间进行作业,即便是游走在工厂中的叉车及移动机器人,也大多全流程自主作业,与人的直接交互比较少。

舞台表演中的机器人显得更加灵动,但更多是一种简单的功能展示,商业变现能力不足。

相比之下,零售门店恰好介于两者之间——零售场景有标准SKU、标准SOP,可以满足机器人持续学习,能力迭代的底层需求,同时又有真实客流、随机订单和现场干扰,是检验机器人泛化能力与固定场景之下应变力的“试金石”。

零售行业的“无人化”由来已久。从自动售货机、无人货架到AI视觉结算,零售行业一直在寻找降低人力依赖的方案,但此前的探索更多集中在“设备自动化”。

中商产业研究院报告显示,2025年中国无人零售市场规模超480亿元,2026年将达536.26亿元。自动售货机是行业内最早实现无人化闭环的终端,当下的“机器人+零售”更像是进一步的内生性深度探索,不仅是近年才开始的跟风。

但现在有部分机器人零售只是在原有无人零售体系上叠加了机器人躯壳和简单问答,整个状态看起来更像技术展示或“表演”,这不能称之为真正的机器人零售服务。

真正的转折点,在于机器人零售门店化并与零售体系之间开始融合:商店中的机器人在授权范围内真正参与到业务的全流程,“卖东西”成为企业经营行为的延伸。

政策支持、技术优化、商业成熟,三者共同推动着这种更加智能的零售业转变。

政策端,对智慧零售的支持力度在提升,政策红利促进人工智能赋能无人化服务的发展;技术上,世界模型、触觉感知相继跨过可用门槛,机器人已经可以到现成的门店直接上岗;商业端,就像人们逐渐习惯了掌上智能助手的7×24服务,经过一段时间的测算,企业相比之前也更加明确了机器人员工“全天候在岗”的红利。

以此为基础,机器人零售的持续发展几乎是确定性的。但确定性属于赛道,并不属于个体。

当下这个领域还没有陷入到内卷的泥沼,因此那些率先突围者的破局样本,更具有研究和参考价值。

模式

资本催熟之下,零售赛道的具身智能厂商们野蛮生长、良莠并存,洗牌期也提前开始。

野蛮生长的一面主要体现在形态之争——人形、双臂协作、轮式复合、桌面级等形态并存,做咖啡、调酒,从零售货架上取物,形态选择取决于职能和场景需要,尚无公认最优解。

良莠不齐与洗牌期同时出现的一面,则是因为资本涌入速度往往远超技术迭代和商业验证周期,行业出现“时间压缩”效应——许多企业被迫在未完成产品闭环时就开始规模化叙事,这也意味着无法实现商业化自洽的企业只能被迫出局。

整体来看,真正火出圈的还是人形机器人,因为机器人的形象展示更容易引发人们的好奇,也代表着更大的想象空间。厂商们的实践方向各异,催生了差异化落地路径与商业模式。

银河通用没有做过多的技术展示,直接在真实线下门店开展技术验证+商业化转化,旗下Galbot G1人形机器人以轮式人形结构为基础,聚焦于“抓、持、递”三项最基础的操作能力的优化与实现。

这款机器人可以依托轮式底盘快速响应订单,柔式夹爪有更稳定的抓握表现,“大脑-小脑-触觉感知”的闭环传导相对流畅,全自主运行,且无需远程操控。

可以看出,这样的整体规划旨在为线下门店提供可复制的智慧零售解决方案。

资本对于银河通用的押注,其中一部分就是它能够把技术转化为“标准化零售劳动力”的预期。但当前真实零售场景的非结构化程度、人机协同的实际摩擦成本,以及终端客户对“劳动力替代”最真实付费意愿,都还需要进一步的验证。

Sharpa则是走了系统性灵巧操作的技术路线,让机器人学会了做冰淇淋。

今年8月,Sharpa和全球知名冰淇淋和快餐连锁品牌Dairy Queen (以下简称DQ) 合作,打造了一家“零改造、全自主、全年无休”机器人暴风雪餐厅,在DQ上海吴江路店落成。

与银河通用一样,Sharpa也不过度追求机器人长得像人,而是更多去塑造机器人更加类人的思考和行动模式,让机器人实现从“递货员”向“产品制作者”的转变。

物理AI的高阶形态,是在开放动态环境中基于物理规律、社会准则,深度理解并完成复杂的长程任务。这个过程对机器人来说,就包含行动前的预判和多任务拆解、行动中的动态调整,以及任务结束后的记忆“归档”,以不断优化下一次的行动。

拆开技术来看,机器人搭载Sharpa Wave五指触觉灵巧手具有22个主动自由度,可以在“抓、捏、推、拉、舀取、倾倒”一整套动作中灵活切换。

相比“像人手”,这只灵巧手的真正意义在于其将原本需要多套设备、多重适配、多次调试才能完成的零售操作,收敛为一个可复用、可扩展、可与外界交互无缝衔接的物理接口。

Sharpa的自研分层端到端模型CraftNet,在底层控制中引入触觉、力觉和状态反馈等机制,机器人会根据摩擦、滑动、振动和受力变化调整输出力度。触、力的觉感知,则是会反馈回全模态的世界模型,一边“保存”历史任务数据,一边规划演绎下一杯的制作。

Sharpa制作冰淇淋的过程很像一场“动态实验”,需要面对杯、勺、柜门和冰淇淋机多个物理实体,全自主地完成从点单到交付的55步连续任务,且不是快闪演示。

可以看出,在零售场景中,机器人将不断触及、跨越其最终实现长程任务的能力“临界点”。

这套技术全栈式的零售打法,也有可能被Sharpa和具身同行们学习、推广到其他冰激凌、汉堡等更丰富的餐饮制作中,“涟漪效应”显然是明晰的。

不过,不同餐饮品类在工艺流程、卫生标准及设备兼容性等方面存在显著差异,这些现实约束,也可能反过来推动更具适配性的下一代“类Sharpa”门店形态的加速涌现。

商汤善惠也是这个赛道中的一个重要参与者,“烧卖购”机器人小店是其人工智能实体服务消费者构想的核心载体。

通过SenseMart OS零售物理操作系统,商汤善惠希望形成一个开放共享、“即插即用”的平台底座,不同店面既可以接入不同的机器人和设备,也可以连接品牌、运营商和场地方端口,通过标准接口缩短新商品、新设备和新业态的上线周期。

复杂的智能零售链路,被拆解为感知、交互、决策、执行四类能力,由统一零售大脑调度;各动作可独立训练验证,店内设备与货架亦经轻量化改造,便于机器人触达。机器人员工被分配到不同店面,感知咖啡机、冰淇淋机、柜门等服务触点,持续完成指定工作任务。

商汤善惠联合创始人伊帅坦言,“机器人店”并不完全等同于“无人店”,机器人小店的本质还是要回归“经营”——显然这需要比机器人卖货要复杂得多的综合能力。

根据设计,“机器人店长”会将互动数据传回决策中枢,成为零售门店运营的关键基础。但在新品引入、品牌联名及大型促销等关键决策环节,仍将保留人的判断,这样才可以最大化激发整个服务体系的技术张力与商业潜能。

本体能力、操作精度与经营系统,共同构成了机器人零售落地的必要支撑。三者协同,将感知、决策、操作与经营整合为一套可持续履约并实现盈利的完整系统。这意味着机器人进入门店绝非简单的硬件入驻,而是一种系统化商业能力的嵌入。

远景

各家企业的情况各有不同,但综合起来看,当前机器人零售正面临一场价值重估:它是否真的可以被资本与零售业界共同视作一个可持续创新的长期场景,被验证并持续开发?

这其中的影响因素很复杂,穿透表象才能更多感受到机器人企业更真实的商业目的。

行业发展的早期阶段,人们对机器人零售的热情更多源于好奇与打卡冲动。吸睛特质会在无形中放大消费者的猎奇心态,短期内必然会收获一波流量,但这只是起点。

从银河通用、Sharpa、商汤善惠等厂商入局机器人零售的实践来看,现阶段机器人进店的核心动力,主要还是希望依托零售场景中标准SKU、标准SOP及真实的交互数据,实现大规模真实数采以反哺机器人后续的训练。

当基础感知与交互能力趋于成熟,新增数据对模型性能的提升将显著放缓,边际数据价值递减的拐点到来,店面追求的不再是数据的“多”,而是追求更具挑战性的长尾案例。如室外取货、多语种混合指令、非标准交互等稀缺数据,将成为下一阶段模型突破的重点。

这时,机器人零售需要在保持“零售本色”的同时,蜕变出更加面向未来的新经营模式,如RaaS模式(机器人即服务)将会被看重,像烧卖购这样的机器人小店,在这种模式下可以成为品牌触达消费者的新触点,并反向促进品牌的产品研发和精准营销。

猎奇效应要转化为长期价值,关键在于创造独有的消费体验,或完成人类难以完成的任务。

这一逻辑已在实践中验证,零售正在成为机器人能力的“母场景”。商汤SenseMart OS正从便利店向商超、园区等场景迁移;银河通用则从零售延伸至药房、康养等多个领域。

另一方面,各家厂商的竞速也正在表明,“机器人零售”、“无人服务”的终局不是“替代人”,而是“激活人”。这也是其商业模式可持续的体现。

机器人零售需要保持人机协同的灵活性与足够的韧性——机器人保障基础服务的稳定输出,人力则用来完善场景、解决问题、维系与消费者的情感连接等等。

因此,衡量机器人零售的成熟度,不能局限于“替代人工”这个单一维度。相比于单纯的人力置换,人机能力的精准耦合与价值共生,可能会成为更具价值的评估标尺。

从整体市场现状看,人类与“类人”员工,还需经历一段比较漫长的磨合周期,完全以取代人为目标的机器人零售企业,可能会遭遇到不同程度的困境与压力。

结语

机器人零售的演进与升级,同时也是行业从技术想象回归到商业常识的一条必经之路。

猎奇所带来的流量终会消退,在真实经营中验证过的人机协同模式、可复制的场景能力,以及更可持续的盈利路径,才能支撑入局的企业穿越周期。

当前,无论是数据积累的临界点突破,还是RaaS模式的探索,抑或是“激活人”而非“替代人”这样共识的形成,都指向同一个方向:

机器人零售正在褪去表演属性,努力成为零售产业的一个组成部分,一个新的方向。

它或许不会以颠覆者的姿态彻底重塑行业,但作为具身智能落地最务实的试验场与放大器,其意义早已超越了卖瓶装水或者冰淇淋本身。

当机器人员工真正学会像店员一样思考、协作与成长,甚至像店长一样完成经营和盈利工作,这场变革才算抵达了真正的起点。

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App

2026-09-23 03:48:42 · 具身智能,政策监管,商汤,对话助手,Agent智能体,设计创意,金融,教育学习,扩散模型,微调蒸馏,世界模型,向量数据库,工业制造,零售电商,传媒内容,营销广告,模型发布,产品更新,合作

腾讯、字节、阿里「会战」AI 办公之后:Agent 领域格局已变

极客公园

「这仗打错了,最多是白烧几十亿;但如果不打,可能是生死问题。」

这是创新工场联合首席执行官、管理合伙人汪华对大厂重金押注 AI 办公的判断。

2026 年的这个夏天,中国科技巨头发起了 Agent 时代第一场「战役」:豆包工作正式发布,TRAE、扣子团队整体并入豆包体系。更早的 7 月底,飞书产品团队并入豆包;另一边,腾讯的 WorkBuddy 已经跑出了千万月活,阿里也在整合自己的桌面 Agent、云端 Agent 和钉钉能力。

巨头为何会集体兴奋?AI 办公的背后他们在思考什么?在争夺什么?最近,极客公园邀请了汪华、Floatboat.ai 创始人兼 CEO 谭少卿一起来聊一聊。

今年初那场「小龙虾热」,本质上只是一场极客的自我狂欢。谭少卿说,「它是个过渡产品」,属于三类产品分层中的「极客产品」,从一开始就没打算走大众化路线。模型不够强、配置门槛高、Harness 不成熟,把普通用户挡在门外。

真正的转折发生在最近几个月。汪华认为,国产模型是最近才真正跨过了那道坎。GLM-5.3-Flash、DeepSeek-V4-Flash 这些模型不仅把指令遵循能力做上去了,更关键的是把成本打了下来。

现在,才是中国 Agent 爆发的真正原点。

这里面有一个反直觉的逻辑:移动互联网时代,千万月活根本不值得巨头兴师动众,但这次大厂已经开始了一场「大会战」。

汪华说,背后的驱动力是恐惧。年初 Claude Code 还没到千万月活时,ARR 就已经达到 200 亿美金了。这意味着,未来的高价值经济入口,可能不建立在高日活之上。法律、财务这类高价值的专业工作,一旦被 Agent 重新定义,丢掉的不是用户规模,而是整个赛道的船票。

除此之外,还有另一个因素是算力。C 端产品比如豆包,算力负担极重,只能用压缩的小模型,所以「有时觉得它智障」;而办公 Agent 恰好卡在一个理想区间,既能体现大模型真实能力,又不会因为用户规模过大导致算力扛不住,同时商业模式能跑通

WorkBuddy 的火热,某种程度上是一场内部赛马的幸存者故事。「它是踩在众多失败项目的尸体上活下来的。」大厂采取的都是内部赛马策略,那些算力成本过高、商业模式不成立的项目自然死亡后,资源自动向幸存者倾斜。

巨头进新战场,常被认为自带优势。但这次不一样。汪华说,「巨头唯一的壁垒其实只有钱,而钱能兑换的仅仅是算力。过去积累的数据和用户,不会自动转化成新赛道的优势,庞大组织架构反而会极大抵消资金优势」。

虽然巨头已经下场,但汪华认为,中国创业者有一个很大优势,距离中国开源模型更近。「大家在一个圈子里,私下交流多,最懂怎么在这些开源模型上做微调、建生态,那就能相对于其他地方的创业者建立一些优势。」

进入 Agent 时代,巨头们都在争夺通往未来的船票。汪华说,「船票」其实只有两张:成为水电煤般的基础设施,以及掌握基础模型。至于用户平台层面的船票,很可能根本不存在了,因为 Agent 本质上「是一种能力、一种智力、一种计算形态」,而不是一个需要被圈养的平台。

谭少卿从产品实践里看到了更远的东西:当 Agent 具备主动性,甚至开始向 CTO、COO 的角色过渡时,连 WorkBuddy 这样的「工作台」形态,都可能只是过渡产品。「模型越聪明,其实越不需要WorkBuddy这种中间层。」

巨头们这一次冲进 AI 办公战场,多少带着一点恐惧:怕错过新入口,怕丢掉下一代生产力的船票。但有意思的是,他们在重兵投入的同时,也无意中完成了市场教育,让更多用户第一次真正理解,Agent 不只是聊天工具,而是能干活的生产力系统。

而创业公司并没有因此被挤到墙角。相反,在巨头照亮市场之后,它们反而看见了更多细分机会:更垂直的场景、更灵活的产品形态。

以下是极客公园创始人&总裁张鹏和汪华、谭少卿的对话内容,部分有删减。


Part 1:中国 Agent 的「ChatGPT 时刻」来了

张鹏:近期腾讯、字节、阿里等大厂在 AI 办公领域的动作非常密集。你们怎么看他们最近的系列动作?

汪华:我觉得这事特别好。有了大厂来推动,包括他们愿意补贴,才能真正开启中国 Agent 领域的「ChatGPT 时刻」。

之前大家用豆包、DeepSeek,体验的是 Chatbot 对话。国内真正用过 Agent 的普通人极少。年初虽然小龙虾火过一阵,但门槛太高,绝大多数人根本没有用起来。它本质上只是极客的狂欢,再加上一点好奇用户的外溢。

现在大厂把 Agent 包装得非常易用,把 PPT、绘画、办公等场景预设好了,花力气把它推给了至少千万用户,相当于给全市场做了一次 Agent 普及教育。除了教育层面,用的人多了,各种应用场景也会被开发出来。

跟今年上半年小龙虾那波相比,还有一个关键不同,是国产模型是最近才真正跨过了那道坎。倒退三个月,国产模型的指令遵循能力还不够。同时,GLM-5.3-Flash、DeepSeek-V4-Flash 这些 Flash 模型把成本打下来了。所以一切水到渠成。

大厂推动 Agent 普及,对创业公司同样是巨大的利好。如果没有大厂去教育市场,创业公司自己拓荒太难了。现在,才是中国 Agent 爆发的真正原点。

图片来源:视觉中国

张鹏:怎么理解从小龙虾到 WorkBuddy,中间的逻辑是什么?毕竟这是两个不同人群的产品?

汪华:小龙虾热的时候我们也聊过,结论是它太复杂了,没法直接给普通用户用。但那波热潮让所有人,尤其是年轻科技爱好者,第一次亲手摸到了科幻小说里的东西。

大家都想尝试,但最后卡在几个地方:一个是模型不够强,当时只有 Opus 4.6 能用但又慢又贵;二是配置门槛太高,普通人搞不定 Linux 环境;三是 Harness 也非常不成熟。

现在完全不同了。模型和 Harness 每一两个月就在飞跃,现在 Opus 4.6 已经被随便「吊打」。更关键的是,普通人需要的是云化,不用自己在本地配置,云端配好直接用。现在的 Codex、Claude Code、豆包工作,也都是帮用户在云端配置好,起码是一个手机或消费品级的体验。

从小龙虾到 WorkBuddy在用户体验上有一个巨大差别:从极客的玩具,到手机 App、消费品。腾讯在这方面一直做得很好,他们始终把 WorkBuddy 当成一个用户级、消费级的 App 来开发,花了几个月时间就走到了今天这一步。

很多人认为这是创业公司的事,但并非如此。创业公司可以在海外做开源,但如果要做消费级、工业化的消费级产品,还得解决流量冷启动、数据积累这一整套问题,可能还是大厂,他们有流量、有资源。

张鹏:小龙虾火了之后,对你们有什么启发?怎么看现在巨头纷纷入场 AI 办公这件事?

谭少卿:我们做得比较早,去年 7 月就发现模型能力在长程任务上已经足够好。但面向普通知识工作者,市场上缺一个原生的「工作台」产品,所以我们就切入了这个方向。

小龙虾今年爆火的价值在于让大众第一次看到,Agent 可以后台 24 小时运行,发个任务就能跑,哪怕经常崩溃、又贵又慢。包括 ClaudeCowork 的发布,这对我们是特别好的事情,它证明了这个方向是可能的,我们第一轮融资就是在 ClaudeCowork 发布之后完成的,我们做的更早,跟它同天发布。

但我们判断当前的 Cowork 类的产品是过渡形态。因为 Cowork 本质上还是以人为中心,随着 Harness 价值的显现,Agent 长程能力越来越强,未来会过渡到以 Agent 为中心,产品形态、交互设计都会不一样。

张鹏:这对投资人的决策有影响吗?

谭少卿:之前从这个角度切入是反常识的,大家觉得这该是个通用赛道而不是垂直 Agent,而且软件演进路径是从软件到 SaaS 到 Agent,从桌面端切入好像是「开历史倒车」。但 ClaudeCowork 发布后,外界对这个路线开始有了认知。

我们把产品分成三类:极客产品、专家产品、大众产品。小龙虾属于极客产品,虽然我们一开始就没打算走这条路,但它让大众看到了可能性。

巨头入场,也是在帮我们教育市场。我们产品今年 1 月公测时,有用户抱怨积分用得太快。但当我们做用户访谈的时候问他任务满不满意,他说很满意,超出预期。再问干了什么工作,往往是实习生需要干半个月的工作量。当时只是没把价格锚定到生产力上,所以大家还是觉得贵。现在各类 Work 产品,让更多人知道了 Agent 真能解决问题,对我们是好事。

汪华:我特别希望这次巨头能教育中国用户交月费。以前,中国用户交月费不能超过 10 块钱,而美国用户为产品付费几十美金是常态,工作类甚至 50-100 美金。中国这么多年的免费模式,导致付费习惯一直起不来,而广告和交易支撑的商业模式,在商业模式上天生就有局限性,不是每种产品都适合这套逻辑。

张鹏:你认为到什么条件下,你会认为付费习惯基本建立起来了?

汪华:现在已经有很好的趋势了。虽然还是一小部分人,但程序员和专家用户,已经能坦然接受 68、98 元这个档位的月费。相比以前,这已经是巨大的进步。

中国用户以前的付费习惯,其实是被巨头抢用户的免费模式毁掉的。中国用户不是不爱付钱,你看 Steam 上 30% 都是中国玩家,巨头的生态是能培养习惯的。

现在大厂做 AI 办公,骨子里还是以前打用户量、算 ARPU、做入口的那套思维,并不是真正的「以 Agent 为中心」。唯一的好处是,因为 Agent 需要算力成本,他们没法再搞纯免费了,必须正儿八经推付费模式。这算是把以前毁掉的习惯又慢慢拉回来了。

谭少卿:确实如此。我们产品一开始主打海外,定价 40 美金一个月,没对国内外用户做价格区分。我们就是想验证,用户愿不愿意为好产品付比较高的价格。结果发现国内用户的付费习惯远超预期。有些重度用户一天甚至能充值两三千块钱,他们是真的把 Agent 当作生产力工具在用,而不是传统软件。

最近我们选了 DeepSeek-V4-Flash,跑了五个主流榜单,并且比官方的 Harness 评分更高。这证明 DeepSeek-V4-Flash 和 GLM 5.2 已经能驱动很复杂的长程任务,配合我们的 Harness 能做得多快好省,就能进入更多的生产力领域,因此推出一个便宜版本。从数据上看,巨头教育市场,对我们的付费率和留存反而都有明显的提升。

Part 2:WorkBuddy 是怎么踩着「尸体」跑出来的?

张鹏:从个人的视角,怎么看 WorkBuddy 这个产品?它是怎么演进的?

谭少卿:这类产品的交互逻辑,基本是从 Coding 场景演变过来的。进去先看到一个 Chat 面板,然后选一个项目文件夹开始工作。但大部分知识工作者的文件系统其实是半结构化的,不会把一份工作相关完全塞进一个文件夹,只有程序员才习惯把所有代码扔进一个目录下面。所以这个交互形态,没什么实质创新,只是把 Coding 的逻辑照搬过来。

真正让大厂资源开始发挥作用的转折点,是把 Skills(包括原来 GPTs 那种形态)包装成「专家」模式。这么做的好处是小白用户更容易理解。小白用户面对一个输入框可能完全不知道该干嘛,但「找个专家」这个概念他能秒懂。虽然这通常会拉低模型智能和 Harness 本身的表现,但也拉低了用户理解产品的门槛。一旦跨过这个门槛,巨头的运营和投放能力就能真正发挥作用。

在这个基础上,WorkBuddy 在易用性上确实做得稍好一点,比刚发布的飞书的豆包办公要更成熟些。

有意思的是,从几家产品官网就能看出各家的文化背景差异:WorkBuddy 官网做得很简单,甚至跟它现有的新版 UI 对不上,说明他们还在快速迭代;千问办公的用词和风格偏工程化,更贴近技术,更像是千问模型的一个管道;豆包办公则更年轻、更酷炫,内容呈现更靠前。这些细节背后其实是各家公司风格的直接投射。

张鹏:我们推导一下,为什么 WorkBuddy 是腾讯先做出来的?而不是字节或阿里?

汪华:实话说,我不知道。年初小龙虾那波热潮,其实是飞书吃到了最大的红利,他们当时也投入了很大精力做相关产品,但确实没跑出来。

其实大厂内部很多团队在赛马,字节有一批,腾讯也有一批,但字节这批没跑出来。

更关键的一点,可能是腾讯在模型选择上更开放。

字节的模型本身有点不够行,这在豆包这种对话式产品里其实无所谓,字节在交互体验上一直做得不错。可一旦到了办公场景,这背后是长程 Agent,对模型智能、指令遵循的要求会更高。而 WorkBuddy 可以自由选择模型,可以接入最好的生态。现在模型更新此起彼伏,「模型即产品」这一点在 Harness 时代依然成立,模型不行,前端交互做得再好,用户体验还是不行。

张鹏:可以选择不同的模型,现阶段是吸引用户的点吗?

谭少卿:坦白讲,对非专家用户来说,选模型这件事其实挺让人懵的。我们从产品早期到现在,一直保留让用户选模型的选项,核心原因是模型之间的差异依然非常大。日常办公用 DeepSeek-V4-Flash 确实又快又好,但如果追求极致效果,比如在 Coding 上,GPT、Claude、GLM 之间的差距依然很大。

只要产品还允许自选模型,就说明模型能力还没有收敛到一家独大。我们判断这会是个比较长期的状态。因为还有新的变量出来。目前,训练和蒸馏技术越来越成熟,任务越长越重要,Harness 越重要。比如很多用户反馈 Fable 5 在编程上不用提示词就特别强,但做非编程任务时会觉得智能下降了,就因为它模型的训练越来越多地对齐在自己的 Harness 上。同时,办公、Coding、世界模型,这几场仗都还没打完。模型厂也不是无限弹药的,专注于当前办公产品的资源其实也有限。

二是供给会越来越充足。大家都可以在基础模型上针对特定领域做后训练,通常都能比原始基模表现更好。我们也接触到一些还没在市面发布的基模,所以供给端只会越来越丰富。

另外,我们在产品协同上选择了和巨头完全不同的「分布式模式」。我们赌的是这次变革本身的特性:AI Agent 的能力不同于以往的技术,它能够根据用户的场景去自我编程、改进,从而让用户不必捆绑于具体的软件和 SaaS 平台。

现在数据其实是分布式的,大家并不关心文档是在飞书、Google Docs,还是存在本地,因为 Agent 全都能访问。所以这些边界被淡化掉了,用户的迁移成本也没那么高了。

正因为如此,分布式的供给才有了可能性。大量中小企业和个人用户,本来就没有谁真心愿意把数据锁死在一个平台上,他们更愿意让数据回归到自己手里。

同时,硬件端也出现了巨大变量。现在的 Mac 顶配电脑跑 27B 甚至 70B 的本地模型已经没问题。我们判断,未来很可能会重演早期 PC 时代的演进路径,算力供给将从中心化回归到个人终端。有可能到年底或明年年初,我们会看到消费级设备上也能跑出可以驱动 Agent 的能力。

张鹏:移动互联网时代,千万月活根本不值得巨头去打会战。为什么腾讯会重金加持?背后的战略思考是什么?

汪华:我觉得首先是恐惧。千万月活确实不多,但你要知道,年初 Claude Code 还没到千万月活时,ARR(年度经常性收入)就已经达到 200 亿美金了。

腾讯的逻辑大概是两点:第一,当年豆包出来,腾讯没重视,结果被做出了一个新入口,所以这次没有哪个巨头敢在一个东西还小的时候就轻视它;第二,大家都害怕未来的新经济形态,生产力、高价值的专业工作,比如法律、财务等,不一定建立在高日活上。如果这波没赶上,可能不是丢了用户规模,而是平白丢掉了高价值的经济入口。这仗打错了,最多是白烧几十亿;但如果不打,可能是生死问题。

而且对国内公司来说,现在算力已经没法像海外那样大规模投,美国那几家一年 CAPEX 就是 2000 亿美金级别。相比之下,国内打应用层的仗,真不算什么大的负担。

张鹏:这个视角很有意思。巨头需要把投资变成未来的资产和能力,否则护城河就会变矮或消失。那应用层是一个很好的选择?

汪华:而且办公场景还有一个巨大的好处:算力可控。

像豆包那种面向几亿 C 端用户的产品,算力负担极重,只能用压缩的小模型,所以大家有时觉得它「智障」。如果算力充裕,按照字节的秉性,肯定愿意给 C 端放开更强的模型,但现实是不允许的。

而办公 Agent 处于一个完美的平衡点:既能体现大模型的能力,又有实际价值和未来的高溢价空间,同时用户规模又不会像 C 端产品那样失控。加上它还能收点费,跑通商业模式,这确实是一个非常合适的战场。

我觉得并不是腾讯一开始就想得有多清楚。他们内部肯定有很多团队在

2026-09-16 06:39:11 · 大模型,算力芯片,AI应用,开源,融资,OpenAI,Google,Anthropic,字节跳动,阿里巴巴,腾讯,DeepSeek,智谱,文生图,代码生成,对话助手,Agent智能体,办公效率,设计创意,金融,教育学习,微调蒸馏,世界模型,提示工程,模型安全对齐,端侧AI,法律,工业制造,营销广告,招聘HR,基础设施,模型发布,产品更新,财报,榜单评测

京东押注物理 AI,冲在前面的是一群 95 后

极客公园

去年,AI 行业最热闹的是模型榜单、推理能力和多模态生成。所有人都在问:这个模型有多强?

但到了 2026 年,问题变了。人们开始追问:它到底能干什么?

这个问题,京东在今年的 JDD 大会上,给出了自己的答案。

京东把这届大会的主题定为「JoyAI · 跃迁物理世界」。它想传达的是,AI 的下一站不只是能说会道、更聪明,而是要进入仓库、货架、家庭、配送路线和售后服务,去完成真实任务。

有意思的是,这次站上舞台的,除了京东高管,还有一批 95 后业务负责人和产品经理。他们讲的不是概念里的未来,而是京东 App 的 AI 化改造、物流具身智能机器人、家庭 AI 入口。这背后京东正在推进一项更大的战略——建设全球最大物理世界运营中心。AI 正在走出屏幕,而年轻人正在成为这场迁移的主力。

95 后冲进 AI 最难落地的地方

陈屿有一段时间,每天都在问自己同一个问题:我们是不是做错了?

那是 2025 年底、2026 年初,整个电商行业都在往「智能体电商」这个方向猛冲。用户输入一句话,AI 理解需求、推荐商品、辅助下单。这个想象很迷人,也足够「未来感」。

陈屿和他的团队也投身这场探索,推出了「京东 AI 购」独立 APP,去打磨这套纯对话式的原生购物体验。经过完整试点之后,团队看到了边界:对话模式擅长处理复杂的选品咨询,但并不适配全部购物场景。

即便是在 AI 对话窗口内,用户聊完需求,最后依旧会追问,「这个能不能再便宜一点?今天有没有优惠?」陈屿说,这些问题,其实在京东原来的首页里,早就解决了。

还有耐心问题。纯对话式购物,你得打字,系统理解,给你推荐,你说不对,再调整、推荐。这个来回消耗的不只是 token,还有用户的时间和信任。买个东西,不是在谈判,人是会烦的。

图片来源:京东

于是陈屿面临了一个真正的岔路口。

一边是行业里最热的方向,所有人都在冲,不跟上显得落伍;另一边是回到用户本身,找寻真正更好的体验。

他们选了后者。他们不是抛弃 AI 助手,而是把 AI「长进」京东原有的购物流程里。搜索里加意图增强,推荐里融入时间‑场景‑用户多维度信息,购物车顶部悄悄加一个「场景提示词」入口。买了钢琴,系统轻声提醒你:节拍器要不要一起?买了投影仪,那些你根本不知道怎么选的参数(激光、原色、幕布),系统帮你变成可以直接点选的选项。

陈屿打了个比方:「就像超市里的导购。你买东西,旁边有人轻声说,你买这个,旁边那个货架上有个配件,用起来会更好。」

这条路,比做一个独立 AI 助手要难得多。你要在一个已经成熟运转的超级 APP 里,在不打扰用户原有习惯的前提下,把新的东西悄悄嵌进去。就像在一栋住满了人的楼里重新装修,不能断水断电,还要让住户觉得越住越舒服。

如果说陈屿的战场是屏幕,林澈的战场就是真实世界的仓库。他是京东物流仓储具身算法开发负责人。

2026 年初,科技圈每天都在被炫酷的机器人 Demo 刷屏。今天是打拳击比赛的人形机器人,明天是能叠衣服的灵巧手……

图片来源:京东

但林澈已经在想另一个问题了:这些机器人,进了真实的仓库,面对满地的杂物遮挡、人员走动,它还能用吗?能给用户带来什么更好的体验吗?

他更关心的不是 Demo 好不好看,而是每小时能拣多少件、准确率是否足够、能覆盖多少 SKU、能否稳定运行,以及能不能和一线员工安全协同。

他的日常不是坐在工位前调参,而是跟着机器人,在真实的仓库里一待就是一整天。

京东的仓库里有十几万种 SKU。同一个储位,上午和下午的摆放可能完全不同。前一件商品被拣走,后面商品的遮挡关系就变了。机器人停靠位置稍有偏差,它看到的画面和能操作的空间就不一样了。

「这些东西,你在实验室里是看不出来的。」

所以他的团队,把仓库当成了实验室。研发人员长期驻扎现场,跟一线操作工人聊:哪些货最难拿?什么时候最忙?出了异常怎么处理?然后把这些经验,一条一条喂给模型。

图片来源:京东

他们自研了一套架构——世界意图模型(World Intent Model)。

逻辑来自一个很朴素的观察:人在抓一个杯子之前,不需要预测每 0.3 秒之后的画面,只需要知道「我要抓这个杯子」这个意图。有了意图,动作自然就跟上了。

传统的世界模型,每次推理都要生成未来的视频帧,速度慢,不实时。他们的方案是:用大模型生成意图,再把意图交给「动作专家」以高频率执行。中间加一个控制器,一旦出现意外——比如杯子没抓到——就重新触发大模型,生成新的意图。

「既能处理长程任务,又能应对实时的突发变化。」林澈说。这套架构,在「仓狼」机器人上取得非常优秀的效果,抓取准确率 99.9%,商品覆盖率超过 85%,每小时拣货效率达到 80 件。这些数字,意味着它不是 demo,是真的可以进仓库、算得过经济账的产品。

京东真正的底牌,不在模型榜单上

相比陈屿和林澈,许欣的经历是另一种京东特色。2019 年,许欣以管培生身份加入京东,在五六年间从 0 到 1 成长为产品负责人。

在最开始半年的轮岗结束后,许欣选择了自己最感兴趣的普惠金融相关产品方向。她觉得,这件事能解决真实的社会问题。在这个项目里,她从一个写需求文档的产品新人,成长为能独立主导战略级项目的产品经理。

京东对待人才有一个有趣的传统,叫「七上八下」。当你的能力具备 70% 的时候,就把你推去做需要 120% 能力的事。许欣说,这是她职业生涯里最重要的训练。「你永远不会在完全准备好的时候被推出去。但正因为如此,你才真的成长了。」

图片来源:京东

之后,许欣转向 C 端 AI 原生 APP,负责用户增长相关工作。那是一套目标清晰的线上产品环境:明确用户从哪里来,如何提升流量,如何完成转化,团队内部语境高度统一。

而接手 JoyInside 之后,她踏入了一个完全不一样的复杂场域。不再局限于纯软件产品的逻辑,工作需要直面硬件工程、供应链、采销、外部品牌方等多方角色。

她描述接手后这段经历是「快速学习」。第一次开硬件供应链的会,会议室里坐着硬件工程师、采销、算法团队,大家开口就是 BOM 成本、声学结构、推理延迟。这些东西,她以前从来没碰过。

但这只是复杂度的开始。做 JoyInside,你面对的是还有整个上下游的协调与合作。你不能只盯着屏幕上的数据,你还要搞清楚一颗芯片怎么装进一个玩具狗里,一个点读笔的声学结构会不会影响 AI 的响应体验,一个品牌商愿不愿意跟你合作,能不能最快在 30 天内把一个传统硬件改造成 AI 产品……这是一个完全不同维度的战场。

如今,JoyInside 已经跑通了样板。小鸡球球 AI 点读笔累计用户突破 10 万,凯米斯 AI 机器狗也实现了近 10 万台的销量突破,跑出了智能硬件爆品节奏。在 JDD 大会现场,JoyInside 还搭了一个 AI Home 样板间,客厅、卧室、厨房、浴室,全品类覆盖,把「AI 进入家庭场景」这件事,从概念变成了可以走进去参观的真实空间。

但许欣清楚,这只是起点。她真正要解决的问题,不是打造一两个爆品,而是从单点爆品,到全品类的批量复制能力。

三个人的故事讲完了。

但如果只把他们看成三个努力的年轻人,你会错过一件更重要的事。

他们能做成这些事,不只是因为他们足够聪明,足够拼。更关键的是,他们背后站着一个足够真实、足够复杂的物理世界。而这个世界,是京东用二十多年一点一点搭出来的。

很多公司爱讲「给年轻人机会」。但在物理 AI 这件事上,光有机会远远不够。

物理 AI 必须进入仓库、供应链、门店、家庭。你得真的泡在这些复杂现场里,在真实的业务压力下把问题跑通,才能知道模型到底能解决什么,不能解决什么。这种训练,你在 PPT 里得不到,在实验室里也得不到。

陈屿推动京东 App AI 化,是因为背后有足够厚的零售数据、商品知识、采销经验和履约服务能力,能支撑 AI 真正嵌入购物链路。林澈做仓储机器人,是因为京东物流本身就有足够复杂、高频、刚性的生产现场,可以让机器人一边干活一边进化。许欣所在的 JoyInside,也依托京东的硬件渠道、品牌合作、家庭消费场景和服务供应链,才有机会把 AI 真正推进真实家庭。

没有这套基础设施,这三个人的故事,可能都只是一个好看的 demo。

今年 JDD 上,京东把这套东西概括成一个词:超级 AI 供应链。云提供算力,数据推动 AI 进化,模型提供大脑,终端进入物理世界,场景负责验证能力,供应链完成规模化。

图片来源:京东

尤其在机器人产业上,京东进一步提出「六个全球第一」,最大的具身智能数据采集中心、最大的机器人产业基地、最大的机器人零部件供应网络、最大机器人维修服务网络、最大规模的物流具身机器人应用军团、最大的机器人零售渠道。

这些加在一起,便是京东的「物理 AI 加速计划」,赋能机器人训练、研发、制造、销售、应用和服务的全链路、全周期。

换句话说,京东看到的物理 AI 产业化,不是做一个爆款机器人,而是把整条链路全部串起来。

当 AI 走出屏幕,人不能被留在原地

三位 95 后负责人的故事,只是京东人才版图里的一个切面。

京东真正在做的,是针对不同的人,找到他们能发挥最大价值的位置,再把他们送进真实的场景里去。

这套逻辑,从初中生就开始了。

今年 8 月 26 日,京东与中国人民大学附属中学联合启动了首届 JDXplorers——未来青少年 AI 探索者计划。面向 12 到 18 岁的在读初高中生,征集 AI 创意作品。

这个计划有两个主题,都很有意思。

一个叫「AI 原点」,强调的是观察身边真实世界,用 AI 解决今天的问题。比如,让不熟悉手机的老人通过语音或拍照完成购物;让 AI 在暴雨前提醒家庭提前准备必需品;让 AI 更好地辅助健康管理。都是很小的事,却都是真实的事。

另一个叫「AI 奇点」,鼓励青少年跳出当下,想象未来。比如,机器人进入家庭后,不只是扫地,还能陪伴老人和孩子、协助设计房间;视障人士逛街购物时,AI 通过语音和触感描绘商品、指引货架;无人车根据用户时间自动规划快递送达。

放在京东的整体布局里看,JDXplorers 更像是一个很早的入口:让年轻人在还没进入职场之前,就开始用真实问题校准自己对 AI 的理解。

再往后,京东有面向校招生的「五年成长计划」,让年轻人到重点业务里挑大梁;也有「顶尖青年技术天才计划」,面向全球招募技术人才,给他们资源和空间。

这是一条从青少年到职场新人再到技术精英的完整路径。

但京东视野里的「人才」,不只是这些站在技术前沿的年轻人。

刘强东曾公开说过一句话,大意是将来都是机器人送货了,根本不需要快递员,但他不希望我们 70 万兄弟没有饭吃、没有工作。

图片来源:京东

这句话背后,是京东内部正在推进的「涅槃计划」:把京东已有的 70 万快递员等蓝领工人送到学校做技术培训,为此在全国签了 120 所学校。

逻辑很直接,机器人送货之后,可能也会出故障,故障了还得人去修。与其让这 70 万人被技术淘汰,不如让他们成为历史潮流的一部分。

这是京东要回答一道真实的命题:技术在变,岗位在变,但人不能被落下。

京东想建立的不是一个只服务于精英工程师的人才漏斗,而是一套覆盖不同人、不同起点、不同场景的系统。从还在上初中的青少年,到刚入职的校招生,到已经在仓库里跟机器人并肩工作的快递员。

物理 AI 的未来,不仅写在仓库里、货架上、家庭的客厅里,也写在京东 90 万员工里。最终让这一切成立的,从来不只是算法,而是一个个真实的人。

2026-09-17 07:51:53 · 大模型,算力芯片,AI应用,具身智能,政策监管,京东,语音音频,对话助手,多模态,Agent智能体,推理思考,搜索RAG,办公效率,设计创意,医疗健康,金融,教育学习,世界模型,向量数据库,提示工程,工业制造,零售电商,物流供应链,招聘HR,基础设施,模型发布,合作,榜单评测

机器人如何自进化,乐享科技走了一条新路

极客公园

作者|Li Yuan

编辑|郑玄

最近,乐享科技因为一个颇大胆的 claim,引发了不少关注:它提出,其具身智能模型以太大模型能够在部署和执行过程中持续更新,并将这种能力概括为「自进化」,是全球首个能自进化的具身智能模型。

自进化是一个容易引起争议的说法。「进化」究竟是模型参数发生了变化,还是进行了任务的临时调整?在多大程度上这样的调整能够变成可迁移的新能力?一个模型能够适配不同场景和不同身体,又应该被理解为工程层面的泛化,还是更强意义上的持续成长?在机器人行业仍然需要解决稳定执行问题的阶段,「自进化」显然是一个需要被谨慎对待的判断。

近日,乐享科技又进行了一场户外直播。按照直播前公布的目标,搭载 Aether 以太大模型的机器人要在户外接受随机点单,完成包括食材和工具处理、烤制、翻面、上菜在内的烧烤任务,并应对临时打断、需求临时增加和场景变化。

在现场超 30 位专业媒体和线上超 550 万观众的见证下,实际呈现的过程并非每一步都顺利。

机器人完成了部分自主烧烤操作,也出现了停顿、失败和重新调整。乐享科技似乎并不回避这些不完美:它想展示的重点,不是机器人在一个固定流程里零失误地把烧烤做完,而是任务和环境发生变化之后,机器人能否继续寻找信息、调整动作,再把任务推进下去。两个机器人本体全程互相传递任务信息、自主思考决策并合理分工协作。

一场直播当然不能回答关于「自进化」的所有问题,但这种展示方式至少体现出一种相对开放的态度:机器人可以失败,真正需要观察的是失败之后会发生什么。

对机器人来说,「自进化」不能只是一个好听的词。它至少要回答三个问题:第一,机器人能不能发现现实和自己预测之间的偏差;第二,它能不能判断哪些经验值得留下、哪些应该忘掉;第三,它能不能把一次任务、一个场景和一具身体上的经验,迁移到新的任务、场景和身体上。

当数字世界的 AI 开始讨论自进化,物理世界的 AI 有没有自进化,或许是下一个时代最重要的问题。

为此,我们和乐享科技背后的团队聊了聊他们的模型思路。

 

01

不是更会模仿,

而是能不能理解真实世界

过去几年,具身智能最常见的思路,是把视觉、语言和动作连接起来:机器人看到环境,接收任务,再输出动作。这条路线的价值很直接,它让机器人可以借助大规模数据学习人的示范,也让复杂指令开始有机会落到具体行动上。

但在乐享科技团队看来,这种从输入到动作的映射仍然存在一个根本限制:它擅长回答「下一步应该做什么」,却未必真正理解「为什么要这样做」,以及这个动作会给真实世界带来什么后果。

团队将 VLA 的局限概括为「不懂因果」,将传统 world model 的问题概括为「可生成、不可执行」。按照这一判断,前者更接近从已有数据中学习动作规律,但这并不自然等于理解动作与结果之间的因果关系;后者可以预测世界可能如何变化,却不代表预测出的未来一定能够被机器人的关节、力矩和控制系统实现。

真实世界恰恰不是一组干净的输入输出。接触力、摩擦、滑动、遮挡、物体形变以及目标临时变化,都会让同一个动作产生不同后果。一个杯子的质量增加一倍,关节需要输出的力矩就应该随之变化;液体重心不断移动,机器人也不能只是机械复现某条既定轨迹。画面上「看起来合理」,与身体上「真的做得到」之间,还有很长一段距离。

这解释了乐享科技为什么没有把重点继续放在动作预测上。

按照团队在采访中的描述,以太大模型是一个由世界状态、内部状态和能量状态耦合而成的动力系统。感知、预测和行动仍然存在,但并不是三个依次调用的独立模块,也不是一个从输入直接吐出动作的黑盒。团队更愿意把它称为「energy-driven state transition」,即由能量驱动的状态转移。

这里的「能量」不是机器人电池还剩多少,相关负责人把它形容为一个 landscape,一张贯穿系统的评价地形:哪些状态值得靠近,哪些状态应该舍弃,当前还缺少什么信息,以及接下来应该把计算和注意力放在哪里,都在这张地形中被共同衡量。

这让感知本身也变成了任务的一部分。机器人不再只是被动接收摄像头传回来的画面,而是带着问题寻找答案:为了继续行动,我还需要看到什么?当前视角能否消除不确定性?是否应该先移动身体、改变观察位置,再决定下一步动作?团队将其称为具有「感知意图」的主动感知。

这套思路可以从乐享科技展示的「太极宗师」任务中得到更直观的理解。在这一任务里,机器人左手需要控制杯中液体不洒,右手同时维持另一个物体稳定。液体状态、外部扰动和关节状态都在持续变化,很难依靠一条固定动作轨迹完成。按照团队的解释,系统需要建立动作、物理状态与结果之间的因果关系,并根据后果不断调节控制。

这并不能单独证明机器人已经拥有完整的物理直觉,但它至少揭示了乐享科技想用以太大模型解决的问题:真正困难的不是生成下一个看起来正确的动作,而是让动作在一个不断变化、会反过来影响机器人的物理世界里成立。

从模仿动作走向理解行动后果,是这条路线的第一层变化。它也为「自进化」提供了前提:如果机器人无法识别现实与预测的差异,就无从知道自己错在哪里,更谈不上从错误中形成新能力。

 

02

自进化不是一句口号,

而是一套闭环机制

那么,乐享科技为什么认为 Aether 可以「自进化」?在采访中,我们把问题进一步落到了模型内部:机器人执行任务时,变化的究竟只是瞬时状态和记忆,还是策略乃至模型权重?

乐享科技给出的回答是,这些层级都会更新。按照团队的解释,他们所说的「自进化」,首先发生在执行过程中的预测误差修正,但并不止于一次性的状态调整。

机器人在行动前形成预测,执行后观察结果,再比较真实结果与原有预测之间的偏差。如果世界已经不再是刚才以为的样子,系统就需要更新内部状态,判断原计划是否失效,再进行局部或全局的重新规划。这个过程不是任务失败后才启动的补救措施,而是伴随每一次行动持续发生。

面对临时改变的目标,系统会重新判断原有计划是否仍然适用,并生成新的动作:「我现在看到的世界,还是我刚才认为的世界吗?」从预测、执行、反馈、更新到再次行动,系统始终处在循环之中。

在 demo 中,机器人需要处理一块有污渍的玻璃。它发现污渍并不在自己面对的这一侧,而在玻璃外侧,于是改变原来的处理方式,把手伸向窗外继续擦拭。正是体现这一点。

 

这与传统意义上的 action prediction 有一个明显区别。后者更关心在当前输入下输出什么动作;按照乐享科技的说法,Aether 则会同时维护世界状态、任务状态和系统自身状态。一次行动之后,变化的不只是机械臂的位置,也可能包括短期经验、技能参数,以及系统对某种因果规律的判断。

长时序任务由此成为一个重要观察点。团队提到,乐享科技已经展示过一镜到底的连续任务,机器人需要理解步骤之间的先后关系,记住已经完成到哪里,并能在中途改变目标或中断后继续执行。单个动作是否准确当然重要,但更难的是,在持续变化的过程中保持对「当前世界是什么样」「任务进行到哪里」「下一步为什么这样做」的统一理解。

只是,能够根据反馈调整,还不等于能够持续学习。在线学习最大的风险,是把偶然扰动当成规律,把错误经验写进模型,甚至在学会新东西时破坏原有能力。

按照乐享科技的介绍,以太大模型不会让所有新经验直接进入长期知识。系统会先评估一次经验是否可靠、是否新颖、能否归因、能否泛化,再决定它值不值得改变已有知识。换句话说,学习能力的一半,是知道什么应该学;另一半,是知道什么不该学。

与之配套的是分层记忆。越具体、越依赖单一场景的状态,生命周期越短,任务结束后就可以被清除;越抽象、经过反复验证的规律,保留时间越长,可能进入世界模型和因果模型。

模型是否真的会「调参」,是区分临场适应与自进化的关键。对此,团队明确表示,经过筛选和验证的经验也可能进一步影响模型权重,并被长期保留;如果只是某个场景下的临时状态,则不会永久写入模型。也正因为更新可能从记忆和策略继续进入参数层,乐享科技才把这套机制称为「自进化」。不过,这里仍然需要保留一个边界:目前我们得到的是团队对内部机制的解释,权重如何变化、变化幅度多大,以及新能力能否稳定保留,还需要更具体的测试结果来呈现。

数据的角色也因此发生变化。真人视频被用于理解人的行为逻辑、推测意图和构建认知,类似一种预训练;示教视频负责把认知落到可执行动作上,被团队形容为「给机器人上幼儿园」;真实运行数据使用得最少,却承担最重要的 reality calibration,也就是让机器人在真实环境里接受检验。

团队还有一个更形象的说法:机器人可以给自己做「错题本」。真正有价值的不是记住某一次失败,而是从失败中分离出可以复用的规律,在下一次面对相似但并不完全相同的任务时调用它。

这也解释了为什么泛化性是判断自进化是否成立的关键。如果所谓学习只能留在原来的任务和原来的机器人上,它更像一次局部调参;只有当经验能够穿过场景和本体差异,才可能真正成为更一般的能力。

据相关负责人介绍,以太大模型已经在约五家不同机器人本体上积累经验,涉及双臂、双足和轮式形态。不同本体在关节数量、自由度、末端执行器、质量分布、控制方式以及传感器布局上都有差异。迁移到新机器人时,团队通常希望获得 URDF、关节名称和传感器配置,以完成运动学对齐、传感器标定、动力学参数辨识和进一步微调。

以太大模型之所以能真正实现「一脑多形」,关键在于:接入一个全新本体后,它能够通过自主探索认知该本体的性能差异、关节限位等约束,并据此生成适配不同本体的动作与轨迹来完成任务。由此,模型完成了对本体的自我认知与适配,进而实现软硬件解耦。

控制系统同样体现了这种分工。团队所称的 200Hz 以上频率,覆盖的是状态读取、控制器计算和关节指令更新;高层感知和推理并不以同一个固定频率运行,而是根据任务复杂度与当前不确定性调整周期。当高层推理需要更长时间时,主动感知反而可能变得更频繁,以获得更多信息。

因此,乐享科技所说的自进化,并不是机器人突然拥有了自我意识,也不是一个简单的端到端黑盒,而是一组更综合的工程机制:主动获取信息,根据预测误差调整行动,筛选值得学习的经验,把不同层级的经验存入不同记忆,再尝试将较稳定的规律迁移到新任务和新身体上。

 

03

如果机器人真的能自进化,

那就是 next level

过去的机器人更像被训练好的执行机器。它可以把规定动作做得越来越精准,但任务之外的经验很难沉淀;它可以被部署到现场,部署后的反馈却未必会变成长期能力;它也可以更换场景和身体,但每一次迁移常常近似重新开始。

乐享科技借以太大模型所提出的观点,不只是让机器人完成更多工作,而是让部署本身成为学习过程。机器人进入真实世界之后,不再只是消耗训练阶段获得的能力,也可能在一次次行动中校准对世界的理解,把可验证的经验逐渐变成新的能力。

最近围绕 GPT-6 的讨论,也让许多人重新思考下一代模型的跃迁会来自哪里。人们关心的已不只是参数是否更大、推理是否更强,还包括模型能否在更长周期中积累经验、形成记忆,并在持续交互中改变自己的能力边界。落到机器人身上,这个问题会变得更具体,也更严格,因为每一个判断最终都要接受物理世界的检验。

如果具身智能只是从指令走向动作,它仍然是一种更复杂的自动化。但如果机器人能够在行动中发现偏差,在反馈中筛选经验,在记忆中沉淀规律,并把这些规律带到新的任务和身体上,那么它就不只是「更会干活」,而是开始具备某种生长性。

当然,关于「自进化」,乐享科技需要回答的还有很多:泛化能够跨越多大的任务差异,学习可以持续多久,模型变化如何被量化,新能力能否在不同机器人上稳定复现,以及长期运行后如何证明旧能力没有退化。

但目前所展示出的能力已经把问题向前推了一步。衡量机器人的方式,或许将不再只有「它现在会做什么」,还要加上一句:「它做完之后学会了什么?」

一旦机器人真的能够把现实世界里的经历变成可积累、可验证、可迁移的能力,它改变的就不只是某个 demo、某家公司或某条技术路线。那意味着机器人不再只是被制造、被训练、被部署的机器,而可能成为一种能够在世界中持续获得经验的行动系统。

那确实是具身智能真正的 next level。

 

*头图来源:乐享科技

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

 

极客一问 你认为下一代模型的跃迁会来自哪里?

 

2026-09-20 07:15:14 · 大模型,具身智能,开源,政策监管,OpenAI,Agent智能体,推理思考,金融,教育学习,微调蒸馏,预训练,世界模型,模型安全对齐,工业制造,传媒内容,产品更新

OpenAI 发布 GPT-6 Sol 和 Luna;传字节跳动豆包收缩对话团队;千问发布 AI 手机全栈解决方案 | 极客早知道

极客公园

OpenAI 发布 GPT-6 Sol 和 Luna 模型,API 价格大降 50%

9 月 23 日消息,OpenAI 今日发布 GPT-6 系列模型的最新成员 GPT-6 Sol 和 GPT-6 Luna。

OpenAI 官方表示,两款模型采用与 GPT-6 Astra 类似的方法进行训练,将 Astra 在专业工作、事实性、编码、计算机使用和对齐等方面最先进的性能带入更快、更经济的模型。

GPT-6 Sol 和 Luna 模型的 API 价格相比 GPT-5.6 促销价降低 50%。不过 OpenAI 官方也表示,GPT-6 Astra 依然是其整体上最优秀的模型,如果你想要最佳效果和无妥协的体验,还是建议选择 GPT-6 Astra。

性能方面,在 AutomationBench 的跨应用业务流程测试中,GPT-6 Sol 在 xhigh 强度下表现优于 Claude Opus 5,成本仅为 Opus 5 每任务成本的 9%。在 high 强度下,GPT-6 Luna 比前代提升了 5.4%,且每项任务成本降低了 58%。

在评估智能体的 Last Exam 测试中,GPT-6 Sol 在 max effort 状态下得分为 56.4%,高于 Claude Opus 5 在评估中的最高分,每任务成本也降低 60%。

OpenAI 还将 GPT-6 Astra 改进后的沟通风格带到了 Sol 和 Luna。官方认为新模型在技术和编程对话中会更清晰、使用更少的术语、更少奇怪的措辞、更少的低价值细节,以及缩短整体回答,同时不会失去实质内容。

除了价格降低,OpenAI 还帮助基于 GPT-6 的开发者在应用重复利用的上下文部分节省更多费用。官方改进了 GPT-6 的提示缓存,默认提供更高的缓存命中率,帮助智能体重用更多上下文,实现更快响应。(来源:IT 之家)

 

云栖大会开幕,吴泳铭提出「思考力商品化」

9 月 22 日,2026 杭州云栖大会正式开幕,阿里巴巴集团 CEO 吴泳铭发表开场主旨演讲,抛出「思考力商品化」核心观点,重新定义 AI 时代的经济逻辑。他类比工业革命将动力变成商品,认为当下 AI 正在把思考变成可规模化供给的商品,未来机器产生的思考总量或将达到人类思考总量的 1000 倍以上。

吴泳铭提出 AI 重塑供需关系:供给端,AI 智能体可以不眠不休完成复杂科研任务,稀缺的顶级思考不再是奢侈品;需求端,智力消耗不再受人口限制,个体能够借助 AI 获得巨大智力杠杆。

吴泳铭提出机器智能时代三大基石:AI 芯片、AI 模型与 AI 云,三者构成完整的思考力生产、流通、消费链条。平头哥芯片负责算力生产,通义千问 Qwen 模型提升思考质量,阿里云则搭建输送思考力的全球「智能电网」,目标 2032 年数据中心规模超 20GW。

阿里同步面向 Agent 做全栈优化,从硬件、存储到 MaaS 平台、Agent Studio 全线调优,解决长任务可靠性、算力成本难题。吴泳铭判断,当前 AI 产品仍处在「电灯时代」,原生 AI 应用尚未诞生,阿里正提前布局 AI 基础设施,为未来智能应用搭建底层土壤。(来源:极客公园)

推荐阅读:拆解下阿里的 AI 经济学,与它的下注

曝理想汽车推进芯片子公司融资,投前估值约 150 亿元

据晚点 Auto 报道称,理想芯片子公司正推进首轮外部融资,投前估值约 150 亿元,计划融资数十亿元。

工商信息显示,一家名为 Mach Intelligent Cores Limited(下称「Mach 香港」)的公司于 7 月 14 日在香港成立。8 月 4 日,Mach 香港全资持有的上海马赫智芯智能科技有限公司成立,理想 CTO 谢炎担任法定代表人。数日后,上海马赫智芯又全资设立上海马赫心科技有限公司,法定代表人为理想联席公司秘书王扬。

据悉,理想自研芯片团队约 200 人,主要从事 AI 算力架构、芯片设计和相关软件开发。目前,理想正同时推进车端、云端两类自研芯片项目。一位员工透露,理想人事部门已与芯片部门员工沟通调整劳动关系的事宜。

理想马赫 M100 芯片发布于今年 6 月,采用 5nm 车规级工艺,单芯片算力 1280 TOPS。今年二季度以来,马赫 M100 芯片已在全新理想 L9、L8、L6、MEGA、i9 等车型上搭载上车。(来源:晚点 Auto)

 

消息称字节跳动豆包收缩对话团队

《晚点 LatePost》独家了解到,豆包通用 Session 团队正在减员,规模预计将缩减约一半。该团队此前约有 50 人,一度是豆包内规模最大的团队,主要负责豆包的对话(Chat)产品能力,包括策略、评测等工作。此次调整后,部分人员将转岗至豆包商业化、飞书等团队,其余人员将被裁撤。

人员调整由豆包负责人赵祺推动。赵祺加入字节十余年,先后负责增长中台、穿山甲(字节旗下广告平台),后转岗至集团人力资源部门,为字节的 AI 业务搭建人才体系。2025 年 9 月,赵祺转岗至豆包。今年 7 月,飞书产品与豆包产品团队整合,他成为新产品团队负责人。

赵祺到豆包后同样看重人效。据了解,此前豆包有一个独立的评测团队,今年赵祺将其拆散,分到了各业务组。

负责对话方向的产品后训练团队(Product Posttrain-Chat)也在缩减。

该团队由朱文佳负责,隶属于大模型部门 Seed,与豆包产品团队协作,基于 Seed 的基础模型进行后训练,产出供豆包直接调用的小模型。由于业务需求减少,部分员工已转岗至 Horizon RL、产品后训练-办公(Product Posttrain-Work)等其他部门。另据了解,对话模型合版负责人在一个月内换了两次。

豆包目前是国内日活跃用户数最高的 AI 应用,DAU 已超过 2 亿,但它过去的成功,本质上仍是对话产品的成功。(来源:晚点 LatePost)

微信朋友圈内测私密发表:可发布仅自己可见的朋友圈

近日,有网友发帖表示,微信朋友圈新增「私密发表」功能,编辑并发布内容后该朋友圈将仅自己可见。

对此,腾讯客服向新浪科技确认并表示,「微信目前已经新增了私密发表功能。需要注意的是,该功能目前处于 iOS 和 Android 客户端的灰度测试阶段,其他机型可能需要等待后续更新。」

谈及为何推出「私密发表」新功能,腾讯客服回应称,「私密发表功能可以让用户发布仅自己可见的朋友圈,避免内容被他人看到,增强隐私保护。目前该功能处于测试阶段,后续会逐步优化覆盖更多用户。(来源:新浪科技)

 

比尔·盖茨最新警告:AI「像外星人降临」,而且是我们亲手创造的

9 月 22 日消息,比尔·盖茨近日在一场活动上对人工智能的迅猛进化发出警示。他形容这项技术「极为特殊」,若只把它当作过往技术的延续,「就容易掉以轻心」。

据报道,盖茨称 AI「就像外星人来了」,区别在于,这些「外星人」并非来自外太空,而是人类亲手创造、置入计算机之中的。他还把当下的技术变革形容为「十本科幻小说里的情节同时发生」:传统科幻作品通常只围绕单一突破展开,而 AI 可能同时推动多个领域飞速剧变。

盖茨透露,大约一年前,AI 的进展速度令他震惊,这项技术如今已能完成他年轻时需耗费大量时间才能掌握的编程工作。更进一步,AI 既能编写代码,也能研究代码、查找漏洞,「也可能入侵各类系统」。

但他的担忧不止于技术本身,盖茨明确指出,面对这种指数级进步,社会层面的广泛参与和讨论远远不够,科技行业内部已经在谈风险,但更广大的公众尚未真正进场。在他看来,人类未来走向何方,取决于整个社会如何对待这项技术。(来源:TechWeb)

 

阿里 Qwen4 投入训练

2026 云栖大会上,阿里巴巴公布大模型最新进展。在大语言模型 LLM 领域,Qwen3.8-Max 在编程(Coding)和办公(Cowork)领域表现出色,发布后斩获 Artificial Analysis Agentic 智能体第一、CodeArena 前端编程第一。

据悉,基于下一代架构的 Qwen4 已投入训练,未来 Qwen4.5、Qwen5 等后续版本模型参数将扩展至 5 到 10 万亿。

在多模态领域,Qwen-Image-3.1 性能有望逼近最强 GPT-Image 系列,跻身全球前列;Qwen-Audio-3.1 在 ASR、TTS 以及 Realtime 三个核心语音赛道均位列国际第一梯队、国内第一,超越 Gemini 3.1 TTS 等国际顶尖模型;世界模型 HappyOyster-2.0-Preview 全新亮相,推动世界模型从实验室走向真实可用;视频生成模型 Wan3.0 斩获 Artificial Analysis 文生视频与视频编辑双榜第一。

同时,阿里下一代视频模型也在训练中,拥有更强的生成力、控制力和理解力,将推动 AI 从工具走向创作智能。(来源:新浪科技)

千问发布 AI 手机全栈解决方案

9 月 22 日,据千问大模型消息,千问发布 AI 手机全栈解决方案 Qwen Intelligence,旨在与手机厂商共创,让手机能够完成各类复杂任务。针对手机 Agent 的核心需求,首发的 Qwen Intelligence 提供了三套解决方案,均达到行业 SOTA 水平,分别承接规划、操作和创意。

目前,Qwen Intelligence 已在真实场景落地。(来源:新浪科技)

 

首发 14999 元起:拓竹发布 R1 激光切割机,55W 高功率二氧化碳激光

9 月 22 日消息,拓竹今日正式发布 R1 激光切割机,新品采用 55W 高功率二氧化碳激光,主打自动光路校准、主动振动补偿、三重定位系统,首发售价 14999 元起。

据介绍,这款产品搭载 55W 高功率二氧化碳激光,能够切割木材、亚克力、布料和皮革等材料,可一次切穿 18mm 黑胡桃木胶合板或 20mm 亚克力,厚重材料切口整洁、断面干净。

同时,该产品配合滚轮送料机使用时,可加工最长 3 米的材料,满足家具家居定制、空间设计、广告标牌制作等需求。配备双摄像头、双激光雷达、双编码器等,实现 0.2mm 高定位精度。支持旋转轴加工、透明材料加工、精细件加工和循边切割。

值得注意的是,该产品机身自带触控显示屏,可快速完成校准、寿命检查、故障排查。使用官方材料制作时,R1 可以自动识别耗材类型,无需手动配置参数。搭载贯穿式风道,可将烟雾和颗粒物快速排出,舱内无污染沉积。

此外,该产品还可直连 E1 Pro 空气净化器,拦截烟尘、异味和有害气体,通过 Class 1 激光安全等级认证,使用时无需佩戴护目镜,更不需要特殊工作空间。(来源:IT 之家)

 

OPPO Find X10 系列正式发布,4999 元起

OPPO 22 日召开 OPPO Find X10 系列暨旗舰生态新品发布会,正式发布年度影像旗舰 OPPO Find X10 系列。

系列首发搭载「哈苏超清原相机」,集三 2 亿像素镜头群、新一代 ProXDR 技术、全焦段 8K 视频录制等领先业界的影像能力于一身;抢先搭载新一代 2nm 旗舰芯片天玑 9600 Pro、Find 系列史上最大 8000mAh 冰川电池,以及「超流畅,更懂你」的 ColorOS 17,引领流畅耐用「三久体验」;更有兼具科技感与哈苏气质的时尚外观、支持 95% BT.2020 超广色域的新一代 1nit 明眸护眼屏,以全方位焕新升级,推动旗舰体验再上新高度。

OPPO 首席产品官刘作虎表示:真实还原就是 OPPO 影像的灵魂和最高使命。近年来,OPPO 持续突破光学、算法和显示的能力,引领移动影像发展,最终带来 OPPO Find X10 系列,以「哈苏超清原相机」回应用户的期待。(来源:TechWeb)

日本计划在国际空间站举办 AI 机器人竞赛,最早 2027 年实行

9 月 22 日消息,据《日经》报道,日本计划最早于 2027 年在国际空间站(ISS)举办机器人竞赛。参赛团队将通过 AI 控制机器人完成任务,培养下一代航天工程师。

据报道,该竞赛由「太空 AI 机器人协会(SAIRA)」组织。该协会成立于今年 7 月,旨在通过与大学、公司和研究机构合作,开发太空、AI、机器人等方面技术。

该竞赛最开始将在模拟空间站环境的地面进行预赛,对 AI 模型进行测试。胜出队伍将进入空间站,通过自行开发的物理 AI 模型,控制日本「希望号」实验舱内的球形机器人无人机 Int-Ball2。

市场研究聚合机构 Global Information 数据显示,预计到 2035 年,太空机器人市场规模将达到 124 亿美元,约为 2026 年市场规模的两倍。(来源:IT 之家)

2026-09-23 00:39:09 · 大模型,算力芯片,AI应用,具身智能,自动驾驶,融资,政策监管,OpenAI,Google,Anthropic,字节跳动,阿里巴巴,腾讯,文生视频,语音音频,代码生成,对话助手,多模态,Agent智能体,办公效率,设计创意,强化学习,模型评测,世界模型,模型安全对齐,工业制造,传媒内容,营销广告,AI for Science,招聘HR,基础设施,模型发布,产品更新,合作,财报,榜单评测,开发者生态

10.99 万元起!日产新 N7 这次是真加量还降价

爱范儿

去年 4 月,东风日产 N7 带着 11.99 万元起的价格进入市场时,一度成为合资新能源阵营里颇受关注的一款车。它的空间够大、座椅够舒服,再加上当时不算落后的智能座舱和辅助驾驶配置,让它很快积累了一批订单,月销成功破万。

如今一年多过去,N7 迎来了首次年度改款。

今晚,新 N7 正式上市,共推出 5 款车型,全系限时权益价 10.99 万元起。

从产品本身来看,新 N7 没有大幅调整原有设计,依旧是封闭式 V-motion 前脸+贯穿式灯带,车长还是 4930mm,轴距 2915mm。

比较容易辨认新老车型的地方,在于车顶新增的激光雷达、半隐藏式的门把手,以及新漆色「青柑」。

看到车顶那个激光雷达,我们大概就能猜到新 N7 最大的升级在于辅助驾驶。

除了一颗中长距激光雷达,新 N7 还配备了高通骁龙 8650P 芯片和 29 个高感知传感器。

按照东风日产在发布会上公布的节奏,新 N7 最快将在今年年底通过 OTA 升级 Momenta R7 世界模型,无论是城区、高速,还是乡村小路,都支持车位到车位的辅助驾驶,以及无导航的漫游。

泊车是这次辅助驾驶升级的另一块重点,新 N7 号称支持超过 300 种泊车场景,常规泊车的一把入库率超过 90%。

与此同时,东风日产还为新 N7 带来了全域智能防晕车 3.0 和 AES 自动紧急转向,加减速更加细腻,主动安全能力也要更强。

舒适性依旧是 N7 很重要的一张牌,发布会上有一张 PPT 是这样写的:

世界上有两种汽车沙发,一种是东风日产的,一种是其他的。

新 N7 前排的「AI 零压云毯座椅」配备 49 个智能传感器,能够实时采集乘员的体型数据,自动调节腰托、侧翼和坐垫,还支持 12 点的座椅按摩;后排则新增吸入式通风和加热功能,还多了一块后排控制屏,方便乘员直接调节温度和风量。

价格上,510 Air 版限时权益价 10.99 万元,510 Pro 版 11.99 万元,625 Pro 版 12.99 万元;两款 Max 车型均增加了激光雷达,其中 510 Max 为 12.99 万元,625 Max 为 13.99 万元。

这次升级之外,N7 本身的市场变化也值得一提。

去年 4 月底上市后,它曾经有过一段相当亮眼的上升期,上市 18 天,大定就突破了 1 万辆,随后交付快速爬升,6 月销量达到 6189 辆,两个月后冲至 10148 辆,成为了合资品牌纯电车型里少见的月销过万的产品。

但高点来得快,回落也很快。前期积累的订单和热度逐渐消化之后,N7 没能维持此前的增长节奏。

转折从 9 月开始出现,9 月和 10 月,N7 的月销量回到 6400 辆左右,11 月降至 4016 辆,12 月只剩 1925 辆,然后就再也没有回升,一直维持在千辆水平。

它最初能够快速打开市场的原因很简单,11.99 万元起的价格,换来接近 5 米的车身,宽敞的乘坐空间,以及日产本身擅长的座椅舒适性,再叠加当时已经具备一定竞争力的智能座舱和辅助驾驶能力,放在 2025 年上半年,确实容易被消费者注意到。

但 15 万元级纯电轿车的迭代速度也非常快,过去一年里,激光雷达、辅助驾驶、更强的座舱芯片以及后排舒适配置不断向更低价格带下放,N7 上市初期形成的部分优势,很快被后来者追了上来。

因此我们可以看到,新 N7 这次的调整基本围绕这些变化展开,它保留了原本比较鲜明的空间和舒适性特点,同时也补上了过去一年里变化最快的几项智能化能力。

对于已经经历过一次快速起落的 N7 来说,这次年款更新是一次重新校准产品竞争力的机会。

带轮子的都关注,欢迎交流。 邮箱:tanjiewen@ifanr.com

#欢迎关注爱范儿官方微信公众号:爱范儿(微信号:ifanr),更多精彩内容第一时间为您奉上。

2026-09-22 13:48:33 · 算力芯片,自动驾驶,政策监管,办公效率,设计创意,世界模型,图神经网络,招聘HR,模型发布,产品更新,榜单评测
AI 资讯

D-JEPA: A Decision-Aligned Latent World Model

arXiv cs.LGarXiv:2609.24749v1 Announce Type: cross Abstract: Latent world models predict the consequences of actions, but accurate prediction does not guarantee that latent distance reflects which candidate will execute successfully. We identify a decision-local prediction gap: among the few futures competing for execution, a candidate predicted closer to the goal can produce a worse realized outcome than an available alternative. We introduce D-JEPA, a decision-aligned latent world model that learns decision-relevant relations among candidate futures from executed outcomes. A bounded, permutation-equivariant operator jointly reasons over goal-relative predictive features and ordinal evidence, refining pretrained predictive geometry where action choices are most consequential. Restricted predictor adaptation and a shared ordinal interface extend this alignment across complementary predictive geometries. D-JEPA further realizes the learned decision structure in JEPA-compatible future representations, enabling deployment through native latent-distance planning. Evaluations across latent control, manipulation, pretrained action-producing models, physical robots and autonomous driving demonstrate improved action selection, including 87.89% success on PushT, a 15.04-point average gain on RoboTwin, and a 17-point gain on physical robot tasks. These results establish decision-relevant relational structure as a direct bridge between predictive world modeling and effective control.
2026-09-22 04:00:00 · AI应用,具身智能,搜索RAG,预训练,世界模型,模型安全对齐,招聘HR,论文
AI 资讯

Robot World Models Are Not Invariant to How the Actions Are Written

arXiv cs.LGarXiv:2609.23252v1 Announce Type: cross Abstract: A robot policy is trained with one of two action parameterizations: absolute joint targets, or deltas relative to the current state. The choice is a live engineering decision in robot learning, and a world model conditioned on actions inherits it silently. We show the inheritance is catastrophic. A latent dynamics model trained on one parameterization and handed the identical commanded trajectory written in the other collapses: retrieval degrades by 2.6-13.4x across three robot datasets and two morphologies, goal-conditioned action selection falls from 53% to 15%, and on PushT the two beliefs about the same future are near-orthogonal (cos = 0.067, worst case -0.377), so the predictor does not degrade gracefully, it answers a different question. This is not a distribution-shift artifact in the usual sense: the two encodings are mutually reconstructible at R^2 = 0.996 given the joint input, so no information is lost, and we give the test that separates a valid re-parameterization from a lossy summary or a sensor swap. The test rejected three of the four axes we proposed. The defect lives in the action channel, which the invariance literature for visual models does not examine: work there concerns crops, jitter and camera pose, while the parameterization of the commands goes unaudited. The repair is averaging over the two encodings, and where it goes matters. Averaging the objective restores task performance by itself; averaging the outputs, safe for probabilities by concavity, is not available for direction-valued prediction, where the normalized mean can score below every member of the orbit. What objective-averaging leaves behind is the tail: worst-case agreement stays at 0.78, a disagreement penalty closes it to 0.995, and over a latent rollout it is the difference between a worst case that erodes and one that holds. On PushT, averaging alone does not repair the axis.
2026-09-22 04:00:00 · 算力芯片,AI应用,具身智能,Google,搜索RAG,扩散模型,世界模型,端侧AI,招聘HR,论文
继续滚动加载更多…