🤖 AI 资讯

每日 05:00 更新 · 09-24 · 主站 liuch.name ↗
全部标签 →
筛选标签:智谱 · 返回个性化推荐 · 清空筛选
AI 资讯

Spider Bench: comparing 9 vision models on 2,000 spider photos [P]

Reddit r/MachineLearning

I tested nine vision models on the same 2,000 spider photos. The highest exact-species accuracy was 49.85%. The tasks, predictions, scoring code, and run settings are public.

The setup:

  • Data: 2,000 photos covering 671 species and subspecies, sampled from a filtered collection of research-grade iNaturalist observations. The species list came from a Polish checklist; the photos were taken worldwide.
  • Task: Pick one of 20 scientific names. Each list contains the expected species, up to nine alternatives from the same family, and other-family names to fill the remaining places.
  • Controls: Every model received the same prepared image bytes and the same candidate lists in the same order. Sampling and candidate selection used fixed seeds.
  • Scoring: Matches against the iNaturalist labels, divided by all 2,000 assigned photos. Failed, missing, and invalid answers count as incorrect.

These are the nine high-effort runs used in my write-up:

Model Exact-species accuracy
Gemini 3.8 Flash 49.85%
GPT-6 Astra 47.50%
Claude Fable 5.1 43.10%
Muse Spark 1.3 39.10%
GLM 5.3 Flash 36.75%
GPT-5.6 Sol 33.65%
DeepSeek V4.1 Flash 26.40%
GPT-5.6 Terra 22.80%
GPT-5.6 Luna 21.50%

The top two were separated by 47 photos. Additional runs at other effort settings are included in the repository.

I also grouped predictions by taxonomy. Gemini’s answers matched the expected genus 63.65% of the time and the expected family 93.40% of the time, including exact-species matches in both figures.

Code, frozen tasks, predictions, and results

Benchmark protocol

My write-up with charts and example predictions

submitted by /u/d_kielbasa
[link] [comments]
2026-09-21 10:13:13 · 大模型,具身智能,开源,OpenAI,Google,Anthropic,DeepSeek,智谱,扩散模型,模型评测,招聘HR,榜单评测
AI 资讯

Recognized but Not Produced: A Generation Benchmark for Culturally Specific Kinship Terms

arXiv cs.CLarXiv:2609.26942v1 Announce Type: new Abstract: Current literature evaluates large language models (LLMs) on multilingual kinship understanding using multiple choice benchmarks, treating it as a recognition problem. We instead prompt five open weight LLMs to generate kinship terms in three non Western languages (Hindi, Tamil, and Korean) across two communicative tasks and pair this with a matched option-supported selection baseline. On identical relation language cells, GPT OSS120B selects the correct term in 90.67% of 75 valid cells but produces an accepted term in 36.00% of the corresponding attempts; Llama 3.370B shows the same pattern (77.92% versus 24.24%). Since the four-option condition displays the candidate terms and does not require script production, the difference is interpreted as an evaluation format gap rather than direct proof that lexical knowledge is intact. On explicitly specified L3 prompts, accuracy varies sharply, from GLM-5.1 at 72.29% to Llama-3.370B at 24.24%. The paternal-lineage advantage is language specific; it is large in Hindi but weak or reversed in Korean, while Tamil shared-term pairs provide a control for measurement variation. These results show that culturally specific kinship generation remains difficult even when the relationship is explicitly stated and motivate generation-based evaluation alongside multiple-choice testing.
2026-09-24 04:00:00 · 大模型,Meta,智谱,扩散模型,强化学习,模型评测,提示工程,招聘HR,论文

WorkspaceBench: Evaluating Interpretability Methods for the Global Workspace

AI Alignment Forum

TL;DR

  • We introduce WorkspaceBench, a set of evaluations for how well an activation-to-text tool can read the contents of the “global workspace” of a model, i.e. the intermediate variables during a forward pass.
  • The benchmark comprises 3,356 questions across 27 eval families, spanning topics in safety, logical reasoning, and multihop computation, with a subset for single-token-output tools.
  • A desirable property of good interpretability techniques is minimal hallucinations, so WorkspaceBench also provides a hallucination-focused eval.
  • WorkspaceBench was developed for Qwen-3.6-27B and we expect it to work on larger models, but it may need to be adapted for smaller or weaker models to ensure the models can do the tasks.
  • Our goal is to create an eval that could identify a good multi-token J-lens. We open-source our benchmark here.



Introduction

Astra can do a concerning amount with no chain of thought. This is bad for CoT monitorability and makes interpretability essential to actually understanding what is going on. A key goal of interpretability is to understand intermediate variables that a model uses to compute its answers. The intermediate representations that models store in their global workspaces contain useful information that can help us decode their intentions, beliefs, algorithms, and thought processes. However, we don’t currently have a good way to measure whether an interpretability tool recovers such variables correctly. We made a benchmark to test how well an activation-to-text tool can read the contents of a model’s global workspace. We think overall performance on WorkspaceBench is a good proxy for practical utility in model auditing, and we hope that new interpretability tools can be evaluated on WorkspaceBench upon release to help determine their capabilities.


Why has no one made a WorkspaceBench before?

Interpretability tools are hard to evaluate, in part because a tool can score well without reading the workspace. For example, a tool that simply inverts activations back into the input text (text inversion) lets an agent infer an intermediate from the prompt rather than from the activations. Our benchmark doesn't fully rule out shortcuts like this, but we address three problems that make evaluating interpretability tools difficult:

  1. There’s no ground truth: we don’t know what is actually in a model’s global workspace, so it’s hard to tell what should count as surfacing workspace content.
    1. How we fix this: We design tasks such that we can be reasonably sure the model needs to use a certain intermediate to compute the answer. We also tailor questions to the model’s capability levels to ensure it can consistently deliver the correct answer.
      1. For some evals (e.g. association and directed modulation) we can’t be absolutely sure the model is thinking about these concepts. However, many tools seem to be able to surface this type of information, which suggests these representations are often held in the workspace. Therefore, we do not necessarily insist that it is possible to saturate the benchmark on these tasks, but higher scores are still directly indicative of a tool’s capabilities
  2. Models often don’t have sophisticated enough computations to have strong representations of intermediates
    1. How we fix this: Recent open source models are increasingly capable of having strong workspace representations, so we use Qwen3.6-27B to test the various interpretability tools on surfacing interesting intermediates.
  3. It is unclear how to weigh the pros and cons of different activation-to-text methods as workspace readers: for example, J-lens is single token but reliable, while NLAs are expressive but prone to confabulation.
    1. How we fix this: We measure WorkspaceBench accuracy scores vs hallucination rates to study such tradeoffs in different tools


Background

We evaluate the following different activation-to-text methods on how well they extract intermediate variables in Qwen-3.6-27B’s workspace:

  • Single-Token Readers: methods below take in a single activation to give back a ranked list of top tokens in the model’s vocabulary.
    • Logit lens: a training-free method that applies the unembedding matrix directly to a model’s residual stream.
    • J-lens: uses the Jacobian to capture the mean linearized effect of an activation to produce tokens in the vocabulary. Requires fitting a linear map from the final layer to the readout layer via backprop and averaging the Jacobian over contexts/positions.
    • R-lens: a drop-in replacement for J-Lens that uses layer-wise relevance propagation (LRP) to surface concepts earlier than J-Lens in a model’s workspace. Similar cost to J-Lens.
    • Tuned lens: a variant of logit lens that learns an affine trans
2026-09-23 06:58:59 · 大模型,算力芯片,AI应用,开源,OpenAI,Google,Meta,阿里巴巴,智谱,Agent智能体,推理思考,搜索RAG,Transformer,扩散模型,模型评测,向量数据库,提示工程,模型安全对齐,端侧AI,招聘HR,网络安全,榜单评测,论文
AI 资讯

Kyutai Releases Voice of Reason: A Speech-Native Model that Solves Spoken Math with Reinforcement Learning

MarkTechPost

Kyutai has released Voice of Reason, 2 open-weight speech-to-speech models that solve math problems out loud. Both start from GLM-4-Voice-9B and add supervised fine-tuning (SFT) and reinforcement learning (RL). There is no transcription step and no separate text LLM in the loop. On spoken GSM8K, accuracy climbs from 27.3% for the base model to 77.1%.

Is it deployable? Yes, for self-hosting. Kyutai ran both BF16 checkpoints on a single H100. You also need the GLM-4-Voice repo for its speech tokenizer and decoder. Weights inherit the GLM-4-Voice license, and no Hugging Face inference provider hosts them yet.

Why Speech Models Lag on Math

Cascaded pipelines (speech-to-text, text LLM, text-to-speech) still lead on reasoning. However, each stage adds latency, and the pipeline loses paralinguistic cues like tone. Speech-native models must emit audio at regular intervals to stay interactive. That limits how many hidden reasoning tokens they can afford.

Base GLM-4-Voice scores 27.3% on GSM8K. The earlier STITCH method raised that to 58.7% by adding reasoning chunks. The research team call their work the first application of RL to math reasoning in speech-native models.

How the Training Works

GLM-4-Voice interleaves its output: 13 text tokens, then 26 audio tokens, repeating.

  • Stage-1 SFT: Training uses 150,616 problems from Orca-Math. Qwen3-235B rewrote each problem for speech. Kyutai’s DSM TTS then voiced them in many voices. SFT alone lifts GLM-4-Voice from 27.3% to 61.7%.
  • Stage-2 RL: For each spoken question, the model samples 4 replies at temperature 0.9. A judge, Qwen3-235B-A22B-2507, scores the decoded text with a binary reward. The judge never sees the reference answer. On 100 hand-checked cases, it agreed with humans 88% of the time.

Rewards are centered within each group, forming a group-relative REINFORCE objective. It is related to GRPO but drops PPO clipping and KL regularization. Training ran on 16 H100 GPUs, with 1,500 RL updates.

2 design choices matter most:

  • Temperature correction: Logits are divided by the sampling temperature before the log-softmax in the loss. Without it, GSM8K collapsed from 65.5% to 12.3%.
  • Audio-token merging: At each audio position, all audio-vocabulary probabilities are summed into 1 abstract token. The loss asks only whether audio came next, not which audio token. The paper proves this estimator is unbiased and lower-variance under a value-invariance assumption.

Interactive Explainer

&&&

The 2 Released Checkpoints

  • glm-4-voice-of-reason-9b answers directly, with no extra reasoning tokens. Any step-by-step working is spoken aloud.
  • glm-4-voice-of-reason-stitch-9b writes silent 100-token reasoning chunks between spoken blocks. Kyutai says later chunks are generated while earlier speech plays, so thinking adds no extra latency. In the STITCH-R layout used here, the first reasoning chunk precedes the first spoken block.

Results

ModelParamsGSM8K (%)
PersonaPlex (full-duplex)8B3.2
GLM-4-Voice9B27.3
STITCH (Chiang et al.)9B58.7
Voice of Reason9B65.5 ± 1.1 (70.3 released)
Voice of Reason (Stitch)9B74.8 ± 1.1 (77.1 released)
Qwen2.5-Omni (text output)7B84.7
Qwen3-Omni (text output)30B94.6
Cascaded ASR-LLM-TTS-ASR31B LLM95.7

Paper scores use top-k 50 decoding, averaged over 3 seeds. Removing top-k gives 70.3% and 77.1%. The released checkpoints correspond to these runs. The omni and cascaded systems are larger top lines, not matched comparisons.

Other findings:

  • Gains survive in real speech: Transcribed with Qwen3-ASR-1.7B, the Stitch model scores 72.0 ± 1.9%.
  • Naturalness holds: UTMOSv2 moved from 4.067 to 4.069 (direct) and 4.174 to 4.164 (Stitch) after RL.
  • Gains do not come from longer answers: RL cut the direct model’s average reply from 41.9 to 36.4 seconds. Stitch reasoning tokens rose only from 167 to 176.
  • RL helps most with little data: With 10% of SFT data, a longer RL run reached 58.5%. SFT alone scored 43.9%.
  • General knowledge dips: Spoken TriviaQA fell from 40.6% to 34.0% for the direct model. The authors attribute this mainly to full-data SFT, not RL.
  • Contamination check: The team dropped AddSub, MultiArith, SingleEQ and SVAMP from evaluation. Of 678 checked questions, 54.0% overlapped with Orca-Math at the paraphrase level.

Evaluation audio came from GPT-4o-mini-TTS, a different TTS system than the training audio. GPT-4o served as the evaluation judge.

Key Takeaways

  • Kyutai’s RL recipe lifts GLM-4-Voice from 27.3% to 77.1% on spoken GSM8K.
  • The direct model reaches 70.3% without reasoning tokens, beating STITCH’s 58.7%.
  • Temperature correction is critical: removing it crashed accuracy to 12.3%.
  • Speech naturalness holds after RL; TriviaQA drops, mostly from SFT.
  • Both 9B checkpoints are open on Hugging Face and run on 1 H100.


Check out the Paper, the direct model and the Stitch model. All credit goes to the researcher of this project. Also, feel free to follow us on 

2026-09-23 06:33:18 · 大模型,算力芯片,AI应用,具身智能,开源,OpenAI,Google,阿里巴巴,智谱,语音音频,推理思考,搜索RAG,扩散模型,强化学习,微调蒸馏,招聘HR,榜单评测,论文

Shut up and calculate: Jev's new AI primitives for coders

The RegisterTypeSafe’s Jev, launched last week, behaves differently from the standard frontier models that everyone is now used to and has therefore quickly attracted plenty of scrutiny and interest as developers explore how to work with this technology. Jev’s output is more restricted than the chatty ask-me-anything approach of other LLM-powered chatbots. Basically, Jev is a classifier with brains. When given a set of data, it returns predefined “typed” decisions that the developer decided on beforehand, along with probability distributions and, for some query types, a confidence level that can then be used to make decisions and automate processes. As Brian Eno has often said, greater limitations frequently spur greater creativity. In the week since Jev’s release, developers have flocked to the service, at least to test it out. FPV Ventures partner Nikunj Kothari set up a site called Jevable to collect prototype Jev apps posted on X. Jevable hosts developer tools and productivity utilities, some frivolous. One app translates plain English into “unnecessarily fancy prose.” Another allows the user to add an “Urgency” column to spreadsheet rows, which Jev can then rate from “no follow-up needed” to “urgent.” Another app gives people a virtual way to see what clothes would look like on them. In a mockup, Jev reads the transcript, consults a list of clothing and changes the outfits on an image of the user in real time. Cost is $0.0011 per decision, and it takes Jev ~620 ms to show how awful you will look in that Hawaiian shirt you're thinking of buying. Gaming hacks are another favorite. There are apps for speeding through Doom, Tetris, League of Legends, Settlers of Catan, and chess (where Jev lost to the GLM 5.3 open-weight model but was far cheaper to run). Perhaps the most extreme expression of coder curiosity has been to use Jev to emulate a CPU, which is useful mostly in terms of entertaining the geek fixation with recursion. To this end, someone coined the term “JevOps” to describe the “end game” of “running all code” on Jev-based virtualization. “JevOps” is still only a meme, not a discipline. For now. What devs can do with Jev Jev has been likened to a smart function call. You give it an input and it returns a defined output, using a structured decision model. TypeSafe calls it a “System One” model, one designed to make fast, highly structured decisions. Users submit data to an API for analysis, and can interrogate their data with three possible types of questions: A Choice, a Score, or a “Noul” (a probability score of truthfulness between 0 and 1), which are all Jev primitives. Jev provides confidence levels with the answers it returns to the Choice and Score inquiries. Because Jev does not generate free-form text, the user must explicitly define the schema and candidate options beforehand for Choice and Score queries. So using Jev requires some old-school manual configuration ahead of time, compared to the free-wheeling prompting required to generate LLM responses. The developer must think about what they want to accomplish in terms of these questions, perhaps by breaking up their task into a series of them. TypeSafe’s documentation recommends using a question like “Does this message convey urgency?” over a more open-ended question like “Analyze this message and determine the best course of action.” The structured response brings a number of advantages. One is that it means Jev doesn’t have to contemplate how to structure the answer for the user. TypeSafe says Jev can return an answer in as little as 150 ms, fast enough for some interactive and real-time applications (hence the coder fascination with using Jev to speed through games). Likewise, Jev’s service is considerably cheaper than standard frontier LLMs – input tokens are $0.042 per million tokens and there is no charge at all for output tokens. “If many useful semantic judgments were affordable within our application’s response-time budget, what would we design differently?” asked TypeSafe technical staff member Eugene Shvarts, in a GitHub README page for an LLM prompt to evaluate Jev’s usefulness for any given project. Possible workloads that might benefit from the Jev format could include job recruiting, as well as screening scientific papers to ensure they have all the required sections. It could manage software that otherwise would require a human in the loop. Jev creator Diogo Almeida suggested using Jev to route tools, and MCP calls for other models. How smart is Jev? “How intelligent is this model? That’s what I’m not able to figure out,” said AI YouTube personality Mo Bitar in a video. The demos are fun, but how accurate are the results? Jev is an LLM, but thus far, we have limited insight (or benchmarks) into Jev’s intelligence. “I know it’s fast. I know it’s cheap, but is it good?” Bitar suspects it would work best with static self-contained training sets, such as for e-mail spam or online shopping. He said predictive work, like suggesting stock picks, may not be a smart use of Jev. Digging a bit deeper was engineer Archer Hume, who reported how he probed Jev with 10,000 API calls. (TypeSafe runs Jev as an API-based service, though others have built several open source classifiers similar to Jev itself, such as Jeff and Nimble.) Hume surmised that Jev has the deep knowledge of an LLM, but it doesn’t try to predict the text it needs to feed back to the user. Rather, it calculates decision probabilities directly from the model's internal representations. Nonetheless, others see Jev as a move in the right direction, namely beyond the loquacious and sometimes deceptive interface of today’s super-powered LLMs. “It’s time to move past the idea that what we need is smarter frontier models. What we need is smarter systems,” noted Adam Jacob, CEO of the agentic software provider Swamp Club, in an X message. Intelligence is fine, but correct, repeatable results are also necessary. Anthropic researcher Andrej Karpathy agreed that Jev carves out a new space in the emerging AI market. Jev “revealed latent demand [...] that was under-invested into because of a race to higher intelligence,” he wrote on X. The demand that Jev may address is for a single-token LLM with low latency and “acceptable intelligence,” he wrote. ®
2026-09-23 07:27:00 · 大模型,算力芯片,AI应用,具身智能,开源,Google,Anthropic,智谱,对话助手,Agent智能体,模型评测,提示工程,端侧AI,招聘HR,开发者生态
AI 资讯

[程序员] 兄弟们, GLM Coding Plan 和 Kimi Coding Plan 如何选择?

V2EX

不讨论别的,只讨论这 2 个:

  • glm max 方案(¥1078/月)
  • kimi max 方案(¥699/月)

看了评分,两款模型算是各有千秋。全栈开发占了我 85%以上的任务。我纠结的点: kimi k3 参数规模大,并且支持多模态,这很有用,我通常会通过 chrome-devtools mcp 连接到 Chrome 进行页面的错误和样式排查修改,但是 kimi k3 的推理速度和输出太慢了。 glm 5.3 参数规模没有这么大,但是据说在编成上要优于 kimi k3 ?而且速度也会比较快一些。

有没有实际深度使用的老哥,来给我推荐下,不考虑差价,更关注质量。

2026-09-24 03:51:17 · 大模型,月之暗面,智谱,多模态,Agent智能体,推理思考,招聘HR

智谱把 ZCode 开源了,然后呢?

· 大模型,开源,智谱,招聘HR

【钛晨报】“十五五”民政工作怎么干?四大重点任务,养老排在第一位;马斯克预测未来世界:20年后可能有1000亿台人形机器人;高瓴创投原合伙人严文韬正式入职DeepSeek

钛媒体

(本文作者为 钛媒体官方账号,钛媒体经授权发布)

【钛媒体综合】9月23日,国务院新闻办举行“开局起步‘十五五’”系列主题新闻发布会。民政部部长李常官介绍,“十四五”时期,中国兜底民生保障全面加强,常态化保障3936万名低保对象、488万名特困人员、57万名孤儿和事实无人抚养儿童基本生活,“两项补贴”惠及1198万名困难残疾人和1675万名重度残疾人。养老服务保障水平持续提升,基本养老服务制度全面建立,5300多万名老年人享受老年人补贴,养老服务机构和设施达到39.5万个。专项社会服务能力稳步增强,婚姻登记实现“全国通办”,群众办事便利度显著提升,公益性殡葬设施短板加快补齐,“身后事”办理让家属更加省心、暖心。相关社会治理创新发展,83万余家社会组织在经济社会发展中发挥积极作用,“乡村著名行动”深入实施,规范命名乡村地名92.7万条。

“十五五”时期,中国将持续推进普惠性、基础性、兜底性民生建设。重点推进四方面工作。

一是着力增进老年人福祉。深入实施积极应对人口老龄化国家战略,健全城乡三级养老服务网络,加大养老机构护理型床位建设,推动养老机构护理型床位占比达到73%,加强失能失智老年人照护服务,因地制宜发展农村养老服务,保障养老服务质量安全,推动全体老年人享有基本养老服务。同时,大力发展银发经济,促进老年人社会参与,加强老年人权益保障,建设老年友好社会。

二是提升社会救助和社会福利水平。健全科学精准认定社会救助对象的制度机制,加强动态监测和分层分类救助帮扶。完善困境儿童福利保障体系,加强流动、留守儿童关爱保护,推动儿童福利机构“开门办院”,让更多困境儿童共享机构专业服务资源,减轻家庭负担。完善残疾人社会保障制度和关爱服务体系,加强重度残疾人托养照护服务,加快发展康复辅助器具产业。

三是优化社会事务管理服务。巩固优化婚姻登记“全国通办”,深化婚俗改革,倡导文明健康婚俗礼仪。强化殡葬行业公益属性,建立健全基本殡葬服务制度,建立殡葬行业跨部门综合监管机制,持续推进公益性殡葬设施建设,深化殡葬移风易俗。

四是加强和创新社会治理。提升地名管理服务法治化、规范化水平,推动区划地名历史文化传承保护工作。优化社会组织结构布局,健全监管机制,引导社会组织更好发挥积极作用。促进和规范慈善事业发展,持续实施“阳光慈善”工程,壮大慈善规模,提升慈善组织公信力。

钛媒摘声:

大模型是历史上发展最快的技术浪潮,更强更通用。当前,Agent的进化,正从对话到助手,从被动到主动,从个体到群体。Agent正发展为Agent经济,而这也是token经济。智能体正取代人类成为互联网主角。五年后非人类流量将是人类流量的1000倍。

——源码资本投资合伙人、美国国家工程院外籍院士 张宏江

当出现安全隐患时,AI公司无需达成全行业协议即可放慢开发速度,市场压力将使“对齐”(即确保AI系统遵循用户意图)成为一种竞争优势。每家实验室都有责任,也有动力按照安全训练模型所需的速度推进。我的看法是,信任和对齐能力正迅速成为区分不同AI智能体和模型的最重要能力。任何不重视对齐的实验室都将落后。

——Meta首席执行官 马克·扎克伯格

国内公司:

高瓴创投原合伙人严文韬正式入职DeepSeek

9月23日,高瓴创投原合伙人严文韬已正式加入DeepSeek,出任CFO。公开资料显示,这位被梁文锋选中的大将出生于1991年,毕业于复旦大学。2013年至2020年间,他先后任职于腾讯投资、H Capital,2020年加入高瓴创投,后晋升为合伙人。严文韬过往参与投资的代表项目包括字节跳动、智谱、MiniMax、小红书、微牛、极兔等。

闲鱼公布调查结果:“涉未成年人淫秽”系不实消息,已就引流行为报案

9月23日,闲鱼调查结果公布:经全面清查,在平台公开展示信息中未发现淫秽信息,更不存在涉未成年人淫秽信息;近期媒体报道中涉及的违规聊天截图,经核实来自其他平台,并非发生在闲鱼,闲鱼已就相关事件向公安机关报案。面对跨平台引流等行业性难题,闲鱼表示,将全力履行平台主体责任,主动配合各级主管部门,持续升级技术识别能力,加大人工巡查力度,同时倡议,各互联网平台联手建立针对黑灰产的反引流联盟,以技术手段和多平台协同,阻断利用网络平台为违法犯罪引流的行为。

豆包工作功能更新,任务模式新增“目标”和“计划”模式

9月23日,豆包工作宣布上新,任务模式新增“目标”和“计划”两种模式,此外支持任务队列、Markdown文件编辑功能、新增深色模式。目前,以上功能已在豆包工作电脑端全量上线。

腾讯WorkBuddy企业版发布办公套件化升级最新进展,管理员统一管控Credit用量

9月23日,腾讯WorkBuddy企业版发布套件化升级最新进展,腾讯文档、乐享、网盘、安全与效能平台及AI设计智能体Ardot首批接入。企业按原价格获五大产品权限,实行一个订阅、一个Agent底座、一个管理后台;网盘由5GB/人扩至50GB/人,各端共享账号、资产与上下文,管理员统一管控Credit用量。套件以Agent Harness统一供能,文档转长期记忆、乐享做知识治理、Ardot精修设计。自2026年3月上线,WorkBuddy已迭代50余版,覆盖政务、教育、零售、金融等50多行业。

网易云音乐鸿蒙版正式上线

9月23日,网易云音乐鸿蒙版全面上线,功能体验更完整,核心听歌体验、社区互动体验全适配;同时完成手机、折叠屏、平板多终端适配,用户可无缝体验跨端听歌。据悉,鸿蒙版APP由网易云音乐与鸿蒙深度合作联合开发,8月底上线尝鲜内测版。过去3周,双方根据用户反馈,快速迭代8个版本,上新具体功能1000+。同时,网易云音乐鸿蒙版特别定制鸿蒙专属“沉浸光感”播放器,融合鸿蒙星环与网易云音乐经典的黑胶播放器元素。

国外企业:

马斯克预测未来世界:20年后可能有1000亿台人形机器人

9月23日,特斯拉CEO埃隆・马斯克接受央视财经专访。谈及机器人,他展望未来美好图景:每个人都能拥有专属机器人,它们可以照料年迈的父母,看护孩童,还能担任孩子的一对一私教,承担各类工作。未来世界,一个人可以操控成百上千台,甚至上万台实体机器人和数字智能体。“我的预测是十年内至少有10亿台人形机器人;未来15年或许达到100亿台;未来20年可能达到1000亿台。”

SpaceX据悉停止猎鹰9号2028年以后预订,业内正掀起运力抢购热潮

9月23日,据报道,消息人士称,SpaceX已停止接受2028年以后的猎鹰9号火箭预订。政府官员和业内人士警告,随着猎鹰9号退出市场,火箭发射运力可能在2030年前出现供不应求的局面。一些公司正自行研发火箭,或者考虑收购一家火箭公司,以保证自己的发射日程。现有的发射商也在抓紧扩大投资,以承接SpaceX外溢的订单。

苹果出手限制“摇一摇”广告

9月23日,大量iPhone用户反馈,苹果在最新发布的iOS 27.2 Beta 2测试版系统中,针对中国区用户悄然新增了一项名为“Restrict Motion Data”(限制运动数据)的设置选项。该功能位于“设置—隐私与安全—运动与健身”目录下,开启后用户可手动选择需要限制的应用,被加入名单的App将无法获取加速度计、陀螺仪等运动传感器数据的权限,从而从系统底层切断“摇一摇”开屏广告的触发源头。

实测发现,iPhone在升级到iOS 27.2 Beta 2版本后,AppStore必须登录国内ID才能在设置里看到“Restrict Motion Data”选项,并启用该功能,而启用后重新切换回国外ID功能就会失效,此前用国区账号设定的限制名单也会同步消失。也就是说,这是苹果针对中国市场“特供”的一项用户体验保护措施,功能跟着账号走,而非跟着设备走。 

三星与KT和SK Telecom携手,为韩国AI RAN项目提供支持

9月23日,三星电子今日宣布,已与韩国电信(KT)和SKTelecom签署合同,为其在韩国科学技术信息通信部(MSIT)“超人工智能网络”计划下的人工智能无线接入网(AIRAN)项目提供支持。三星将分别担任KT的全球独家供应商和SKTelecom的主要供应商。这些项目计划于2026年10月启动,将在从造船厂到石化设施等各种工业环境中部署5G独立组网(SA)专用网络,以验证AIRAN能力并为未来的部署生成现实世界的见解。

政策风向:

央行:9月28日至10月8日开展隔夜逆回购操作,每日操作量不超过10000亿元

9月23日,央行公告,为更好匹配银行体系短期流动性需求,中国人民银行将在9月28日至10月8日开展隔夜逆回购操作,采用固定利率、数量招标,每日操作量不超过10000亿元。

央行:9月24日将开展8000亿元MLF操作,期限为1年期

9月23日,央行发布9月中期借贷便利招标公告称,9月24日,中国人民银行将以固定数量、利率招标、多重价位中标方式开展8000亿元MLF操作,期限为1年期。

五方面重点发力,中国将进一步优化婚姻管理服务

9月23日,在国务院新闻办公室今天举行的“开局起步‘十五五’”系列主题新闻发布会上,民政部副部长舒惠好介绍,“十五五”时期,民政部门将聚焦群众需求,进一步优化婚姻管理服务,在以下五个方面重点发力:

一是提升登记服务水平。完善全国婚姻基础信息库,提升数据质量和信息核验效率,让“全国通办”运行更加顺畅。出台男女双方均非内地居民的中国公民在内地办理婚姻登记办法,进一步规范和便利港澳台居民、华侨来内地办理婚姻登记。

二是拓展辅导服务供给。健全婚姻家庭辅导服务体系,推动服务资源向基层社区延伸、向线上平台拓展。鼓励各地引入更多专业力量,为群众提供婚前辅导、婚姻家庭关系调适等全链条服务。

三是优化登记场所建设。推进婚姻登记机关规范化、标准化、便利化、信息化、专业化、人文化“六化”建设,常态化开展结婚颁证、集体婚礼等特色服务,增强婚姻登记的仪式感和神圣感。

四是培育文明婚俗风尚。持续深化婚俗改革,着力破除大操大办、高额彩礼、低俗婚闹等陈规陋习,弘扬文明简约的婚俗新风。

五是规范婚介行业发展。联合相关部门开展整治婚介机构乱象专项行动,严厉打击虚假宣传、诱导消费、婚托婚骗等违法违规行为。完善婚介机构监督管理的政策措施,建立健全行业监管长效机制。支持各地发展公益婚恋服务平台,为青年提供交友渠道,助力婚介行业健康有序发展。

中国将适度超前、系统推进新一代通信网建设,推动算力设施扩容提质

9月23日,“十五五”时期,中国将把握新一代通信网络建设的战略机遇,适度超前、系统推进新一代通信网建设。工业和信息化部副部长余晓晖表示,要坚持应用牵引、适度超前、系统推进新一代通信网建设,推进宽带网络向双万兆演进,推进低轨卫星互联网系统建设,统筹优化国际海陆网络布局,推动算力设施扩容提质,强化算网协同和算力互联,更好支撑一体化算力网建设。

股市行情:

恒生指数公司推出恒生半导体产业指数等八条新指数

9月23日,恒生指数公司推出恒生半导体产业指数等八条新指数。

山东路桥:控股股东及一致行动人拟增持4.5亿至9亿元股份

9月23日,山东路桥公告称,公司控股股东高速集团及其一致行动人高速投资控股拟自公告披露之日起6个月内,以专项贷款和/或自有资金通过集中竞价方式增持公司股份,增持总金额不低于4.5亿元且不超过9亿元。其中,高速集团增持金额不低于3亿元且不超过6亿元,高速投资控股增持金额不低于1.5亿元且不超过3亿元。本次增持不设价格区间。

奥联电子:控股股东将变更为骏图天泽,股票复牌

9月23日,奥联电子公告称,公司股票自2026年9月24日开市起复牌。控股股东瑞盈资产拟将所持16.20%股份协议转让给骏图天泽,另将5%股份转让给衢州信安广合。交易完成后,控股股东将变更为骏图天泽,实控人变更为陈扬。

行云科技:全资子公司签订8.72亿元智算资源租赁服务合同

9月23日,行云科技公告称,公司全资子公司长沙湘树云科技有限公司与VE客户签署《智算资源租赁服务合同》,湘树云向VE客户提供算力服务,协议服务期限为5年,含税总金额为8.72亿元。本次合同履行期限较长,收入将分期确认,存在双方因经营情况变化、财务状况恶化等丧失履约能力的风险。目前公司对应服务器的采购工作已完成,正在接收验收中,预计在2026年9月30日前完成对VE客户的交付。若合同顺利实施,预计对公司未来的经营业绩产生一定影响。

其他重要内容:

经合组织上调2026年全球经济增速预期至2.9%

9月23日,当地时间23日,总部位于法国巴黎的经济合作与发展组织(经合组织)发布最新一期中期经济展望报告,预计2026年全球经济增速为2.9%,较今年6月预测值上调0.1个百分点;2027年全球经济增速预计为3.0%,较6月预测值下调0.1个百分点。 报告显示,在中东地缘冲突带来持续负面影响的背景下,全球多数经济体仍展现出韧性。较为充足的石油库存、海湾地区以外的增量供应,叠加各国政府的定向支持政策,有效对冲了多重下行风险。同时,AI相关产业的持续景气也拉动了投资、生产和贸易增长。 报告预计,二十国集团国家总体通胀率今年将小幅上行至4.1%,2027年伴随能源价格回落,整体通胀率将下降至3.6%,但核心通胀回落节奏仍然偏慢。

未来四年“双一流”高校本科招生数还将扩容7.6万人

9月23日,教育部发展规划司

2026-09-23 23:20:00 · 大模型,算力芯片,AI应用,具身智能,自动驾驶,融资,政策监管,Meta,字节跳动,腾讯,华为,DeepSeek,xAI,智谱,对话助手,Agent智能体,办公效率,设计创意,医疗健康,金融,教育学习,扩散模型,模型安全对齐,政务,工业制造,零售电商,传媒内容,营销广告,招聘HR,模型发布,产品更新,收购并购,合作,财报,开发者生态

Opinion | Why A.I. Is Dangerous for Science - The New York Times

Google News AI (英文)Opinion | Why A.I. Is Dangerous for Science  The New York Times
· 大模型,Google,智谱,招聘HR
AI 资讯

Diffusion Drafts, AR Verifies: Accelerating Document OCR with Self-Speculative Decoding

arXiv cs.CLarXiv:2609.26638v1 Announce Type: new Abstract: Autoregressive OCR vision-language models accurately convert document images into text and structured markup, but require one sequential decoding step per output token, limiting inference speed. Unlike open-ended text generation, OCR outputs are strongly grounded in the input image, making diffusion-based parallel generation promising. However, when several tokens are predicted in one diffusion step, each is predicted before the others are known. Committing them directly can therefore introduce errors. We therefore introduce GravityOCR, a parameter-shared AR-block-diffusion model jointly trained for parallel drafting and causal AR verification. Verifying drafts before commitment lets the model commit multiple output tokens per round without a separate drafting network. The causal AR path also enables GRPO with sequence- and structure-level OCR rewards, avoiding diffusion-trajectory likelihood estimation while updating the shared drafter parameters. On OmniDocBench v1.6, AR-path GRPO improves the Overall score from 94.92 to 95.16 without reducing diffusion drafting efficiency, while the final model remains close to the original GLM-OCR score of 95.48. In an SGLang serving deployment, GravityOCR commits an average of 9.7 output tokens per forward pass and achieves a $3.94\times$ decode-only speedup on region crops and a $1.32\times$ end-to-end page-processing speedup over AR decoding.
2026-09-23 04:00:00 · 大模型,算力芯片,AI应用,Google,智谱,搜索RAG,扩散模型,强化学习,端侧AI,论文
AI 资讯

Provable Anytime Ensemble Sampling Algorithms in Nonlinear Contextual Bandits

arXiv cs.AIarXiv:2510.10730v3 Announce Type: replace-cross Abstract: We provide a unified algorithmic framework for ensemble sampling in nonlinear contextual bandits and develop corresponding regret bounds for two most common nonlinear contextual bandit settings: Generalized Linear Model Ensemble Sampling (GLM-ES) for generalized linear contextual bandits and Neural Ensemble Sampling (Neural-ES) for neural contextual bandits. Both methods maintain multiple estimators for the reward model parameters via maximum likelihood estimation on randomly perturbed data. We prove high-probability frequentist regret bounds of $\widetilde{\mathcal{O}}(d^{3/2} \sqrt{T} + d^{4})$ for GLM-ES and $\widetilde{\mathcal{O}}(\widetilde{d}^{3/2} \sqrt{T})$ for Neural-ES, where $d$ is the dimension of feature vectors, $\widetilde{d}$ is the effective dimension of a neural tangent kernel (NTK) matrix and $T$ is the number of rounds. The regret bound of GLM-ES matches the state-of-the-art result of randomized exploration algorithms in generalized linear bandit setting. In the theoretical analysis, we introduce techniques that address challenges specific to nonlinear models. Practically, we remove fixed-time horizon assumption by developing anytime versions of our algorithms, suitable when $T$ is unknown. Finally, we empirically evaluate GLM-ES, Neural-ES and their anytime variants, demonstrating strong performance. Overall, our results establish ensemble sampling as a provable and practical randomized exploration approach for nonlinear contextual bandits.
2026-09-23 04:00:00 · 大模型,智谱,扩散模型,微调蒸馏,论文
AI 资讯

AgentHazard: A Benchmark for Evaluating Harmful Behavior in Computer-Use Agents

arXiv cs.AIarXiv:2604.02947v2 Announce Type: replace Abstract: Computer-use agents extend language models from text generation to persistent action over tools, files, and execution environments. Unlike chat systems, they maintain state across interactions and translate intermediate outputs into concrete actions. This creates a distinct safety challenge in that harmful behavior may emerge through sequences of individually plausible steps, including intermediate actions that appear locally acceptable but collectively lead to unauthorized actions. We present \textbf{AgentHazard}, a benchmark for evaluating harmful behavior in computer-use agents. AgentHazard contains \textbf{2,653} instances spanning diverse risk categories and attack strategies. Each instance pairs a harmful objective with a sequence of operational steps that are locally legitimate but jointly induce unsafe behavior. The benchmark evaluates whether agents can recognize and interrupt harm arising from accumulated context, repeated tool use, intermediate actions, and dependencies across steps. We evaluate AgentHazard on Claude Code, OpenClaw, and IFlow using mostly open or openly deployable models from the Qwen3, Kimi, GLM, and DeepSeek families. Our experimental results indicate that current systems remain highly vulnerable. In particular, when powered by Qwen3-Coder, Claude Code exhibits an attack success rate of \textbf{73.63\%}, suggesting that model alignment alone does not reliably guarantee the safety of autonomous agents.
2026-09-23 04:00:00 · 大模型,算力芯片,AI应用,Google,Anthropic,阿里巴巴,DeepSeek,月之暗面,智谱,代码生成,Agent智能体,模型评测,模型安全对齐,招聘HR,论文
AI 资讯

A2M: Trace-Optimized Agent Hijacking in the MCP Ecosystem

arXiv cs.AIarXiv:2609.26761v1 Announce Type: cross Abstract: Agents using the Model Context Protocol (MCP) rely on semantic matching to select tools from third-party servers, exposing a semantic supply-chain risk through attacker-controlled metadata and outputs. We introduce A2M (Attraction-to-Manipulation), a two-stage black-box framework for hijacking MCP agents. The Attraction phase optimizes tool metadata to increase invocation probability; the Manipulation phase uses execution traces to refine adversarial tool returns that steer agents toward attacker-desired outcomes. On LiveMCPBench, direct attacks optimized and evaluated on GLM-4.6 achieve a macro-average malicious tool invocation rate of 93.6% across four scenarios, increase weighted token costs to 32.4$\times$ the benign baseline under Cognitive Denial of Service, and attain a mean attack success rate of 74.4% across Information Exfiltration, Environment Integrity Compromise, and Reasoning Derailment. Transfer to four other models without re-optimization yields corresponding macro-averages of 63.6%, 2.7$\times$, and 24.5%. These findings motivate stronger tool vetting and runtime isolation in MCP ecosystems. Code is publicly available at https://github.com/Lilaizhen/A2M.
2026-09-23 04:00:00 · 大模型,算力芯片,AI应用,开源,Google,Meta,智谱,Agent智能体,推理思考,搜索RAG,招聘HR,论文
AI 资讯

GroundedGEO: Auditing the Evidence Gap in Generative Search Rankings

arXiv cs.AIarXiv:2609.25189v1 Announce Type: cross Abstract: Generative search systems rank products and services for consequential decisions, and publishers can cheaply make candidate text look relevant. Yet evidence status is not a text property but a claim-evidence relation: text-only rankers and defenses cannot separate honest detailed content from fabricated detail, creating an identifiability gap. We audit this gap with an evidence-paired benchmark (50 e-commerce queries, 1,950 cases) and a claim-level reranker, GroundedGEO, that penalizes query-relevant claims lacking support in a supplied packet. Matched rich variants control format and volume; packet twins add attestations at fixed text, while thinned packets withdraw them. On the frozen listwise ranker Qwen2.5-7B, unsupported-rich variants show significant normalized rank gain over clean candidates (+0.065 to +0.092 across claim profiles, Holm-corrected), while supported and neutral controls do not; the effect is model-dependent (marginal on MiMo-v2.5, absent on GLM-5.3-Flash). On a frozen pointwise scorer, oracle evidence labels cut the unsupported-rich top-3 rate from 0.65 to 0.43 (laundering from 0.61 to 0.39) at lambda=40 with zero false suppression; packet twins restore the original rates without changing text. Against a 370-claim human gold, all tested automatic judges fail the preregistered reliability gate, although the best local judge retains 79-100% of oracle suppression with zero measured false suppression on protected arms. Separately, stripping attestation coverage increases false suppression by 0.307. These diagnostic effects identify two limits on the evidence channel: label quality and packet coverage. They do not validate an automatic defense, and interpretation of the adverse human-gold arm remains pending adjudication.
2026-09-23 04:00:00 · 大模型,AI应用,阿里巴巴,智谱,搜索RAG,扩散模型,强化学习,模型评测,榜单评测,论文

Z.ai says sorry for slurping up your code, open sources ZCode

The RegisterChinese AI giant Z.ai has apologized after developers caught it pulling a Grok, packaging up and uploading user workspaces to cloud storage. In a case that’s highly reminiscent of the issues over which Elon Musk’s xAI was scrutinized in July, Z.ai’s code-generation harness wing, ZCode, was found packaging and git-encrypting entire user workspaces, including complete project histories, and shipping them off to Alibaba Cloud. Worse still, the private key used to decrypt the data was only held by the server under Z.ai’s control, meaning users could not access the files ZCode had uploaded, nor delete them. Ferstar, the researcher who first highlighted the issue, claimed there was no option for users to disable the behavior in their settings, and there was no disclosure of the practice in ZCode’s privacy policy. They said the core problem lay with the tool’s Repository Index functionality, which triggered the uploading of files after Repo Wiki generated pages in the cloud. ZCode released a statement on Monday apologizing for the “security issues” and confirming the data it uploaded had never been used to train its models. “We sincerely thank the community developers who previously identified issues in ZCode. Going forward, we will establish an ongoing product security vulnerability reporting and response process,” it Xeeted. “We welcome developers to continue reviewing ZCode and reporting potential issues, and we will provide rewards based on the severity of the issues reported.” ZCode said it tasked the China Academy of Information and Communications Technology (CAICT) and Beijing security company NSFOCUS to probe its product following the implemented changes. The company claimed the two outside assessments concluded that all the previously uploaded data has now been deleted and said the Repo Wiki feature was removed. ZCode also open sourced the entire project on GitHub, “placing the code under community scrutiny and making ZCode more open and transparent.” “Once again, we sincerely apologize and welcome continued scrutiny from the community. The full security assessment report will be released soon.” Ferstar confirmed the open sourced code showed no signs of the Repo Wiki still being implemented, but criticized the company for wiping commit records and the source code ZCode used to upload files pre-patch. For the uninitiated, Z.ai, formerly known internationally as Zhipu, is among the world’s AI heavyweights and one of the most heavily backed LLM-focused companies in China. It is the first AI company in the post-Gen AI era to launch and subsequently IPO on the Hong Kong Stock Exchange. Other Chinese AI giants are publicly traded, such as Alibaba and Baidu, but these were all established well before the AI era began. Z.ai is a startup with its roots in academic research. It spun out of Tsinghua University’s Knowledge Engineering Group research lab in 2019 and now develops AI models that it claims compete with the best in the West. Last month, the company claimed that its latest model, GLM-5.3, is as good as the most advanced equivalents developed by Anthropic and OpenAI at hunting for security vulnerabilities. Z.ai has also previously claimed the accolade of developing the first advanced model entirely on Chinese (Huawei) hardware. Meanwhile, the likes of Anthropic and OpenAI have reportedly expressed concern over the capabilities of models from Z.AI and Moonshot, while the US government mulls restricting access. ®
2026-09-22 15:59:00 · 大模型,AI应用,开源,融资,OpenAI,Anthropic,xAI,月之暗面,智谱,搜索RAG,招聘HR

《AGI市场观察》发布:四款国产模型周用量破10万亿tokens,DeepSeek与混元占比近半

雷锋网

日前,智能经济30人论坛AGI测评中心发布最新一期《AGI市场观察》(2026年9月12日-18日)。报告以OpenRouter词元消耗数据、各厂商官方披露价格及Arena基准测评为基础,对国产大语言模型做周度量化追踪,本期围绕用量、份额、集中度、价格与性价比等方面给出观察。

数据显示,深度求索于9月10日下调DeepSeek V4 Flash及V4.1 Flash定价,后者周用量随之增长483.62%,位次由第9升至第2;腾讯Hy4 preview以12.01万亿tokens位列第三、份额15.54%,性价比位次与上期持平。

词元用量方面,周期内词元用量超过10万亿tokens的均为轻量级(Flash/类Flash),包括DeepSeek V4 Flash(14.59万亿)、DeepSeek V4.1 Flash(12.93万亿)、腾讯Hy4 preview(12.01万亿)、智谱AI GLM 5.3 Flash(11.62万亿)。而上海创智学院Nex-N2.5 Pro、阿里巴巴Qwen3.8 Flash则首次跻身Top 15。

市场份额方面,DeepSeek V4 Flash(18.88%)及V4.1 Flash(16.73%)、腾讯Hy4 preview(15.54%)、智谱AI GLM 5.3 Flash(15.04%)四款模型份额在中国大模型中的词元用量份额同处 “第一梯队”,四强合计约占66%。头部集聚态势不变,前三位模型贡献了近一半的用量份额,前五位更是占比超过四分之三。

价格与性价比方面,当期Top15大模型每百万tokens最高价与最低价相差38.75元,与上期持平,其中最低为小米MiMo-V2.5(1.25元),最高为月之暗面Kimi K3(40元)。在基准任务成本中,腾讯Hy3最低,低至0.308元/基准任务,其次分别为DeepSeek V4.1 Flash、MiniMax M3和GLM 5.3 Flash,同处于“经济好用”区间。

据悉,智能经济30人论坛是由中国(深圳)综合开发研究院等机构联合发起,汇聚全国人工智能、数字经济领域的专家学者与企业家,共同推动智库交流与合作。

雷峰网 雷峰网

2026-09-22 11:25:00 · 大模型,阿里巴巴,腾讯,DeepSeek,月之暗面,智谱,小米,金融,微调蒸馏,模型评测,长上下文,模型发布,合作,榜单评测

腾讯、字节、阿里「会战」AI 办公之后:Agent 领域格局已变

极客公园

「这仗打错了,最多是白烧几十亿;但如果不打,可能是生死问题。」

这是创新工场联合首席执行官、管理合伙人汪华对大厂重金押注 AI 办公的判断。

2026 年的这个夏天,中国科技巨头发起了 Agent 时代第一场「战役」:豆包工作正式发布,TRAE、扣子团队整体并入豆包体系。更早的 7 月底,飞书产品团队并入豆包;另一边,腾讯的 WorkBuddy 已经跑出了千万月活,阿里也在整合自己的桌面 Agent、云端 Agent 和钉钉能力。

巨头为何会集体兴奋?AI 办公的背后他们在思考什么?在争夺什么?最近,极客公园邀请了汪华、Floatboat.ai 创始人兼 CEO 谭少卿一起来聊一聊。

今年初那场「小龙虾热」,本质上只是一场极客的自我狂欢。谭少卿说,「它是个过渡产品」,属于三类产品分层中的「极客产品」,从一开始就没打算走大众化路线。模型不够强、配置门槛高、Harness 不成熟,把普通用户挡在门外。

真正的转折发生在最近几个月。汪华认为,国产模型是最近才真正跨过了那道坎。GLM-5.3-Flash、DeepSeek-V4-Flash 这些模型不仅把指令遵循能力做上去了,更关键的是把成本打了下来。

现在,才是中国 Agent 爆发的真正原点。

这里面有一个反直觉的逻辑:移动互联网时代,千万月活根本不值得巨头兴师动众,但这次大厂已经开始了一场「大会战」。

汪华说,背后的驱动力是恐惧。年初 Claude Code 还没到千万月活时,ARR 就已经达到 200 亿美金了。这意味着,未来的高价值经济入口,可能不建立在高日活之上。法律、财务这类高价值的专业工作,一旦被 Agent 重新定义,丢掉的不是用户规模,而是整个赛道的船票。

除此之外,还有另一个因素是算力。C 端产品比如豆包,算力负担极重,只能用压缩的小模型,所以「有时觉得它智障」;而办公 Agent 恰好卡在一个理想区间,既能体现大模型真实能力,又不会因为用户规模过大导致算力扛不住,同时商业模式能跑通

WorkBuddy 的火热,某种程度上是一场内部赛马的幸存者故事。「它是踩在众多失败项目的尸体上活下来的。」大厂采取的都是内部赛马策略,那些算力成本过高、商业模式不成立的项目自然死亡后,资源自动向幸存者倾斜。

巨头进新战场,常被认为自带优势。但这次不一样。汪华说,「巨头唯一的壁垒其实只有钱,而钱能兑换的仅仅是算力。过去积累的数据和用户,不会自动转化成新赛道的优势,庞大组织架构反而会极大抵消资金优势」。

虽然巨头已经下场,但汪华认为,中国创业者有一个很大优势,距离中国开源模型更近。「大家在一个圈子里,私下交流多,最懂怎么在这些开源模型上做微调、建生态,那就能相对于其他地方的创业者建立一些优势。」

进入 Agent 时代,巨头们都在争夺通往未来的船票。汪华说,「船票」其实只有两张:成为水电煤般的基础设施,以及掌握基础模型。至于用户平台层面的船票,很可能根本不存在了,因为 Agent 本质上「是一种能力、一种智力、一种计算形态」,而不是一个需要被圈养的平台。

谭少卿从产品实践里看到了更远的东西:当 Agent 具备主动性,甚至开始向 CTO、COO 的角色过渡时,连 WorkBuddy 这样的「工作台」形态,都可能只是过渡产品。「模型越聪明,其实越不需要WorkBuddy这种中间层。」

巨头们这一次冲进 AI 办公战场,多少带着一点恐惧:怕错过新入口,怕丢掉下一代生产力的船票。但有意思的是,他们在重兵投入的同时,也无意中完成了市场教育,让更多用户第一次真正理解,Agent 不只是聊天工具,而是能干活的生产力系统。

而创业公司并没有因此被挤到墙角。相反,在巨头照亮市场之后,它们反而看见了更多细分机会:更垂直的场景、更灵活的产品形态。

以下是极客公园创始人&总裁张鹏和汪华、谭少卿的对话内容,部分有删减。


Part 1:中国 Agent 的「ChatGPT 时刻」来了

张鹏:近期腾讯、字节、阿里等大厂在 AI 办公领域的动作非常密集。你们怎么看他们最近的系列动作?

汪华:我觉得这事特别好。有了大厂来推动,包括他们愿意补贴,才能真正开启中国 Agent 领域的「ChatGPT 时刻」。

之前大家用豆包、DeepSeek,体验的是 Chatbot 对话。国内真正用过 Agent 的普通人极少。年初虽然小龙虾火过一阵,但门槛太高,绝大多数人根本没有用起来。它本质上只是极客的狂欢,再加上一点好奇用户的外溢。

现在大厂把 Agent 包装得非常易用,把 PPT、绘画、办公等场景预设好了,花力气把它推给了至少千万用户,相当于给全市场做了一次 Agent 普及教育。除了教育层面,用的人多了,各种应用场景也会被开发出来。

跟今年上半年小龙虾那波相比,还有一个关键不同,是国产模型是最近才真正跨过了那道坎。倒退三个月,国产模型的指令遵循能力还不够。同时,GLM-5.3-Flash、DeepSeek-V4-Flash 这些 Flash 模型把成本打下来了。所以一切水到渠成。

大厂推动 Agent 普及,对创业公司同样是巨大的利好。如果没有大厂去教育市场,创业公司自己拓荒太难了。现在,才是中国 Agent 爆发的真正原点。

图片来源:视觉中国

张鹏:怎么理解从小龙虾到 WorkBuddy,中间的逻辑是什么?毕竟这是两个不同人群的产品?

汪华:小龙虾热的时候我们也聊过,结论是它太复杂了,没法直接给普通用户用。但那波热潮让所有人,尤其是年轻科技爱好者,第一次亲手摸到了科幻小说里的东西。

大家都想尝试,但最后卡在几个地方:一个是模型不够强,当时只有 Opus 4.6 能用但又慢又贵;二是配置门槛太高,普通人搞不定 Linux 环境;三是 Harness 也非常不成熟。

现在完全不同了。模型和 Harness 每一两个月就在飞跃,现在 Opus 4.6 已经被随便「吊打」。更关键的是,普通人需要的是云化,不用自己在本地配置,云端配好直接用。现在的 Codex、Claude Code、豆包工作,也都是帮用户在云端配置好,起码是一个手机或消费品级的体验。

从小龙虾到 WorkBuddy在用户体验上有一个巨大差别:从极客的玩具,到手机 App、消费品。腾讯在这方面一直做得很好,他们始终把 WorkBuddy 当成一个用户级、消费级的 App 来开发,花了几个月时间就走到了今天这一步。

很多人认为这是创业公司的事,但并非如此。创业公司可以在海外做开源,但如果要做消费级、工业化的消费级产品,还得解决流量冷启动、数据积累这一整套问题,可能还是大厂,他们有流量、有资源。

张鹏:小龙虾火了之后,对你们有什么启发?怎么看现在巨头纷纷入场 AI 办公这件事?

谭少卿:我们做得比较早,去年 7 月就发现模型能力在长程任务上已经足够好。但面向普通知识工作者,市场上缺一个原生的「工作台」产品,所以我们就切入了这个方向。

小龙虾今年爆火的价值在于让大众第一次看到,Agent 可以后台 24 小时运行,发个任务就能跑,哪怕经常崩溃、又贵又慢。包括 ClaudeCowork 的发布,这对我们是特别好的事情,它证明了这个方向是可能的,我们第一轮融资就是在 ClaudeCowork 发布之后完成的,我们做的更早,跟它同天发布。

但我们判断当前的 Cowork 类的产品是过渡形态。因为 Cowork 本质上还是以人为中心,随着 Harness 价值的显现,Agent 长程能力越来越强,未来会过渡到以 Agent 为中心,产品形态、交互设计都会不一样。

张鹏:这对投资人的决策有影响吗?

谭少卿:之前从这个角度切入是反常识的,大家觉得这该是个通用赛道而不是垂直 Agent,而且软件演进路径是从软件到 SaaS 到 Agent,从桌面端切入好像是「开历史倒车」。但 ClaudeCowork 发布后,外界对这个路线开始有了认知。

我们把产品分成三类:极客产品、专家产品、大众产品。小龙虾属于极客产品,虽然我们一开始就没打算走这条路,但它让大众看到了可能性。

巨头入场,也是在帮我们教育市场。我们产品今年 1 月公测时,有用户抱怨积分用得太快。但当我们做用户访谈的时候问他任务满不满意,他说很满意,超出预期。再问干了什么工作,往往是实习生需要干半个月的工作量。当时只是没把价格锚定到生产力上,所以大家还是觉得贵。现在各类 Work 产品,让更多人知道了 Agent 真能解决问题,对我们是好事。

汪华:我特别希望这次巨头能教育中国用户交月费。以前,中国用户交月费不能超过 10 块钱,而美国用户为产品付费几十美金是常态,工作类甚至 50-100 美金。中国这么多年的免费模式,导致付费习惯一直起不来,而广告和交易支撑的商业模式,在商业模式上天生就有局限性,不是每种产品都适合这套逻辑。

张鹏:你认为到什么条件下,你会认为付费习惯基本建立起来了?

汪华:现在已经有很好的趋势了。虽然还是一小部分人,但程序员和专家用户,已经能坦然接受 68、98 元这个档位的月费。相比以前,这已经是巨大的进步。

中国用户以前的付费习惯,其实是被巨头抢用户的免费模式毁掉的。中国用户不是不爱付钱,你看 Steam 上 30% 都是中国玩家,巨头的生态是能培养习惯的。

现在大厂做 AI 办公,骨子里还是以前打用户量、算 ARPU、做入口的那套思维,并不是真正的「以 Agent 为中心」。唯一的好处是,因为 Agent 需要算力成本,他们没法再搞纯免费了,必须正儿八经推付费模式。这算是把以前毁掉的习惯又慢慢拉回来了。

谭少卿:确实如此。我们产品一开始主打海外,定价 40 美金一个月,没对国内外用户做价格区分。我们就是想验证,用户愿不愿意为好产品付比较高的价格。结果发现国内用户的付费习惯远超预期。有些重度用户一天甚至能充值两三千块钱,他们是真的把 Agent 当作生产力工具在用,而不是传统软件。

最近我们选了 DeepSeek-V4-Flash,跑了五个主流榜单,并且比官方的 Harness 评分更高。这证明 DeepSeek-V4-Flash 和 GLM 5.2 已经能驱动很复杂的长程任务,配合我们的 Harness 能做得多快好省,就能进入更多的生产力领域,因此推出一个便宜版本。从数据上看,巨头教育市场,对我们的付费率和留存反而都有明显的提升。

Part 2:WorkBuddy 是怎么踩着「尸体」跑出来的?

张鹏:从个人的视角,怎么看 WorkBuddy 这个产品?它是怎么演进的?

谭少卿:这类产品的交互逻辑,基本是从 Coding 场景演变过来的。进去先看到一个 Chat 面板,然后选一个项目文件夹开始工作。但大部分知识工作者的文件系统其实是半结构化的,不会把一份工作相关完全塞进一个文件夹,只有程序员才习惯把所有代码扔进一个目录下面。所以这个交互形态,没什么实质创新,只是把 Coding 的逻辑照搬过来。

真正让大厂资源开始发挥作用的转折点,是把 Skills(包括原来 GPTs 那种形态)包装成「专家」模式。这么做的好处是小白用户更容易理解。小白用户面对一个输入框可能完全不知道该干嘛,但「找个专家」这个概念他能秒懂。虽然这通常会拉低模型智能和 Harness 本身的表现,但也拉低了用户理解产品的门槛。一旦跨过这个门槛,巨头的运营和投放能力就能真正发挥作用。

在这个基础上,WorkBuddy 在易用性上确实做得稍好一点,比刚发布的飞书的豆包办公要更成熟些。

有意思的是,从几家产品官网就能看出各家的文化背景差异:WorkBuddy 官网做得很简单,甚至跟它现有的新版 UI 对不上,说明他们还在快速迭代;千问办公的用词和风格偏工程化,更贴近技术,更像是千问模型的一个管道;豆包办公则更年轻、更酷炫,内容呈现更靠前。这些细节背后其实是各家公司风格的直接投射。

张鹏:我们推导一下,为什么 WorkBuddy 是腾讯先做出来的?而不是字节或阿里?

汪华:实话说,我不知道。年初小龙虾那波热潮,其实是飞书吃到了最大的红利,他们当时也投入了很大精力做相关产品,但确实没跑出来。

其实大厂内部很多团队在赛马,字节有一批,腾讯也有一批,但字节这批没跑出来。

更关键的一点,可能是腾讯在模型选择上更开放。

字节的模型本身有点不够行,这在豆包这种对话式产品里其实无所谓,字节在交互体验上一直做得不错。可一旦到了办公场景,这背后是长程 Agent,对模型智能、指令遵循的要求会更高。而 WorkBuddy 可以自由选择模型,可以接入最好的生态。现在模型更新此起彼伏,「模型即产品」这一点在 Harness 时代依然成立,模型不行,前端交互做得再好,用户体验还是不行。

张鹏:可以选择不同的模型,现阶段是吸引用户的点吗?

谭少卿:坦白讲,对非专家用户来说,选模型这件事其实挺让人懵的。我们从产品早期到现在,一直保留让用户选模型的选项,核心原因是模型之间的差异依然非常大。日常办公用 DeepSeek-V4-Flash 确实又快又好,但如果追求极致效果,比如在 Coding 上,GPT、Claude、GLM 之间的差距依然很大。

只要产品还允许自选模型,就说明模型能力还没有收敛到一家独大。我们判断这会是个比较长期的状态。因为还有新的变量出来。目前,训练和蒸馏技术越来越成熟,任务越长越重要,Harness 越重要。比如很多用户反馈 Fable 5 在编程上不用提示词就特别强,但做非编程任务时会觉得智能下降了,就因为它模型的训练越来越多地对齐在自己的 Harness 上。同时,办公、Coding、世界模型,这几场仗都还没打完。模型厂也不是无限弹药的,专注于当前办公产品的资源其实也有限。

二是供给会越来越充足。大家都可以在基础模型上针对特定领域做后训练,通常都能比原始基模表现更好。我们也接触到一些还没在市面发布的基模,所以供给端只会越来越丰富。

另外,我们在产品协同上选择了和巨头完全不同的「分布式模式」。我们赌的是这次变革本身的特性:AI Agent 的能力不同于以往的技术,它能够根据用户的场景去自我编程、改进,从而让用户不必捆绑于具体的软件和 SaaS 平台。

现在数据其实是分布式的,大家并不关心文档是在飞书、Google Docs,还是存在本地,因为 Agent 全都能访问。所以这些边界被淡化掉了,用户的迁移成本也没那么高了。

正因为如此,分布式的供给才有了可能性。大量中小企业和个人用户,本来就没有谁真心愿意把数据锁死在一个平台上,他们更愿意让数据回归到自己手里。

同时,硬件端也出现了巨大变量。现在的 Mac 顶配电脑跑 27B 甚至 70B 的本地模型已经没问题。我们判断,未来很可能会重演早期 PC 时代的演进路径,算力供给将从中心化回归到个人终端。有可能到年底或明年年初,我们会看到消费级设备上也能跑出可以驱动 Agent 的能力。

张鹏:移动互联网时代,千万月活根本不值得巨头去打会战。为什么腾讯会重金加持?背后的战略思考是什么?

汪华:我觉得首先是恐惧。千万月活确实不多,但你要知道,年初 Claude Code 还没到千万月活时,ARR(年度经常性收入)就已经达到 200 亿美金了。

腾讯的逻辑大概是两点:第一,当年豆包出来,腾讯没重视,结果被做出了一个新入口,所以这次没有哪个巨头敢在一个东西还小的时候就轻视它;第二,大家都害怕未来的新经济形态,生产力、高价值的专业工作,比如法律、财务等,不一定建立在高日活上。如果这波没赶上,可能不是丢了用户规模,而是平白丢掉了高价值的经济入口。这仗打错了,最多是白烧几十亿;但如果不打,可能是生死问题。

而且对国内公司来说,现在算力已经没法像海外那样大规模投,美国那几家一年 CAPEX 就是 2000 亿美金级别。相比之下,国内打应用层的仗,真不算什么大的负担。

张鹏:这个视角很有意思。巨头需要把投资变成未来的资产和能力,否则护城河就会变矮或消失。那应用层是一个很好的选择?

汪华:而且办公场景还有一个巨大的好处:算力可控。

像豆包那种面向几亿 C 端用户的产品,算力负担极重,只能用压缩的小模型,所以大家有时觉得它「智障」。如果算力充裕,按照字节的秉性,肯定愿意给 C 端放开更强的模型,但现实是不允许的。

而办公 Agent 处于一个完美的平衡点:既能体现大模型的能力,又有实际价值和未来的高溢价空间,同时用户规模又不会像 C 端产品那样失控。加上它还能收点费,跑通商业模式,这确实是一个非常合适的战场。

我觉得并不是腾讯一开始就想得有多清楚。他们内部肯定有很多团队在

2026-09-16 06:39:11 · 大模型,算力芯片,AI应用,开源,融资,OpenAI,Google,Anthropic,字节跳动,阿里巴巴,腾讯,DeepSeek,智谱,文生图,代码生成,对话助手,Agent智能体,办公效率,设计创意,金融,教育学习,微调蒸馏,世界模型,提示工程,模型安全对齐,端侧AI,法律,工业制造,营销广告,招聘HR,基础设施,模型发布,产品更新,财报,榜单评测

传折叠屏 iPhone 维修费 8000 元,苹果:价格未公布;腾讯 Chatterfly 输入法开启内测;软高管:AI 训练是「人类历史上最大规模的劳动盗窃」|极客早知道

极客公园

谷歌最新旗舰模型 Gemini 4 Pro 疑似「偷跑」,多项指标领先 Astra 和 Fable 5.1

9 月 18 日,Google 下一代旗舰模型 Gemini 4 Pro 疑似正以「gemini-3.8-flash」名称「偷跑」上线。据反馈,谷歌在 Arena 等基准平台上测试了其最强 Gemini 4 Pro 模型,内部开发代号为 Argon。

网上流传的一张测试图显示,该模型在智能体编程测试 DeepSWE v1.1 中得分超过 88%,在 Terminal-bench 2.1 和 OSWorld 2.0 中分别获得 95.3%和 86.8%的成绩,高于 GPT-6 Astra 和 Claude Fable 5.1。不过,该图片的来源、测试条件及完整结果尚未公开,相关分数暂时无法独立验证。(来源:华尔街见闻)

苹果回应 iPhone Duo 维修费达 8000 元传闻:具体价格尚未公布

9 月 18 日消息,针对苹果首款折叠屏手机 iPhone Duo 维修费用可能达到 8000 元的传闻,苹果官方维修人员回应称,该产品尚未开启预售,目前没有具体维修价格,苹果一般会在新机预售后于官网公布相关费用。

这一传闻来自第三方维修人员的估算。此前,影视飓风 Tim 在体验 iPhone Duo 时反向弯折机身,导致外屏闪屏。杭州一家数码店负责人据此判断,如果屏幕和铰链同时损坏,整体维修费用可能达到七八千元,但该价格并非苹果官方报价。

iPhone Duo 起售价为 15999 元,将于 10 月 16 日 20 时开启预购,10 月 23 日正式发售。与其对应的 AppleCare+价格也尚未公布。苹果客服表示,反向弯折造成的损坏属于人为损坏,不在标准保修范围内。(来源:界面新闻)

 

研究人员借助 Claude 攻破 OpenAI 内部系统

9 月 18 日,安全公司 Hacktron AI 披露,研究人员借助 Claude Opus 5,在不到 72 小时内将一个图像处理漏洞扩展为完整攻击链,最终获得一名 OpenAI 员工的 ChatGPT、Codex 账户及内部 GitHub 访问权限。

攻击入口为基于 Discourse 搭建的 OpenAI 社区论坛。研究人员利用图像处理组件 libheif 的堆缓冲区溢出漏洞取得论坛服务器控制权,随后通过 OpenAI 单点登录系统中的另一处独立缺陷进入员工账户。由于该账户已连接 OpenAI 的 GitHub 组织,研究人员让 Codex 在内部代码库中创建了一个无害的拉取请求,以验证相关权限,未读取敏感源代码。

Hacktron 表示,Claude Opus 5 在数小时内生成了可用的 ARM64 漏洞利用程序,并将其适配至论坛使用的 x86-64 环境。研究人员已于 7 月 25 日通过漏洞赏金平台 Bugcrowd 向 OpenAI 披露问题,OpenAI 当天完成修复,并支付 6500 美元赏金;Discourse 也于 7 月 28 日发布补丁。

该事件还显示,当 AI 账户同时连接 GitHub、Slack、邮箱及云端文档等企业服务时,单个账户失守可能进一步扩大至多个内部系统。企业因此需要限制 AI 代理的授权范围,并将其凭证按照特权账户管理。(来源:华尔街见闻)

 

全面追赶 OpenAI,消息称 Anthropic 计划在今年年底前拥有约 5 吉瓦可用算力、明年年底翻倍

9 月 18 日,在争夺顶尖模型性能的较量中,OpenAI 与 Anthropic 的竞争已进入白热化阶段。而这场较量的核心,正是训练与部署这些模型不可或缺的基础设施——算力。

据纽约时报消息,过去几年里,OpenAI 在可用算力规模上始终占据领跑地位。据知情人士透露,截至去年,Anthropic 在可用算力储备上仍处于下风,其规模约为 1.5 吉瓦(GW),而 OpenAI 则已达到约 2 吉瓦。

消息称 Anthropic 已经制定了全面的追赶计划。多位知情人士表示,该 AI 实验室已告知投资者,计划在今年年底前储备约 5 吉瓦规模的可用算力,并预计到明年年底将这一容量再度翻倍。

而据掌握 OpenAI 内部预估数据的人士称,这一节奏已与 OpenAI 的扩容路径大体持平——后者同样计划在今年达到约 5 吉瓦的算力规模,并在明年拓展至约 10 吉瓦。(来源:IT 之家)

智谱 ZCode 就代码库数据上传致歉:已修复,将开源代码库接受第三方审查

9 月 18 日,针对社区中有关代码库数据上传的讨论,智谱旗下编程产品 ZCode 今日通过智谱官方群组向受影响用户致歉,并发布回应称已第一时间完成自查,相关问题目前已经修复。

据官方说明,此次问题源于 ZCode 的「代码库索引」功能。该功能旨在帮助用户在本地生成仓库索引,以支持包括历史版本在内的会话检查点恢复、历史版本回退及 Repo Wiki 等功能。其中,Repo Wiki 在生成 Wiki 页面时,可能会触发仓库数据上传。官方称,Wiki 页面在云端生成后,相关上传数据会立即销毁,不会保存。由于该功能在上线初期默认开启,导致部分用户受到影响。

针对数据安全及产品信任问题,官方宣布近期将开源 ZCode 代码库,并邀请第三方评估人员对系统运行情况进行审查,持续公开产品审查进展。此外,ZCode 将为全体用户额外提供一次周额度重置,今日起发放。(来源:cnBeta)

 

消息称长鑫正准备进入闪存市场,与三星、海力士、美光正面竞争

9 月 18 日,据路透社消息,三位知情人士透露,长鑫存储正计划进军需求激增的闪存市场。

知情人士透露,长鑫存储计划在其位于北京的新工厂建设一条用于 NAND 闪存研发生产线。该公司还在北京设立了研发机构,相关研发项目包含了 NAND 技术的开发。

此外,长鑫存储已就其 NAND 业务规划与客户展开接洽,其中包含一家新成立的初创企业。该企业计划采购长鑫存储的 NAND 芯片,用于人工智能系统及超级计算机的存储产品研发与部署。

TrendForce 集邦咨询数据显示,按营收口径计算,三星电子以 29.3% 的市场份额在 2026 年第二季度位居全球闪存市场榜首,SK 海力士位列次席,美光紧随其后。

长鑫存储 DRAM 内存营收则在 2026 年第 2 季度达到 146.24 亿美元(现汇率约合 983 亿元人民币),环比增幅达到 99.3%,市占则从 2026Q1 的 7.6% 提升至 9.5%。(来源:IT 之家)

 

吴恩达回应 AI 末日论:别被科幻叙事带偏,应解决现实工程问题

曾参与创办 Google Brain 和 Coursera 的 AI 领域研究者吴恩达,在 9 月 17 日在接受彭博电视采访时表示,顶尖模型开发商近期有关 AI 可能导致人类生存风险的警告「更像科幻小说,而不是科学」,并认为这类叙事可能分散行业对实际 AI 安全问题的关注。

吴恩达称,科技行业早期曾放大 AI 潜在灾难性风险,以获取关注并影响监管方向;近两周相关讨论再次升温,也可能存在类似动机。他认为 AI 确实存在现实风险,尤其包括网络安全等领域,但不认同将人类灭绝风险作为当前 AI 发展的核心判断依据。

与「减速」主张不同,吴恩达认为行业应继续推进 AI 发展,同时通过受控测试、工程防护和迭代改进解决可验证的安全问题,并让 AI 更多应用于能够产生社会价值的场景。当前,AI 安全讨论正从模型能力边界进一步延伸至网络安全、代理失控、对齐及前沿模型治理等具体问题。(来源:aibase)

 

闲鱼:坚决打击色情违规内容,今年已冻结风险账号 9.8 万个

9 月 18 日,闲鱼发布关于持续严打色情引流的公告,称闲鱼持续致力于打造安全、健康、可信的社区交易环境。针对平台上利用色情内容进行引流、欺诈等行为,闲鱼已建立「前置识别—即时处置—警企联动」综合防控治理机制。闲鱼将坚决打击色情违规内容,持续强化平台治理力度,维护网络清朗环境。

2026 年 1 月至今,闲鱼已累计冻结色情引流类风险账号 98358 个。平台主动将相关线索移送公安部门。今年以来,警企协同已成功打击色情团伙 15 个。

为此,闲鱼持续升级色情引流内容打击能力,从监测预警、技术识别、人工巡查三个维度构建系统化治理机制:(来源:IT 之家)

 

比尔·盖茨警告:AI 或成为人类历史上最严重的不平等来源

9 月 18 日据媒体报道,比尔・盖茨近日表示,人工智能的发展和普及速度远快于电脑、互联网等以往技术,如果完全由市场决定资源投入和产品方向,相关收益可能率先集中于富裕人群及基础设施完善的地区,使贫困地区进一步落后。

盖茨指出,目前大模型训练数据中超过 90% 为英文,英语环境下部分工具的识别错误率低于 6%,在部分小语种中失败率则超过 60%。语言数据及基础设施的差异,可能使发展中国家难以获得可靠的 AI 服务。

盖茨基金会宣布,未来两年将投入至少 10 亿美元,用于建设小语种数据集,并支持面向医疗、教育和农业等领域的 AI 工具。盖茨认为,未来 12 至 18 个月是决定 AI 资源如何分配的关键时期;如果在产品设计和资金投入中考虑弱势群体,AI 也可能用于缓解医生、教师等公共服务资源不足的问题。(来源:cnBeta)

阿里 AI 登顶《科学》:全球首个专家级通用医疗影像模型,一个模型识别 146 种病症

9 月 18 日电,阿里巴巴达摩院与浙江大学医学院附属第一医院等机构研发出通用医疗影像 AI 模型 DAMO RADAR,登上国际顶级学术期刊《科学》(Science)。

该模型面向腹部增强 CT 诊断,可一次性识别超过 146 种病症,其准确性首次达到影像科专家级水平,现已正式开源。(来源:财联社)

 

腾讯 WorkBuddy 上线「应用生成能力」

9 月 18 日,据腾讯云消息,WorkBuddy 上线「应用生成能力」。

据介绍,WorkBuddy 全栈「网页应用」生成,包括以下核心能力:

  • 一站式制作发布:页面生成、数据配置、上线发布闭环在 WorkBuddy

  • 免部署:不用买服务器、不配环境,发布即得访问链接

  • 云数据库:结构化数据存云端,支持增删改查,可配权限规则控制谁能读写

  • 文件存储:图片、附件等文件上传到云端并在应用内调用

  • 注册登录:内置身份认证,用户可注册登录,数据按用户隔离

  • 免密钥 AI 调用:直接调用大模型,不用自己申请和管理 API Key

  • 运营数据统计:上线后可查看用户数量、注册增长(来源:IT 之家)

 

腾讯 Chatterfly 输入法开启内测

9 月 18 日,腾讯全新 AI 原生输入工具 Chatterfly 低调开启内测,该产品也被市场称作此前传闻的元宝输入法。

目前内测仅开放 macOS、Windows 桌面客户端,进入产品需要使用内测码;iOS、安卓移动端页面标注「即将发布」,尚未上线。底层依托腾讯混元多模态大模型,区别传统输入法单纯语音转文字,Chatterfly 定位 AI 表达助手,主打「开口即成稿」能力,能够理解上下文语义,把口语内容自动整理润色为书面文本,适配嘈杂、弱网、轻声等复杂录音环境。

产品内置六大自然场景 Skill 能力,覆盖会议纪要、工作汇报、项目进度梳理、营销文案、邮件润色、Vibe‑Coding 提示词优化,可在微信、QQ 等各类应用软件内调用。值得注意的是,语音转写录音、相关记录默认在本机存储,不上传云端。产品还会逐步学习用户表达习惯,优化输出风格,支持个人词库维护。

截至目前,腾讯尚未发布官方正式公告,产品功能、迭代节奏、移动端上线时间均以官方后续披露为准。(来源:cnBeta)

 

Snap 推出 AR 智能眼镜 SPECS,AI 应用 SPECS Intelligence 同步发布

9 月 17 日,Snap 在洛杉矶发布新一代 AR 智能眼镜 SPECS。该产品将计算硬件集成在眼镜中,无需外接处理器,可通过手势和语音操作,并将 AI 助手、导航及其他数字信息呈现在用户视野内;连接手机后还可接听电话、查看通知和播放音乐。

Snap 同步推出 AI 应用 SPECS Intelligence。该应用可跨 iPhone、Mac 和 SPECS 运行,在用户自主连接应用和工具后,逐步了解其目标、日程和使用习惯,并在适当时间主动提供信息或操作建议。目前,美国年满 18 周岁的用户可体验 iOS 预览版,Mac 版本则采用邀请制。

SPECS 还支持 60 种语言实时翻译、步行导航、流媒体播放、运动训练及商品 3D 预览等功能。Snap 表示,设备不使用面部识别,也不会持续录制或保存周围的音视频;拍摄时镜框上的 LED 指示灯会亮起。

SPECS 已开放预订,售价 2195 美元,需支付 200 美元可退还定金,预计今年秋季晚些时候在美国、英国和法国发货。Snap 还将单独销售可提供四次额外充电和蜂窝网络连接的充电盒。(来源:白鲸出海)

微软高管:AI 训练是「人类历史上最大规模的劳动盗窃」

9 月 18 日,近日根据《纽约时报》公开的法律文件,微软应用科学总监布伦特·赫希特(Brent Hecht)在内部备忘录中,将 AI 模型训练定性为「人类历史上最大规模的劳动盗窃」,并称之为「规模空前、令人震惊的盗窃行为」。

赫希特在 2023 年 1 月的一份内部备忘录中写道:「全球数百万人很快就会将大型模型『吸走』他们所有作品的行为视为一场规模空前的惊人盗窃……几乎没有人打算让自己创作的内容以这种方式被使用,他们也没有为此获得补偿。」

在另一份日期为 2024 年 1 月的内部演示文稿中,赫希特用「毁灭循环」(doom loop)来描述 AI 对新闻业的影响:AI 产品不断减少新闻网站的流量和收入,导致新闻机构减少内容生产,最终 A

2026-09-19 00:01:42 · 大模型,算力芯片,AI应用,开源,融资,政策监管,OpenAI,Google,Anthropic,Microsoft,阿里巴巴,腾讯,智谱,语音音频,代码生成,对话助手,多模态,Agent智能体,办公效率,翻译字幕,设计创意,医疗健康,金融,教育学习,模型评测,提示工程,模型安全对齐,法律,政务,工业制造,营销广告,招聘HR,网络安全,基础设施,模型发布,产品更新,财报,开发者生态

卢伟冰谈小米18 Pro涨价:大家会觉得合理;剪映发布 Hub 及 AI 助手「小映」;苹果或 10 月推出智能家居设备|极客早知道

极客公园

B 站上线 AI 无限竞技场测评榜:GPT-6 Astra 现居榜首

9 月 20 日,B 站宣布上线「AI 无限竞技场」大模型测评榜,并同步公布了首轮模型排行榜。据 B 站介绍,「AI 无限竞技场」是一个汇集了 B 站 UP 主 AI 大模型测评的竞技广场,由各领域 UP 主对上百个大模型的真实场景实测构成,涵盖代码、推理、协作、知识等多种测评主题。

其中 GPT-6 Astra 在 10 个 UP 主测评中拿下榜首,打败 GLM-5.3 获得榜首次数冠军;前 5 名中,国产大模型占据 3 席。

不同于传统跑分评测,B 站 AI 无限竞技场不设主题或测评维度限制,来自各个分区的 UP 主们以真实工作流、专业应用、趣味脑洞等自主命题,在同题 PK 中直观呈现各模型的实际表现差异。

榜单涵盖 DeepSeek、Kimi、ChatGPT、Claude、Gemini、豆包、千问、Hy、MiniMax 等主流模型对比测评,排名实时更新,持续面向全站 UP 主开放报名。(来源:ITBears)

iPhone 18 Pro 上市首日出现死机问题,苹果回应正调查

9 月 20 日,据 CNMO 科技从韩媒获悉,苹果新款手机 iPhone 18 Pro 系列被曝出现设备突然关机后自动重启的「Panic Full」现象,反映相关问题的用户接连不断。

据业内人士 9 月 20 日透露,在拥有约 241 万会员的 iPhone 用户社区「阿沙莫」中,接连出现 iPhone 18 Pro 和 iPhone 18 Pro Max 遭遇 Panic Full 现象的帖子。Panic Full 现象是指iPhone设备停止响应后自动关机并意外重新开机的现象。

一名用户称,在进入需要 Face ID 认证的银行应用或照片应用「最近删除」项目后,反复使 Face ID 识别失败,即可重现设备关机现象。该用户表示,用手遮住 Face ID 传感器部分尝试认证,反复进行放手再遮挡的操作后,屏幕出现「请重试」提示,随后设备即自动重启。该用户称经多次测试,同一现象反复出现。

科技 YouTube 频道「ZUYONI」也表示,在收到 iPhone 18 Pro 用户举报后检查了正在使用的产品,确认发生了 Panic Full。该频道称,日常使用中尚未遇到,但在特定情况下 iPhone 会出现重启现象,在相册回收站查看或金融应用 Face ID 识别失败后立即重试再次失败时,Panic Full 便会发生并导致关机。(来源:CNMO)

 

Anthropic 计划将 IPO 推迟至 11 月,上市估值约 2 万亿美元

9 月 20 日,据《华尔街日报》报道,Anthropic 计划将首次公开募股(IPO)推迟至 11 月进行,晚于许多投资者此前预期的 10 月。

知情人士透露,部分 Anthropic 顾问认为,推迟至 11 月可以让公司有时间展示第三季度财务数据,以证明其竞争地位。知情人士表示,将 IPO 目标定在 11 月的决定是在 Anthropic 前研究员发出公开警告、引发关于 AI 发展速度是否过快辩论之前作出的。这一时间安排仍可能发生变化。

投资者此前预计 Anthropic 上市估值约为 2 万亿美元(现汇率约合 13.44 万亿元人民币),募资额最高可达 1,000 亿美元(现汇率约合 6,721.85 亿元人民币),两项数据均将超越 SpaceX 在今年 6 月创下的纪录。

Anthropic 正考虑推出一款新的人工智能(AI)模型,以应对 OpenAI 自发布 GPT-6 Astra 以来所形成的势头。根据企业支出管理平台 Ramp 的最新数据,GPT-6 Astra 约占该平台追踪的企业 AI 支出的 13%,Anthropic 旗下 Claude Fable 则约占 8%。这引起了一些原本有意投资 Anthropic 的投资者的担忧。 (来源:IT 之家)

 

英伟达黄仁勋驳斥 AI 末日叙事:吓唬人不负责任,部分人士意在摆脱现有法律约束

9 月 21,英伟达联合创始人兼首席执行官黄仁勋昨日接受 CBS News 采访时表示,他不认同某些研究员提出的「AI 可能在几年内灭绝人类」说法。他觉得这类说法是 AI 末日叙事,已经被过度渲染。

黄仁勋表示:「2030 年不会是世界末日,2030 年即是世界末日的可能性为 0%。吓唬人不负责任,也没有必要。」

据悉,黄仁勋此番言论是在回应前 Anthropic 研究员雅各布 · 考克森的看法。这名研究员此前表示,Anthropic 和 OpenAI 两家公司的做法都不负责任。它们争相开发能够自我改进的超级智能,拿人类生命做赌注。

黄仁勋表示:「我们公司的成功与产品服务、安全部署息息相关。如果我们不能持续保持安全,我们的价值就会降低。」他认为,美国现有产品责任法以及针对未授权侵入网络的法律已经足够完善,因此没有必要再立法监管 AI 开发商。他还表示,自己赞同美国总统的观点,即 AI 行业不需要额外监管措施。

「网络安全和损害责任法律已经涵盖了各种情况,首先就应该执行这些法条。不要让末日叙事,成为某些人摆脱现有法律约束的理由。」(来源:IT 之家)

卢伟冰谈小米 18 Pro 系列手机定价:是会涨,但相信大家会觉得合理

9 月 20 日消息,小米 18 Pro 系列手机官宣 9 月 23 日 19:00 发布。有网友表示,现在小米 17 Pro 是 5699(元起),今年小米 18 Pro 这配置还得涨多少?

小米集团合伙人、总裁,手机部总裁,小米品牌总经理卢伟冰下午回应称:「是会涨,但相信大家会觉得合理。」

卢伟冰此前发文表示,「这是小米数字旗舰系列,升级幅度最大的一次。性能、背屏、屏幕、影像四大核心体验,全面大升级。」

小米 18 Pro 系列手机官宣搭载 2nm 旗舰移动平台、徕卡双 2 亿超清影像系统、新一代超级像素屏幕(全新 M11 发光体系)、0.99mm 极窄边屏幕设计、32% 超高硅小米金沙江电池。

其中,小米 18 Pro 搭载 7000mAh 金沙江电池,小米 18 Pro Max 搭载 8500mAh 金沙江电池。(来源:IT 之家)

 

京东汽车与张雪机车达成战略合作:在京东下单送装一体,带一公升汽油上门

9 月 20 日,第二十四届中国国际摩托车博览会在重庆开幕。京东汽车与张雪机车宣布达成战略合作,上线京东自营旗舰店,推出送车上门服务。

据都市现场报道,京东汽车摩托车业务负责人邢洪梅接受采访时表示,把重点放在如何把摩托车送到用户家里,「在京东下单张雪机车,送装一体,带一公升汽油上门」。

所谓「送装一体」,即用户下单后,物流师傅与上门技师一同到户,现场送货、安装、组装,用户确认满意后再离开。邢洪梅特别提到「带油运输」,通过专业防爆罐随车供油,解决新车到户后无油、需手动推到加油站的问题。「直接把油带到消费者家里、加满,收到就能骑。」邢洪梅说道。

「消费者下一台摩托车订单,背后承载的东西非常多。」邢洪梅表示,整车配送依靠京东物流能力,可覆盖市县、乡镇及区县;摩托车安装、组装则由京东到家技师团队完成。

邢洪梅还表示,带油、送装、上门维修等服务均有成本,目前由京东承担,相当于在售后服务环节给用户让利。张雪机车创始人张雪近日透露,夺冠后摩托车热销,原计划 2026 年产量为 5~6 万台,已提前在 8 月完成,预计到年末能完成 10 万台产量。(来源:IT 之家)

 

西贝起诉罗永浩即将开庭,「理记」质疑其借野人事件重塑舆论形象

9 月 20 日,微博大 V「理记」发文透露:「西贝已对罗永浩提起诉讼,案件即将开庭。」。

他进一步分析指出,罗永浩近期就「野人先生」事件发声,实为一石二鸟之举:一方面与钟薛高品牌近期复出形成话题联动;另一方面试图通过淡化自身角色,将公众认知导向「我只是普通消费者表达吐槽」的叙事框架,以重构历史语境。(来源:DoNews)

 

马斯克预言:AI 将使明年美国 GDP 增速翻番达到 4%

9 月 20 日,马斯克预言,人工智能(AI)将大幅加速美国经济增长,他认为人工智能明年可能会使美国经济增长率从大约 2% 翻一番,达到 4%。不过,主流经济预测对 AI 拉动增长仍偏悲观。(来源:财联社)

苹果最早将于下月推出智能家居屏幕设备

9 月 20 日,知名科技记者马克·古尔曼撰文称,苹果预计最早将于下月推出智能家居屏幕设备。这款产品将成为特努斯执掌苹果初期最受期待的发布之一,将整合所有联网设备控制、视频通话、对讲功能和媒体内容,同时让用户访问苹果服务和应用。

设备内部代号为 J490,将搭载一套围绕 Siri AI 打造的新操作系统,目前正在苹果员工家庭中进行广泛测试。设备屏幕大约呈方形,可以放置在底座上,外观类似于被切成两半的 HomePod mini,也可以安装在墙上。设备的一项主要功能是通过前置摄像头系统实现面部识别,并根据用户身份个性化显示内容。苹果能够在没有 Face ID 级深度传感器的情况下实现这一功能,说明未来可能也能在 iPhone Duo 上实现面部识别(目前依赖 Touch ID),而无需传统面部识别所需要的物理空间。(来源:格隆汇)

 

剪映发布 Hub 及 AI 助手「小映」,覆盖脚本、素材生成和视频剪辑

9 月 20 日,剪映在「AI 新创作发布会」上推出一站式创作工作台剪映 Hub、智能创作 Agent「剪映助手」及移动端 AI 助手「小映」,并上线新的 AI Ultra 会员订阅方案。

剪映 Hub 由无限画布和多轨道编辑器组成。用户可以从一句话、参考视频或文档开始整理思路、生成脚本,并调用即梦、小云雀等平台生成图片、视频和音频素材,随后在多轨道编辑器中继续调整。剪映助手则可通过对话完成素材整理、口播删减、字幕纠错和视频包装,并支持创作者自定义 Skills。

移动端的「小映」可以根据用户提供的文字需求和素材,调用图片、视频、音乐及 AI 生成功能制作可继续修改的初版视频;商家也可上传商品图片,由其提炼卖点并生成不同平台的营销素材。

剪映还升级了「剪同款」功能,用户可通过自然语言修改模板内容和情节。剪映表示,目前每年约投入 1.5 亿元用于创作者激励,并将推出模板作者 AI 助手及「剪映创作合伙人」计划。(来源:雷锋网)

 

稚晖君发布启元 Q1 和 T1 人形机器人:外壳随心改换、人形四足秒切换,首发接入腾讯 WorkBuddy

9 月 20 日,在 2026 启元机器人全球产品发布会上,启元机器人发布启元 Q1、启元 T1 两款人形机器人。

据上纬新材料科技股份有限公司董事长、智元机器人联合创始人兼首席技术官彭志辉(稚晖君)介绍,启元 Q1 主打自定义特性,支持自定义设计互动动作、3D 打印改造外观,用户可自由调整机器人的外观造型、性格特质、动作姿态与语音音色。

启元机器人是上纬新材旗下品牌上纬启元推出的消费级人形机器人品牌,2025 年底,稚晖君宣布公司以该品牌进入个人机器人领域。(来源:IT 之家)

 

阿里千问开源 Qwen-Image-2.1 图像模型:可生成、编辑透明图像,支持最多 10 张参考图

9 月 20 日,阿里千问宣布,开源千问图像系列当前兼顾生成效果、推理效率与使用成本的开源图像模型 Qwen-Image-2.1。

Qwen-Image-2.1 将文生图与图像编辑整合在同一模型中,视觉生成部分仅有 7B 参数,并原生支持透明图像的生成与编辑。

官方表示,本次更新的主要特色包括四个方面:

  • 小模强效,极致价比:轻量的模型结构与推理优化,在生成质量和计算成本之间取得平衡。

  • 原生透明,创改一体:根据提示词生成普通图像或透明图像,并支持透明图层编辑与抠图。

  • 全能编辑,多局保全:支持最多 10 张参考图,增强局部编辑、人像与商品保真,并覆盖多种编辑任务。

  • 真实质感,字雅人美:提升文字排版、人物光影与细节表现,让生成结果更具美感。(来源:IT 之家)

FBI 局长称该局 AI 使用量增长 605%,拦截多起枪击案

9 月 20 日,美国联邦调查局局长卡什・帕特尔近日在接受福克斯新闻采访时表示,在其推动下,FBI 对人工智能技术的使用量增长了 605%。他称,AI 可用于筛选和分类数据,并曾帮助调查人员跟进线索,阻止北卡罗来纳州及另外六个州发生枪击事件。

不过,帕特尔并未解释 605%的统计对象和计算方式,也未披露相关枪击事件的具体情况,目前缺少公开数据对上述说法进行独立验证。

美国司法部今年 2 月公布的 2025 年度 AI 应用清单显示,FBI 当时共有 50 个 AI 应用案例,其中 9 个被列为「高影响力项目」。FBI 首席人工智能官凯蒂・诺伊斯今年 8 月表示,该局获批使用的 AI 项目已增至 139个。FBI 此前还发布采购文件,计划投入 8800 万美元购买 AI 服务器。

帕特尔此前介绍,FBI 已使用 AI 转写通话录音、生成摘要、梳理人员关系并关联报案线索,同时将人脸识别等技术用于寻找失踪儿童和调查虐童案件。(来源:IT 之家)

2026-09-21 01:01:53 · 大模型,算力芯片,AI应用,具身智能,开源,融资,政策监管,OpenAI,Google,Anthropic,NVIDIA,字节跳动,阿里巴巴,腾讯,DeepSeek,xAI,月之暗面,智谱,小米,京东,文生图,文生视频,语音音频,对话助手,Agent智能体,推理思考,办公效率,翻译字幕,设计创意,金融,模型评测,提示工程,法律,传媒内容,营销广告,物流供应链,AI for Science,招聘HR,网络安全,模型发布,产品更新,合作,财报,版权诉讼,榜单评测
继续滚动加载更多…