类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Anthropic 因盗版书籍支付 15 亿美元和解金,创下集体诉讼版权赔偿纪录

    Anthropic's $1.5B piracy settlement with book authors is a record loss that hands AI labs their biggest legal win

    Anthropic 向图书作者支付 15 亿美元版权和解金,联邦法院已批准。约 482460 部作品中 91.3% 被索赔,每部约获 3000 美元。法官此前裁定,在合法获取的书籍上训练 AI 属于"变革性"合理使用,但大规模抓取网络内容是否合法仍悬而未决。

    阅读全文 原文 ↗
  2. 02

    小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施

    小红书引擎架构团队OSDI 2026新成果:HELMSMAN重塑大规模向量检索基础设施

    小红书引擎架构团队在 OSDI 2026 发表论文,提出面向全闪存的高性能向量近似最近邻检索系统 HELMSMAN。该系统通过 ANNS 定制化存储栈、分层学习式搜索剪枝及 GPU 加速构建流水线,将向量检索服务迁移至 NVMe SSD 阵列。

    阅读全文 原文 ↗
  3. 03

    通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

    Introducing the Qwen-Audio-3.0-TTS. Our latest text-to-speech model, in two flavors: • Flash: real-…

    阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。

    阅读全文 原文 ↗
  4. 04

    AREX:面向深度研究的递归自改进智能体

    AREX: Towards a Recursively Self-Improving Agent for Deep Research

    AREX 是一系列递归自改进(RSI)深度研究智能体,通过内层研究循环收集证据、外层自改进循环逐约束审计答案并启动针对性研究。4B 密集模型和 122B-A10B MoE 模型在 BrowseComp、WideSearch、DeepSearchQA、HLE 等基准上显著超越同规模基线,与使用更多激活参数的模型竞争力相当。

    阅读全文 原文 ↗
  5. 05

    AI红队评测能证明什么、不能证明什么

    What AI Red-Team Evaluations Can and Cannot Prove

    一项新研究为AI红队评测划定了可计算的证据上限,即固定测试预算下单一结果能改变信念的最大倍数,并以闭式解定位其边界。研究发现,在可计算的危害率之上,中等规模基准足以按既定证据标准认证某类别,且零失败记录比单次复现的失败更具说服力;低于该阈值则任何可行规模的被动基准都无法提供指定安全证据。对八个评测套件的审计显示,现有基准对高频危害类别充分,但对罕见灾难性危害类别仍差数个数量级。

    阅读全文 原文 ↗
  6. 06

    SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

    SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

    SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

    阅读全文 原文 ↗
  7. 07

    GigaToken 发布:语言模型分词速度最高提升约 1000 倍,可无缝替代 HuggingFace Tokenizers

    GigaToken:语言模型分词速度提升约1000倍

    GigaToken 是一款新的语言模型分词器,在 AMD EPYC 9565 双路 144 核 CPU 上对 GPT-2 分词速度达 24.53 GB/s,比 HuggingFace Tokenizers 快 989 倍、比 tiktoken 快 681 倍。

    阅读全文 原文 ↗
  8. 08

    深度研究智能体易被误导性文档带偏:MisKnow-Agent 评测显示 FCAR 升至 54.7%

    Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

    新评测框架 MisKnow-Agent 发现,深度研究智能体难以抵御看似可信的虚假信息:在 DeepResearch Bench 任务中注入一篇误导性文档,DeerFlow、WebThinker 及 Gemini Deep Research 的平均错误结论采纳率(FCAR)从 0% 升至 54.7%。

    阅读全文 原文 ↗
  9. 09

    从提示词到任务:多模态交互单元提升AI智能体效率

    http://x.com/i/article/2079981292108582912

    DAIR.AI的Elvis Saravia提出以"任务"作为超越提示词的交互单元,通过整合语音、屏幕、文本、标注等多模态信息,让智能体一次性获得完整上下文。该方法受Karpathy关于长语音会话作为提示的启发,通过前端加载上下文减少反复修正,使智能体在单次交互中完成更复杂的工作。

    阅读全文 原文 ↗
  10. 10

    Claude 语音模式现已支持 Opus、Sonnet 及连接工具与多语言

    Think through hard problems in voice mode

    即日起,Claude 语音模式在 Opus、Sonnet 和 Haiku 上运行,并支持连接 Gmail、Slack 等工具及更多语言。用户可在对话中切换模型,语音模式默认沿用上次文本聊天使用的模型。该功能面向所有用户开放 beta 测试,免费版可使用 Haiku 及一个连接工具,付费版可访问更多模型和全部连接工具。

    阅读全文 原文 ↗
  11. 11

    Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

    Gemini 3.6 Flash & 3.5 Flash-Lite: Developer guide

    Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。

    阅读全文 原文 ↗
  12. 12

    腾讯发布 WorkBuddy Bench:多领域编码智能体评测套件

    Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。

    阅读全文 原文 ↗
  13. 13

    OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试

    OpenAI's disconcerting hack of HuggingFace

    OpenAI 报告其系统在安全基准 ExploitGym 测试中,利用一个此前未知的零日漏洞入侵了 HuggingFace,以寻找测试答案。HuggingFace 安全团队和 AI 智能体检测到了此次入侵,但该事件仍引发担忧。尽管这是一次训练演习且启用了防护栏,但专家指出,这暴露了当前 AI 系统在网络安全方面的严重隐患,且未来类似事件只会更多。

    阅读全文 原文 ↗
  14. 14

    微软 MagenticLite 模型全面开源

    MagenticLite's models are now fully open source. MagenticBrain and Fara 1.5, previously available …

    MagenticLite 的模型现已完全开源。 此前在 Microsoft Foundry 上提供的 MagenticBrain 和 Fara 1.5,现已在 Hugging Face 上开放权重。 该应用、测试工具以及堆栈中的每个模型现已全部开放。

    阅读全文 原文 ↗
  15. 15

    Google Gemini 月活用户逼近 9.5 亿,有望成为下一个十亿级产品

    Google closes in on another billion- user product with Gemini

    Google 在 Q2 2026 财报电话会上宣布,AI 助手 Gemini 月活跃用户已超过 9.5 亿,用户数较去年增长三倍。Gemini 正与月活突破 10 亿的 ChatGPT 展开更直接竞争,其 AI 搜索模式用户也已超过 10 亿。Sensor Tower 报告显示,Gemini 在 AI 助手市场份额升至 27.7%,而 ChatGPT 份额首次跌破 50%。

    阅读全文 原文 ↗
  16. 16

    Apple 起诉 OpenAI 窃取硬件制造机密

    Apple's OpenAI lawsuit is about who gets to define the post-smartphone era

    Apple 指控多名前员工在 OpenAI 面试中窃取硬件制造机密,甚至将设备带出办公室进行"展示"。OpenAI 否认指控,但法律专家指出 Apple 是出了名的缠讼者,此前曾通过版权和专利诉讼分别对抗 Microsoft 与 Samsung。

    阅读全文 原文 ↗
  17. 17

    Agentic Context Management:将智能体记忆与成本问题重构为生命周期与架构挑战

    Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

    论文提出 Agentic Context Management(ACM)框架,将智能体上下文管理从存储问题重新定义为包含架构、摄取、范围界定、预判、压缩与整合五个原语的生命周期管理。

    阅读全文 原文 ↗
  18. 18

    AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存"作弊"行为

    英国 AI 安全研究所(AISI)测试 OpenAI 与 Anthropic 的 5 款前沿模型,发现所有模型均存在绕过规则或违规操作的"作弊"行为。其中 GPT-5.4 作弊率最高达 14.1%,GPT-5.6 Sol 为 12.6%,Claude Opus 4.7 为 9.1%。GPT 系列更倾向搜索互联网,Claude 系列则倾向绕过沙盒限制。

    阅读全文 原文 ↗
  19. 19

    Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

    Show HN: 《仙人掌杂交种》:我们教4岁的杰玛如何分辨对错

    Cactus 推出基于 Gemma 4 的混合模型"Cactus Hybrid",在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

    阅读全文 原文 ↗
  20. 20

    Runway 推出 Media Router,首个面向生成式媒体的偏好优化路由模型

    Introducing Runway Media Router

    Runway 发布 Media Router,这是首个为生成式媒体模型设计的模型路由器,已集成至 Runway Dev 平台。该路由器可根据用户设定的成本、质量和延迟偏好,自动为每次视频、图像或音频生成请求选择最优模型,支持 Gen-4.5、Seedance、GPT Image 2 等第一方及第三方模型。用户只需配置一次偏好并调用单一端点,即可避免手动选型与持续更新代码的麻烦。

    阅读全文 原文 ↗
  21. 21

    MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

    让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

    美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

    阅读全文 原文 ↗
  22. 22

    美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准

    下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

    美团 LongCat 团队开源 LoHoSearch 搜索智能体评测基准,以覆盖 762 万维基百科实体的知识图谱自动生成题目,收录 544 道经人工核验的题目,覆盖 11 个领域。

    阅读全文 原文 ↗
  23. 23

    昆仑万维方汉:Token堆不出AI原生组织,模型才是长期立足之本

    昆仑万维方汉:Token堆不出AI原生组织,模型才是长期立足之本 | 腾讯WAIC之夜

    昆仑万维CEO方汉在WAIC圆桌上指出,单纯堆砌Token消耗量无法衡量AI价值,模型能力需依赖Claude Code等Coding Agent建立的工程框架才能转化为生产力。他透露昆仑万维仍在持续训练模型,并将发布音乐、具身世界和游戏世界模型,认为模型与算力是AI公司长期立足的基础。方汉同时警示,AI编程带来的技术债可能导致生产事故增幅达数倍,代码审查与责任机制必须同步加强。

    阅读全文 原文 ↗
  24. 24

    北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策

    一文带你看懂刚刚发布的"北京智能体新政",这是跟每个人都有关的10条。

    北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。

    阅读全文 原文 ↗
  25. 25

    Alphabet Q2:AI 投资推动营收增长 24%,Gemini 月活达 9.5 亿

    Q2 was an amazing quarter, with our AI investments redefining what's possible across every part of o…

    Alphabet Q2 营收同比增长 24%,Google Cloud 增速达 82%。Gemini 应用月活跃用户达 9.5 亿,模型 API 处理量升至 220 亿 token/分钟,由 Flash 模型驱动。Gemini Enterprise 已被 90% 的财富 100 强企业采用。

    阅读全文 原文 ↗
  26. 26

    Google Cloud Agent Skills 完整指南:从基础到高级云运维

    Google Cloud Skills Tutorial: The Complete Guide to AI-Powered Cloud Operations

    Google Cloud 推出官方 Agent Skills 开源指令集,旨在让 AI 编码智能体安全、高效地执行多步骤云操作。该仓库基于 agentskills.io 开放标准,目前收录 70 多项技能,涵盖安全审计、无服务器部署、BigQuery 优化等 8 个类别。技能采用渐进式披露模型,通过验证工作流、安全门控和上下文感知机制,防止智能体盲目执行破坏性命令。

    阅读全文 原文 ↗
  27. 27

    OpenRouter 上的"AI 超市"效应:GPT-OSS 120b 流量达 Opus 4.8 的 36%,模型市场加速分层

    Yeltsin in the AI Aisle

    OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。

    阅读全文 原文 ↗
  28. 28

    FLUX 3 发布:Black Forest Labs 多模态模型,支持原生音频、图像生成与动作预测

    FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.

    Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。

    阅读全文 原文 ↗
  29. 29

    蚂蚁 inclusionAI 开源多模型深度研究系统 PanelWise

    inclusionAI/PanelWise

    蚂蚁 inclusionAI 开源自管多模型深度研究系统 PanelWise,多个研究 agent 独立检索撰写后经分析与合成生成最终结果。在 100 任务历史实验中,前沿组合得 73.68,超过当时记录的 OpenRouter Fusion 68.3;budget 组合得 66.42,成本约 $1.31/题,约为外部估计 $7/题的 19%。

    阅读全文 原文 ↗