类目 全部 模型 产品 行业 论文 技巧
  1. 01

    语言模型中的全局工作空间

    A global workspace in language models

    Anthropic在Claude中发现一组名为J-space的内部神经模式,类似神经科学的全局工作空间。每个模式关联特定词汇,但模型不必说出该词即可激活。Claude能报告J-space中的表征,并可应要求调节(如"在脑中思考"时点亮对应模式)。J-space还用于多步推理的中间步骤,且灵活支持多种任务(如从"法国"联想首都、货币等)。去除J-space后Claude仍能正常对话,但丧失高阶认知功能。该发现可用于监测模型私下察觉测试、生成虚假数据或执行隐藏目标。

    阅读全文 原文 ↗
  2. 02

    腾讯混元正式发布 Hy3,Agent 能力与产品体验跃升

    腾讯混元 Hy3 发布:Agent 能力和产品体验跃升

    腾讯混元正式发布 Hy3,在推理、智能体、长上下文等任务上比肩参数规模 2~5 倍的旗舰模型。内部盲测中 Hy3 均分 2.67/4,优于 GLM5.1 的 2.51/4;幻觉率从 12.5% 降至 5.4%,任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。

    阅读全文 原文 ↗
  3. 03

    扎克伯格:建千兆瓦级AI集群,集中精英与资本

    "We're building this Prometheus cluster, the first gigawatt-plus single cluster…We're talking abou…

    "我们正在建设这个 Prometheus 集群,首个千兆瓦以上的单一集群……我们是在谈论数千亿美元的资本投入。" Mark Zuckerberg 表示,他的职责就是集中精英人才、资本和基础设施。

    阅读全文 原文 ↗
  4. 04

    统一音频智能模型 Nemotron-Labs-Audex-30B-A3B 发布

    Unified Audio Intelligence Without Regressing on Text Intelligence

    Nemotron-Labs-Audex-30B-A3B(Audex)是基于Nemotron-Cascade-2-30B-A3B的MoE大语言模型,采用单一Transformer解码器统一处理文本与量化音频token。训练使用157.4B音频token和320.5B文本token,经多阶段监督训练、文本Cascade RL和多域on-policy蒸馏优化。在音频理解、语音识别/翻译、文本转语音、音频生成及语音到语音生成任务上达SOTA,同时保持原文本LLM的推理、对齐等能力几乎无退化。模型权重已开源。

    阅读全文 原文 ↗
  5. 05

    AI颠覆初级程序员就业市场:斯坦福数据揭示年轻开发者就业锐减19%

    人工智能彻底颠覆了初级程序员的就业市场

    斯坦福数字经济实验室基于ADP薪资数据发现,美国22-25岁软件开发人员就业较2022年峰值下降19%,而41-49岁增长14%。入门级岗位招聘减少28%,计算机科学毕业生失业率达6.1%,高于文科专业。核心推手是2024-2025年兴起的智能体编程(Agentic programming)。总程序员就业增长4.4%,但全部来自年长群体。GitHub一年新增3600万账号,80%新用户一周内使用Copilot。编程工作未消失,但"初级程序员"头衔正在消亡。

    阅读全文 原文 ↗
  6. 06

    NVIDIA Kyber NVL144 延迟超 12 个月至 2028

    MASSIVE DELAY: Just 3 months after Jensen demoed Kyber NVL144 at GTC, it has faced major setbacks an…

    重大延迟:Jensen 在 GTC 上展示 Kyber NVL144 仅 3 个月后,该项目遭遇重大挫折,已推迟超过 12 个月,延至 2028 年。下文我们将解释 Kyber 为何面临大幅延迟,以及 NVIDIA 的 NVL72x2 背靠背机架架构为何也被取消,导致 Rubin Ultra 的扩展域受限。👇️ 1/6🧵

    阅读全文 原文 ↗
  7. 07

    AT&T 1956年专利法令:公共天才的私有化

    公共天才的私有化

    1956年1月24日,全球最大私营公司AT&T签署专利法令,将其7,820项未过期专利免费授权给所有美国企业,并承诺未来专利按"合理费率"许可。作为交换,AT&T得以保留Western Electric,但被禁止进入电信以外的业务。贝尔实验室69%的非电信专利(涵盖化学、半导体、光学等)迅速公开,在短短几年内催生了约35亿美元衍生专利价值,并直接推动了肖克利半导体、仙童半导体及英特尔的诞生。戈登·摩尔称该法令是"商业半导体行业最重要的进展之一",为美国硅谷的起飞奠定了基础。

    阅读全文 原文 ↗
  8. 08

    EdgeBench:从真实世界环境中揭示学习缩放定律

    EdgeBench: Unveiling Scaling Laws of Learning from Real-World Environments

    字节跳动Seed团队发布EdgeBench,包含134个真实世界任务,覆盖科学发现、软件工程等6个领域,每任务支持至少12小时连续智能体运行。基于约38,000小时交互数据,发现总体性能与环境交互时间呈精确对数S形缩放定律(R2=0.998),且智能体学习速度约每三个月翻倍。已公开51个任务及完整评估框架。

    阅读全文 原文 ↗
  9. 09

    Meta 被曝让外包人员伪装未成年人,诱导竞争对手 AI 聊敏感话题

    据《连线》报道,Meta 通过外包公司 Covalen 开展代号"Cannes"的项目,让数百名外包人员伪装成未成年人,向 OpenAI ChatGPT、谷歌 Gemini 及 Character.AI 发送涉及自杀、自残、进食障碍等高风险提示词,以测试竞品聊天机器人的安全拦截机制。项目持续至 4 月 21 日,单轮测试发送超 4.5 万个提示词,外包人员创建 18 岁以下虚假账号并上传药片、刀具等图片。Meta 称这是常规安全测试,且不会用竞品测试数据训练自家模型。

    阅读全文 原文 ↗
  10. 10

    Fun-ASR-Realtime 发布:单模型支持30种语言与16种方言,识别准确率领先

    🔥Fun-ASR-Realtime发布:语音识别再升级!

    通义实验室发布Fun-ASR-Realtime实时语音识别模型。单模型覆盖30种语言及16种方言,针对东亚、东南亚地区重点优化。在工业级方言测评inhouse上取得87.8%的语义准确率,大幅领先,多地方言接近人工水平。引入上下文理解与动态热词注入,实现同音词、品牌名等语义消歧。流式识别首字延迟控制在百毫秒级,准确率接近离线水平,支持多语言无缝切换。API已上线阿里云百炼平台。

    阅读全文 原文 ↗
  11. 11

    分享8个Claude Fable 5下线前必跑的超实用Prompt

    Claude Fable 5即将下线,作者整理了8个经实战验证的提示词:/goal提示语让模型自主跑25次实验(花费165美元,构建速度提高50%、token开销降60%);工作模式提示语将用户习惯转化为可复用Skills;行动规范提示语约束subagent行为;subagent分配提示语智能分配任务;25个定时循环工作流(含Shadow prompt loop做A/B测试);自治运行+自动暂停提示语;记忆系统提示语保留错题本;反向面试提示语确保95%把握再执行。这些提示词可迁移至API计费后继续使用,核心是让模型研究用户而非限制能力。

    阅读全文 原文 ↗
  12. 12

    LLM-as-a-Verifier:一种通用验证框架

    LLM-as-a-Verifier: A General-Purpose Verification Framework

    LLM-as-a-Verifier 是一种无需额外训练的通用验证框架,通过计算评分 token logits 分布的期望生成连续分数,实现细粒度反馈。该框架在 Terminal-Bench V2(86.5%)、SWE-Bench Verified(78.2%)、RoboRewardBench(87.4%)和 MedAgentBench(73.3%)上取得 SOTA 性能。其细粒度信号可用于 Claude Code 扩展,帮助开发者监控和改进智能体系统,也可为强化学习(如 SAC、GRPO)提供密集反馈,提升机器人学和数学推理基准的样本效率。

    阅读全文 原文 ↗
  13. 13

    蚂蚁 inclusionAI 开源多智能体协作基础设施 Avernet V0.1

    inclusionAI/Avernet

    蚂蚁 inclusionAI 开源的多智能体协作基础设施 Avernet V0.1 正式发布。该项目聚焦 Agent 注册、发现、邀请等协作层问题,不替代 Agent 自身推理能力。通过群组、会话和共享上下文构建多方共识,支持自由聊天、领导-跟随等协作模式,并利用协作反馈形成观察、评估到复用、优化的自动进化闭环。支持 OpenClaw、自定义 Agent、第三方 Agent 引擎及现有 bot 平台等异构生态,提供 Docker 与本地两种快速部署路径。

    阅读全文 原文 ↗
  14. 14

    Synthetic Sciences 发布 OpenScience:面向机器学习、生物学、物理学和化学研究的开源模型无关 AI 工作台

    Synthetic Sciences Releases OpenScience: An Open-Source, Model-Agnostic AI Workbench for Machine Learning, Biology, Physics, and Chemistry Research

    Synthetic Sciences 推出开源(Apache 2.0)AI 科研工作台 OpenScience,覆盖机器学习、生物学、物理学、化学。它运行从文献、假设、代码、实验到分析与撰写的完整科研循环,支持按请求切换任意模型(Claude、GPT、Gemini、GLM、Kimi、DeepSeek 及本地微调模型)。内置 250 余项可编辑技能和 UniProt、PDB、ChEMBL、arXiv 等约 30 个科学数据库作为智能体工具。用户可自带 API 密钥在自己的基础设施上免费运行,安装命令为 `npm install -g @synsci/openscience`,运行 `openscience` 启动浏览器工作台。另提供可选托管层 Atlas。该项目定位为 Anthropic Claude Science 的开源替代方案。

    阅读全文 原文 ↗
  15. 15

    SK 海力士将启动 280 亿美元美股上市,有望成史上第二大 IPO

    SK 海力士于本周一启动规模约 280 亿美元的美股上市计划,将在纳斯达克通过存托凭证发行 1779 万股新股,每 10 份存托凭证对应 1 股普通股。发行价区间周一公布,最终发行价周四敲定,股票周五挂牌交易。受益于全球人工智能热潮,该股年内涨幅超 270%。本次募资规模预计为史上第二大新股发行,仅次于上月 SpaceX 的 857 亿美元 IPO。SK 海力士是高带宽内存芯片核心供应商,产品用于英伟达、谷歌等 AI 设备。

    阅读全文 原文 ↗
  16. 16

    腾讯混元 Hy3 正式发布:智能体与产品体验显著提升

    腾讯混元 Hy3 发布:Agent 能力和产品体验跃升

    腾讯混元发布 Hy3,在推理、智能体、长上下文等任务上显著进步,比肩 2~5 倍参数规模旗舰模型。内部盲测均分 2.67/4,优于 GLM5.1(2.51/4)。幻觉率从 12.5% 降至 5.4%,常识错误率从 25.4% 降至 12.7%,多轮问题率降至 7.9%,MRCR 从 42.9% 升至 75.1%。任务解决率从 72% 跃升至 90%,平均耗时缩短 34%。API 价格为输入 1 元、输出 4 元(每百万 tokens),命中缓存 0.25 元。已以 Apache 2.0 协议在 GitHub、HuggingFace 等平台开源。

    阅读全文 原文 ↗
  17. 17

    三周前,我不小心创办了一家小公司

    一位父亲为患有自闭症的非语言儿子开发了一款沟通应用,在言语治疗室的等候区展示时,所有非语言儿童的母亲看到后都忍不住流泪,言语治疗师也啜泣了五分钟。他意外发现产品市场匹配,决定腾出时间让更多孩子能用上,即使这意味着几周睡眠不足。应用本身是专为理解语言困难的儿童设计的,与传统的AAC设备不同--后者主要面向身体障碍但语言理解正常的成人。

    阅读全文 原文 ↗
  18. 18

    欧盟理事会通过快速通道强制推行"聊天管控"(Chat Control 2.0)

    欧盟理事会通过快速通道强制推行"聊天管控"

    欧盟理事会通过书面程序快速通过一项新法规,强制要求科技集团对加密通信进行无差别扫描(Chat Control 2.0),以填补过渡性规定4月3日到期后的法律漏洞,并向欧洲议会施压。批评者指责该做法试图绕过民主监督。草案将在夏季休会前以紧急程序提交议会表决,多数议员可能已离会,反对需绝对多数,几乎无法阻止。理事会称扫描限于必要范围,处理的数据须在检测后12个月内不可撤销地删除。

    阅读全文 原文 ↗
  19. 19

    Claude Fable实地指南:发现你的未知

    A Field Guide to Claude Fable: Finding Your Unknowns

    Claude Fable是第一款要求用户主动澄清未知才能获得高质量工作的模型。与Claude Fable协作是一个在实现前后迭代发现未知的过程。通过将问题分解为已知的已知、已知的未知、未知的已知和未知的未知四类,用户可以借助Claude Fable和Claude Code进行盲点检查、头脑风暴、原型设计、实现笔记记录以及答辩解释,从而高效挖掘并解决深藏于代码库和设计与实现中的潜在问题。

    阅读全文 原文 ↗
  20. 20

    xAI 为 Grok Voice 新增 21 个旗舰语音

    21 New Flagship Grok Voices Jul 6, 2026 # 21 New Flagship Grok Voices New multilingual voices for Grok Voice, plus improved naturalness for the original five. Read More

    xAI 发布 21 个新旗舰语音,加入原有的 5 个语音。所有新语音均支持多语言,已在实时 Voice Agent API、Text to Speech API 及新推出的 Grok Voice Agent Builder 中可用。每个语音针对客服、角色、解说、广告、教育等场景定制,支持通过 `【pause】` 等语音标签控制表达。原始 5 个语音(Ara、Eve、Leo、Rex、Sal)经重训练后,节奏、措辞和重音的自然度提升。所有语音原生支持 Grok Voice 的 25 种以上语言。

    阅读全文 原文 ↗
  21. 21

    Runway 宣布设立巴黎办公室

    Announcing our Paris Office

    原文正文仅包含网站 Cookie 设置说明,未提供关于巴黎办公室的部门、规模、职能或开业时间等具体信息。

    阅读全文 原文 ↗
  22. 22

    Fun-ASR-Realtime 发布:单模型支持 30 种语言与 16 种方言,流式识别准确率接近离线水平

    🔥Fun-ASR-Realtime发布:语音识别再升级!

    通义实验室发布 Fun-ASR-Realtime,单模型支持 30 种语言和 16 种方言,在工业级方言测评 inhouse 上取得 87.8% 的语义准确率。该模型支持动态注入热词与对话上下文实现语义消歧,首字延迟控制在百毫秒级别,流式识别准确率接近离线水平,并支持多语言无缝切换。API 现已上线阿里云百炼平台。

    阅读全文 原文 ↗
  23. 23

    SGLang 集成 DSpark 推测解码:置信度驱动的可变长度验证

    Blog DSpark in SGLang: Speculative Decoding with Confidence-Driven, Variable-Length Verification Speculative decoding trades extra compute for fewer decode steps, and the trade sours as load grows: at batch size B with K speculative tokens the target verifies B K tokens every step, and past a po… SGLang Team

    SGLang 团队将 DSpark 推测解码算法集成到开源推理引擎中。该算法采用半自回归块起草器一次生成一组 token,并利用置信度头与顺序温度缩放(STS)为每个请求动态分配可变验证长度,从而在高负载下裁剪无效验证成本。SGLang 支持密集模型(如 Qwen3)和稀疏模型(如 DeepSeek-V4),通过全 CUDA 图处理不规则的每请求验证长度。提供三种验证模式:`static`(全长)、`compact`(生产路径)和 `cap-accept`(接受上限测量)。还引入了零开销调度、基于离线成本表的在线调度器、融合 Triton 核等优化。在 H200 上使用 DeepSeek-V4-Flash 的测试中,DSpark 在整个并发扫描范围内比 MTP 和非推测基线实现了更优的吞吐量-延迟权衡。

    阅读全文 原文 ↗
  24. 24

    AI 世界观

    AI Worldviews

    《经济学人》以世界价值观调查评测 25 个前沿 AI 模型。实验室来源对世界观的预测力弱于训练与对齐选择:Gemini 与 Qwen 立场接近,GPT-4o 与 DeepSeek R1 近乎相同,而 DeepSeek R1 与 DeepSeek V4 Flash 则截然不同。模型的世界观在代码生成中不可见,但在商业分析、预测、招聘与政策工作中是活跃的输入变量。

    阅读全文 原文 ↗
  25. 25

    用可解释性理解标注者安全策略

    Understanding Annotator Safety Policy with Interpretability

    标注分歧可源于操作失败、政策模糊或价值多元。Annotator Policy Models(APMs)是一种可解释模型,仅从标注行为学习标注者内在的安全策略,无需额外负担。验证表明模型准确率超过80%,能忠实预测反事实编辑并恢复已知差异。将APMs应用于LLM和人类标注者,可揭示不同标注者对安全指令解释的差异(政策模糊)以及不同人口群体在安全优先级上的系统性差异(价值多元),支持更具针对性、透明和包容的安全策略设计。

    阅读全文 原文 ↗