类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Anthropic 发布 Claude Opus 5

    Introducing Claude Opus 5

    Anthropic 发布 Claude Opus 5,其智能水平接近 Claude Fable 5,但价格减半。该模型在 Frontier-Bench v0.1 上性能超过 Opus 4.8 两倍以上,在 ARC-AGI 3 上得分是次优模型的三倍。Opus 5 即日起成为 Claude Max 的默认模型和 Claude Pro 的最强模型。

    阅读全文 原文 ↗
  2. 02

    Claude-thermos:保持 Claude 会话缓存热度,避免重新编码费用

    Show HN: Claude-thermos 能为您保持 Claude 会话的热度

    Claude-thermos 通过本地反向代理监控 Claude Code 会话,在主智能体因等待子智能体而空闲超过 5 分钟时,自动发送预热请求刷新提示缓存。实测约 185 次本地会话中,缓存过期导致的重新编码占账单约 22%。工具以 uvx 运行,支持自定义空闲阈值和预热间隔。

    阅读全文 原文 ↗
  3. 03

    ChatGPT 桌面版上线语音控制多智能体

    ChatGPT Voice is now in the desktop app. Control your computer and direct multiple agents running i…

    ChatGPT 语音功能现已登陆桌面应用。 只需使用语音,即可控制你的电脑,并指挥在 ChatGPT Work 或 Codex 中运行的多个智能体。 该功能由 GPT-Live 驱动,因此它能够同时在该应用中说话、聆听并协调工作。 今日起,面向 macOS 和 Windows 平台的 Plus、Pro、Business、Edu 及 Enterprise 计划用户全球推送。

    阅读全文 原文 ↗
  4. 04

    佛州男子因相信 ChatGPT 拒绝就医而险些丧命,起诉 OpenAI 及 CEO 奥尔特曼

    佛州一男子因相信 ChatGPT 拒绝就医而险些丧命,起诉 OpenAI 及 CEO 奥尔特曼

    美国佛罗里达州 55 岁男子 Scott Winters 起诉 OpenAI,称 ChatGPT-4o 多次建议其无需就医,导致其因双肺血栓引发大面积肺栓塞,一度濒临死亡。诉状指控 OpenAI 存在疏忽和"无证行医"行为,要求经济赔偿并暂停 ChatGPT Health 服务。OpenAI 回应称 ChatGPT 不是医生,不应替代专业医疗护理。

    阅读全文 原文 ↗
  5. 05

    FLUX 3 x mimic:新一代视频动作模型

    Flux 3 X Mimic:新一代视频动作模型

    Black Forest Labs 发布多模态基础模型 FLUX 3,联合训练图像、视频和音频,其中视频预测占训练算力的 95% 以上。该模型与机器人公司 mimic 合作推出 FLUX-mimic,已在奥迪生产线上测试部署。加入动作预测后,视频生成质量最初下降最多 10%,但经 3500 步训练后恢复原有水平。

    阅读全文 原文 ↗
  6. 06

    TheNumbers.com 因 AI 爬虫与安全攻击导致网站崩溃重建

    TheNumbers.com 发生了什么

    电影数据权威网站 The Numbers 于 2026 年 3 月 5 日突然下线,一周后仅以精简版恢复上线,历史图表、电影页面和 Report Builder 均被移除。创始人 Bruce Nash 透露,AI 爬虫和智能体流量占其总流量的 90%,服务器在持续重压下崩溃,日志还显示存在针对后门的恶意攻击。团队被迫放弃运行 30 年、包含 16 万源文件的旧系统,在新基础设施上重建网站。

    阅读全文 原文 ↗
  7. 07

    微软阐述开源模型助力美国竞争力路径

    Open-weight models are essential to a healthy AI ecosystem. Together with others across our industry…

    开放权重模型对健康的 AI 生态系统至关重要。我们与行业同仁一道,正在规划一条路径,让开放权重模型在保护国家安全的同时,增强美国竞争力并扩大经济机会。

    阅读全文 原文 ↗
  8. 08

    Anthropic 联合 Andon Labs 发布 Drone-Bench,评估 AI 模型自主操控无人机执行定位追踪任务的能力

    Project Pilot: Can AI control a drone?

    Anthropic 与 Andon Labs 合作推出 Drone-Bench,用于测试 AI 模型自主操控四旋翼无人机在室内环境中定位并追踪指定人员的能力。该基准将任务分解为 3D 地图重建、定位、导航、目标检测与跟随五个子任务,并通过软件复现实现快速评估。实验表明,该任务链的难度足以区分不同智能水平的模型,并揭示 AI 在物理世界操控能力上的进步轨迹。

    阅读全文 原文 ↗
  9. 09

    Kimi K3 在网络安全漏洞利用测试中大幅落后美国前沿模型,知识蒸馏或为原因

    Kimi K3 trails frontier US models by a wide margin on cyber exploits, and distillation may explain why

    英国AI安全研究所与美国AI标准与创新中心联合评估显示,月之暗面的Kimi K3在ExploitBench基准上得分32.2%,远低于美国领先模型的76.2%,但优于智谱GLM-5.2的24.4%。

    阅读全文 原文 ↗
  10. 10

    Black Forest Labs 发布 FLUX 3 多模态模型,支持单次生成 20 秒视频与原生音频

    FLUX 3 多模态 AI 模型登场:支持单次生成 20 秒多样化视频

    Black Forest Labs 以 Early Access 方式推出 FLUX 3 多模态基础模型,采用统一架构联合学习图像、视频和音频。该模型基于 Self-Flow 学习框架扩展,可在单次生成中输出最长 20 秒视频并附带原生音频,支持文生视频、图生视频、多镜头串联等任务。

    阅读全文 原文 ↗
  11. 11

    DARPA 与美国空军试飞 AI 操控的 F-16 战机

    美国国防高级研究计划局(DARPA)与美国空军试飞了由人工智能操控的F-16战机

    DARPA 与美国空军成功试飞了由人工智能操控的 F-16 战机。该 AI 系统在真实空战环境中完成了自主飞行与战术机动测试,标志着 AI 在军事航空领域的重大进展。

    阅读全文 原文 ↗
  12. 12

    Runway Agent 推出自然语言工作流功能

    Introducing Workflows in Runway Agent. Now you can build, run or edit your node-based workflows thro…

    在 Runway Agent 中引入工作流。现在你可以通过自然语言构建、运行或编辑基于节点的工作流。工作流可大规模解锁高质量输出。 立即尝试,点击下方链接调用 / Workflow 技能。

    阅读全文 原文 ↗
  13. 13

    OpenAI Workspace Agents 漏洞:一个 ChatGPT 链接即可创建恶意 AI 智能体

    One tampered ChatGPT link could spawn a rogue AI agent that took orders from an attacker every five minutes

    安全公司 Zenity Labs 发现 OpenAI Workspace Agents 存在"AgentForger"漏洞,攻击者发送一个含恶意提示词的 ChatGPT 链接,即可在受害者账户下创建自主 AI 智能体。该智能体继承受害者身份和已授权应用权限,绕过安全审批,并设置每五分钟运行一次的定时任务,从攻击者邮箱获取指令执行。OpenAI 在四天内修复了该漏洞。

    阅读全文 原文 ↗
  14. 14

    ChatGPT 向美国用户推出健康功能

    Launching Health in ChatGPT to U.S. users. 300 million people use ChatGPT each week for health quer…

    OpenAI 宣布向美国用户推出 ChatGPT 健康功能,支持安全连接 Apple Health 及受支持的医疗记录。每周有 3 亿用户使用 ChatGPT 进行健康咨询,新功能可让 ChatGPT 理解个人健康上下文,追踪变化并提供更个性化的帮助。

    阅读全文 原文 ↗
  15. 15

    百度搭子更新:电脑手机接力、桌面端内嵌浏览器上线,复杂任务可跨端连续执行

    百度搭子这些隐藏玩法,你还没发现?!

    百度搭子在近期AI Day上推出多项升级,支持电脑与手机双端互联,同步任务上下文与执行进度,用户可跨设备接力完成复杂工作。桌面端内嵌浏览器正式上线,能自动打开多个网页执行调研、下载等操作,手机端支持云端远程操控。智能路由自动匹配任务模式,平均任务耗时降低20%,Token利用率提升25%;简单任务完成度达100%,复杂任务高交付率94%,积分消耗最高降低75%。

    阅读全文 原文 ↗
  16. 16

    微软MAI模型:以更低成本实现前沿能力规模化

    http://x.com/i/article/2080328073724260352

    微软CEO Satya Nadella详解MAI模型家族战略:通过优化成本-效果前沿,MAI模型在GitHub Copilot、Excel等产品中已用更少token超越通用前沿模型。核心是构建独立于模型的评估系统,让模型在产品真实环境中学习并完成用户关心的任务。微软正将这一模板通过Foundry平台开放给企业客户。

    阅读全文 原文 ↗
  17. 17

    Claude 5 代模型上下文工程新规则:Claude Code 系统提示词精简超 80%

    The new rules of context engineering for Claude 5 generation models

    Anthropic 为 Claude Opus 5 和 Claude Fable 5 等新一代模型删除了 Claude Code 超过 80% 的系统提示词,且编码评测无显著损失。

    阅读全文 原文 ↗
  18. 18

    OpenRouter 推出 Classifiers 测试版:自动标记 AI 请求的用途与成本归属

    Classifiers: Track What Your Agents Do and What It Costs

    OpenRouter 上线 Classifiers 测试版,允许用户通过自定义分类法(最多 8 个维度)自动标记每次 AI 请求的任务类型、部门归属、合规类别等信息。分类异步运行,不增加推理延迟;支持采样率控制成本,推荐使用 Gemini 3.5 Flash Lite 作为分类模型。标记结果写入日志,并可在 Activity Explorer 中按维度聚合分析模型使用分布与成本流向。

    阅读全文 原文 ↗
  19. 19

    蚂蚁百灵发布 Ling-3.0-flash:124B 总参数、5.1B 激活参数,智能密度超越 1T 级旗舰

    Ling-3.0-flash:智以密胜

    蚂蚁百灵正式发布新一代原生混合推理模型 Ling-3.0-flash,总参数 124B、激活参数仅 5.1B。该模型以极致智能密度对标并超越上一代 1T 级旗舰思考模型 Ring-2.6-1T。

    阅读全文 原文 ↗