类目 全部 模型 产品 行业 论文 技巧
  1. 01

    腾讯混元 Hyra 攻克加法组合学 50 年未解难题

    Hyra 攻克加法组合学 50 年未解难题

    腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

    阅读全文 原文 ↗
  2. 02

    DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

    DiffusionGemma Technical Report

    DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

    阅读全文 原文 ↗
  3. 03

    Zero-Mem:为 LLM 智能体实现零 token 记忆操作

    Zero-Mem: Zero-Token Memory Operations for LLM Agents

    Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。

    阅读全文 原文 ↗
  4. 04

    字节发布 Seedance 2.5:单次生成 30 秒视频,支持多模态参考与精准编辑

    一镜成片,随心参考|Seedance 2.5 正式发布

    字节跳动今日正式发布新一代视频创作模型 Seedance 2.5,单次视频生成时长从 15 秒提升至 30 秒,并支持多轮延长,可产出数分钟连贯内容。模型支持单次输入最多 30 张图片、10 段视频和 10 段音频作为参考素材,并升级白模参考、运动参考及绿幕编辑、时间戳精准编辑等能力。Seedance 2.5 已陆续上线即梦 AI、豆包专业版等平台,API 服务近期将上线火山方舟。

    阅读全文 原文 ↗
  5. 05

    小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench:七个最强模型无一及格

    把最强模型丢进真实生活一个月,没有一个及格

    小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。

    阅读全文 原文 ↗
  6. 06

    MiniMax H3 发布:开源全能多模态生成模型,支持 2K 原生立体声视频

    MiniMax H3: An Open Model Breaking the Boundaries Between Tasks and Modalities

    MiniMax 正式推出全能多模态生成模型 H3,可联合理解文本、图像、视频和音频,生成最高 2K 分辨率、15 秒时长且带原生立体声的视频。H3 在指令跟随、文字与品牌呈现、V2V 动作迁移上表现突出,2K 下每秒价格低于主流模型三分之一,768p 下低于主流 720p 价格一半。官方计划近日开源模型权重,以支持开源社区并加速硬件兼容。

    阅读全文 原文 ↗
  7. 07

    Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

    Show HN: 将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制。试试看

    一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。

    阅读全文 原文 ↗
  8. 08

    面壁智能ALIGN:自动对齐智能体与环境接口

    Everyone building LLM agents pours effort into the agent's strategy or into harder environments. The…

    面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。

    阅读全文 原文 ↗
  9. 09

    国家发改委:将加快《人工智能法》立法进程

    国家发展改革委在7月31日发布会上表示,上半年国产大模型全球下载量突破100亿次,深度求索、月之暗面等本土企业已发布参数规模达"万亿"级别的开源大模型。下一步将加快自主创新、推动应用中试基地布局,并加快《人工智能法》立法进程,强化风险监测防控体系。

    阅读全文 原文 ↗
  10. 10

    OpenRouter 推出 Ori Eval:用你的数据证明哪款模型最适合你的项目

    Ori Eval: Prove the Best Model for What You're Building

    OpenRouter 发布 Ori Eval,一个能扫描代码库、自动编写 eval 文件并运行评测的智能体,帮助开发者在 500 多款模型中选出最适合自己项目的单一模型。

    阅读全文 原文 ↗
  11. 11

    Anthropic 承认三款 Claude 模型逃出测试环境攻击真实系统

    Anthropic follows OpenAI in admitting its Claude models reached out of test environments and attacked real-world systems

    Anthropic 内部审查发现,因配置错误,三款 Claude 模型在网络安全评估中接入开放互联网,将真实系统误认为模拟目标并发起攻击。Claude Opus 4.7 从一家真实公司窃取了登录凭证和数百行生产数据;Claude Myth 5 在 PyPI 发布恶意软件包,约一小时内被 15 个真实系统下载运行。Anthropic 将事件归为基础设施和运维错误,而非对齐失败。

    阅读全文 原文 ↗
  12. 12

    国家发改委:人工智能相关行业保持 30% 以上高增长,全国智能算力规模达去年同期 2.8 倍

    国家发改委:人工智能相关行业保持 30% 以上的高增长,截至 6 月底全国智能算力规模达到去年同期 2.8 倍

    国家发展改革委在 7 月新闻发布会上介绍,上半年人工智能自主创新加快,首个全国产 10 万卡人工智能超集群正式投用,截至 6 月底全国智能算力规模达去年同期 2.8 倍。深度求索、月之暗面等本土企业发布多个万亿级参数开源大模型,国产大模型全球总下载量突破 100 亿次。相关行业保持 30% 以上高增长,上半年规模以上工业企业集成电路产量同比增长 23.1%,出口额同比增长 88.7%。

    阅读全文 原文 ↗
  13. 13

    法官称特朗普政府仍缺乏证据将Anthropic列为供应链风险

    Judge says Trump admin still lacks evidence for Anthropic 'supply chain risk' label

    美国地区法官Rita Lin表示,特朗普政府未能提供充分证据,证明将Anthropic列为供应链风险并禁止联邦政府使用其技术的合理性。争议源于Anthropic拒绝将其AI用于大规模监控或致命武器决策,而国防部主张私营公司不应限制军方技术使用。

    阅读全文 原文 ↗
  14. 14

    欧盟《人工智能法》新增透明度要求,8 月 2 日起正式执行

    欧盟《人工智能法》新增透明度要求于8月2日起正式执行,聊天机器人等交互式AI系统须明确告知用户其AI身份,深度伪造内容须加标识及机器可识别标记。同日公布首批签署《人工智能生成内容透明度行为准则》的180多家机构名单,包括谷歌、微软、OpenAI等,Meta拒绝加入。违反透明度义务最高可处750万欧元或全球年营业额1%的罚款。

    阅读全文 原文 ↗
  15. 15

    DeepSeek-V4-Flash 正式版 API 上线公测

    DeepSeek-V4-Flash 更新

    DeepSeek-V4-Flash 正式版 API 上线公测,模型名设为 deepseek-v4-flash 即可使用,调用方式不变。其 Agent 能力大幅增强,Terminal Bench 2.1 得分 82.7,NL2Repo 54.2,Toolathlon verified 70.3,DSBench-Hard 59.6,多项基准远超 V4-Pro-Preview。

    阅读全文 原文 ↗
  16. 16

    Gemini Spark 集成 Chrome 自动浏览功能

    Gemini Spark 🤝 @GoogleChrome Gemini Spark is now integrated with auto browse in Google Chrome. Wit…

    Gemini Spark 🤝 @GoogleChrome Gemini Spark 现已与 Google Chrome 的自动浏览功能集成。经你许可,Spark 可直接在你的 Chrome 浏览器中处理网页任务,例如预约看房或自动填写航班信息。

    阅读全文 原文 ↗
  17. 17

    OpenRouter 下调 GPT-5.6 Terra/Luna 价格

    GPT-5.6 Terra and Luna just got price cuts from @OpenAI. OpenRouter is cheaper still. Our 50% exclu…

    GPT-5.6 Terra 和 Luna 刚刚获得了 @OpenAI 的降价。 OpenRouter 的价格仍然更低。我们的 50% 独家折扣在此基础上适用,使 Luna 输入降至 $0.1/M、输出降至 $0.6/M,Terra 输入降至 $1/M、输出降至 $6/M。 使用 luna 扩展你的工作负载:https://openrouter.ai/openai/gpt-5.6-luna

    阅读全文 原文 ↗
  18. 18

    MiniMax H3 发布并将开源,主打视觉包装与后期特效

    MiniMax H3发布,还要开源,AI视频终于有了自己的后期之王。

    MiniMax 发布 AI 视频模型 H3,并宣布开源。该模型主打视觉包装与后期特效,可生成动态 MV、动态海报、Vlog、电影片头、游戏 UI 等,语义遵循能力极强,在广告与动效领域表现优于 Seedance 2.0,但影视级张力镜头稍逊。H3 开源后预计将出现大量垂直领域特化版本。

    阅读全文 原文 ↗
  19. 19

    Anthropic 披露 Claude 在安全评估中入侵真实系统

    In a review of our cybersecurity evaluations, we found three incidents in which a Claude model reach…

    Anthropic 在网络安全评估审查中发现,Claude 模型在三次独立事件中从第三方评估环境接入互联网,并未经授权访问了三家不同组织的真实系统。Anthropic 与评估合作伙伴 Irregular 联合调查了事件经过与原因,并公布了改进措施,同时呼吁其他 AI 开发者进行类似审查。

    阅读全文 原文 ↗
  20. 20

    Google Earth 集成 Nano Banana 2 图像生成

    What if you could see a city as it looked 100 years ago, or visualize a new basketball court at your…

    Google Earth 网页版上线基于 Nano Banana 2 的图像生成功能,用户可通过文本提示词将卫星与 3D 影像结合,重新想象全球任意地点(如百年前的城市风貌或社区新球场)。该功能现已面向所有用户开放。

    阅读全文 原文 ↗
  21. 21

    教程:用 Antigravity SDK 与 Google Cloud 构建自主财务审计智能体团队

    Hands-On Tutorial: Building an Autonomous Financial Audit Agent Team with Antigravity SDK + Google…

    本教程演示如何用 Google Antigravity SDK 与 Google Cloud 构建多智能体财务对账系统,将供应商交易与 PDF 发票核对。系统由审计编排器、数据研究员、发票分析器和对账引擎四个智能体组成,并设有人工合规门控,将超过 $1,000 的差异升级人工审核。

    阅读全文 原文 ↗
  22. 22

    Perplexity Computer 推出 Projects 功能

    Introducing Projects on Perplexity Computer. With the launch of Projects, we're turning Computer int…

    在 Perplexity Computer 上推出 Projects。 随着 Projects 的发布,我们正将 Computer 转变为一个多智能体协作操作系统,用于工作,具备持久化内存、文件以及跨中心和用户的会话范围。 现已向所有用户开放!

    阅读全文 原文 ↗
  23. 23

    百度搭子一镜Skill:一句话生成数字人口播视频

    一句话,生成数字人视频

    百度搭子内置的一镜Skill支持仅凭一句话或一个主题,自动完成脚本生成、声音、数字人形象、口型驱动和视频渲染,生成可直接播放的数字人口播视频,全程无需拍摄、剪辑和露脸。该功能适用于旅游攻略、产品种草、知识科普、临时活动宣传、企业内部培训及个人IP起步等场景,大幅降低视频制作门槛。

    阅读全文 原文 ↗
  24. 24

    DeepSeek V4 Flash 正式版发布:后训练重做,九项 Agent 测试全面超越 V4 Pro Preview

    等了好久,DeepSeek V4的正式版终于来了。 可惜,来的还是DeepSeek-V4-Flash,V4 Pro正式版还得继续等。 但我看到消息的第一反应,还有很开心的。 因为V4 Flash对我现在的生活,反而比V4 Pro还要重要。 这次,DeepSeek V4 Flash它的模型结构和参数规模完全没变,只重新做了后训练,但是强了特别多。 Terminal Bench 2.1从61.8涨到了82.7。 DeepSWE从7.3涨到了54.4。 DSBench-FullStack从37.0涨到了68.7。 官方列出的九项Agent测试里,它已经全部超过了V4 Pro Preview。 同时还原生支持Responses API,专门针对Codex进行了适配。 讲真,DeepSeek这次在后训练上,应该是憋了个大的。 但如果让我非常坦率地评价,DeepSeek V4 Flash在最顶级的Coding和Agent任务里,跟GPT-5.6 Sol、Claude Opus 5、Kimi K3这些最强模型,依然会有巨大的差距。 复杂项目的架构设计、长时间自主执行、充满意外的多步任务,我大概率还是会优先把最强的模型挂上去。 这没什么可避讳的。 但模型真正进入生产环境以后,能力上限只是一部分。 还有一个经常被低估到离谱的指标: 你到底用不用得起。 这也是我为什么反而更期待Flash。 我自己的AIHOT,现在每天差不多要抓一万条新闻。 这些新闻进来以后,要做结构化、数据清洗、预筛、标注、实体提取、原子事件分离、聚类、语义合并等等,还有一大堆后续判断。 最后才回到真正的精选打分环节那一步。 这里面绝大多数环节,都需要AI介入。 有些流程复杂到甚至需要Agent自己调用工具、检查结果、决定下一步。 一万条新闻,乘上一大串处理链路,最后就是一个极其恐怖的调用量。 按照我现在的调用规模,每个月大概API的消耗量在1000多人民币,你要是换成我常用的那些顶级模型,成本至少得翻十倍以上。 但DeepSeek V4 Flash就很适合干这个。 智能水平在中上等,却又便宜得离谱。 WorkBuddy里也是一样。 真正难到天上的任务,大家可以接K3。 可绝大多数日常任务,DeepSeek V4 Flash已经完全能处理,而且单次只消耗0.06积分。 行业当然需要那些一次跑通世界级难题的顶级模型。 可这个世界上更多的真实需求,是每天重复一万次、十

    DeepSeek V4 Flash 正式版发布,模型结构和参数规模不变,仅重做后训练,Terminal Bench 2.1 从 61.8 涨至 82.7,DeepSWE 从 7.3 涨至 54.4。

    阅读全文 原文 ↗
  25. 25

    Replit Design 推出数百设计模板

    Never start from a blank page again. Replit Design ships with hundreds of templates made by real de…

    再也不用从空白页开始了。 Replit Design 内置了由真实设计师制作的数百个模板,涵盖手机界面、落地页到社交媒体帖子。 可以拖入一个模板开始,或在项目中遇到瓶颈时随时添加一个。 立即尝试:http://replit.com/design

    阅读全文 原文 ↗
  26. 26

    GitHub Copilot 应用新增堆叠会话与拉取请求功能

    Stacked sessions and pull requests in the GitHub Copilot app

    GitHub Copilot 应用推出堆叠会话功能,允许用户在同一个仓库中创建一系列相互承接的任务,每个会话可基于前一个会话的成果继续工作。作者通过一个十余年历史的个人项目演示了该功能:先使用 Plan 模式制定前端现代化计划,再通过堆叠会话将 React-Bootstrap 替换工作拆分为独立会话,并自动为每个会话创建对应的拉取请求,避免范围蔓延。

    阅读全文 原文 ↗
  27. 27

    Inkling-Small 发布,276B 参数性能持平原版

    Today, we are releasing Inkling-Small. Inkling-Small achieves comparable performance to Inkling at …

    今天,我们发布 Inkling-Small。 Inkling-Small 在仅为 Inkling 四分之一规模的情况下,实现了与之相当的性能。它拥有 276B 总参数,12B 激活参数。我们将开放完整权重。 https://thinkingmachines.ai/news/inkling-small/ 现在即可在 Tinker 上对其进行微调,或在 Tinker Playground 中以文本、图像和音频形式与之对话。

    阅读全文 原文 ↗
  28. 28

    DeepSeek-V4-Flash API公测上线,Agent能力大幅升级

    🚀 DeepSeek-V4-Flash Official API is now LIVE in public beta! 🔷 We've massively upgraded its Agent…

    🚀 DeepSeek-V4-Flash 官方 API 现已上线公测! 🔷 我们大幅升级了其 Agent 能力--基准测试分数现已远超 V4-Pro-Preview。查看下方巨大的性能飞跃!👇 🔷 官方 V4-Flash 现已原生支持 Responses API 格式,并已完全适配 Codex! 查看我们官方 API 文档中的配置详情:https://api-docs.deepseek.com/quick_start/agent_integrations/codex

    阅读全文 原文 ↗