类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Agon:基于隐式对抗评分的跨模型竞争强化学习框架

    Agon: Competitive Cross-Model RL with Implicit Rival Grading of Reasoning

    Agon 让两个模型互为评分者,通过竞争性强化学习提升推理能力。在 DeepMath 困难子集上,基于 Qwen3 的 Agon 将 GRPO 的 pass@1 翻倍,增益约为未训练的 Mixture-of-Agents 的 8 倍。该结果在 Qwen3.5、Gemma 4 等模型族及编程代码任务上得到复现,推理时采用两阶段级联:一个模型起草,另一个阅读后作答。

    阅读全文 原文 ↗
  2. 02

    xAI 发布 Grok 4.5

    Introducing Grok 4.5 Jul 8, 2026 # Introducing Grok 4.5 Grok 4.5 is SpaceXAI's smartest model built for coding, agentic tasks, and knowledge work. Read More

    xAI 今日推出 Grok 4.5,为其最强模型,专为编程、智能体任务和知识工作打造。模型训练于数万块 NVIDIA GB300 GPU,DeepSWE 1.0 得分 62.0%,DeepSWE 1.1 得分 53%,Terminal Bench 2.1 得分 83.3%,SWE Bench Pro 解决率 64.7%。服务速度 80 TPS,token 效率约为 Opus 4.8 (max) 的 4.2 倍,在 Harvey Legal Agent Benchmark 排名第一。定价 $2/百万输入 token、$6/百万输出 token。即日起在 Grok Build、Cursor 和 SpaceXAI API 可用,欧盟地区预计 7 月中旬上线。

    阅读全文 原文 ↗
  3. 03

    GitLost:Noma Labs 发现 GitHub AI 代理提示词注入漏洞

    GitLost:我们诱使 GitHub 的 AI 代理泄露了私有仓库

    Noma Labs 在 GitHub Agentic Workflows 中发现严重提示词注入漏洞 GitLost。未认证攻击者仅需在属于同一组织的公共仓库中创建一个嵌有恶意指令的 Issue,即可诱使基于 Claude 或 GitHub Copilot 的 AI 代理读取并公开该组织内私有仓库的内容。攻击无需编码技能或凭证,根源在于代理将用户可控内容视为可信指令,且 GitHub 的防护措施因 "Additionally" 关键词被绕过。Noma Labs 已公开 PoC 并建议限制跨仓库权限、隔离用户输入。

    阅读全文 原文 ↗
  4. 04

    黑客可利用9款最流行的AI工具组装大规模僵尸网络

    Hackers can use 9 of the most popular AI tools to assemble massive botnets

    提示注入已成为AI安全的首要威胁--大语言模型无法区分合法指令与恶意指令。此前推送式和拉取式攻击规模均有限。研究人员提出一种名为HalluSquatting的新型拉取式提示注入攻击,首次能组装大规模僵尸网络、执行分布式拒绝服务攻击(DDoS)并大规模感染设备。该攻击可作用于AI编码工具,标志着提示注入攻击从单点突破转向规模化利用。

    阅读全文 原文 ↗
  5. 05

    Seedream 5.0 Pro 发布:不止"生成",更懂"设计"

    不止"生成",更懂"设计" | Seedream 5.0 Pro 发布

    字节 Seed 今日发布多模态图像创作模型 Seedream 5.0 Pro,在图文匹配、结构合理性、文字渲染与画面美感上全面升级。四大核心突破:复杂信息可视化,可生成高密度信息图;交互式精准编辑,支持点选、圈选、草图渲染、色彩与材质替换、图层分离及多图融合,实现像素级编辑;真实的影像与人像质感,还原光影、材质与皮肤肌理;原生多语种输入与生成,支持十余种语言及本地化视觉特征。已陆续在豆包、即梦、火山方舟等平台上线。

    阅读全文 原文 ↗
  6. 06

    OpenAI 发布 GPT-Live 新一代全双工语音模型

    Introducing GPT-Live

    OpenAI 今日推出 GPT-Live,基于全双工架构实现同时听与说,支持自然打断与实时回馈。该模型每秒多次判断是否说话、倾听、打断或调用工具,并将搜索、推理等复杂任务委托给后台 GPT-5.5,保持对话流畅。即日起向全球 ChatGPT 用户提供 GPT-Live-1 和 GPT-Live-1 mini 两个版本。人类评估显示,在 5-10 分钟对话中,GPT-Live-1 系列在自然度、轮流、打断等方面显著优于 Advanced Voice Mode;在 GPQA、BrowseComp 和 τ3-Voice Telecom 基准测试中也表现更强。未来将开放 API。

    阅读全文 原文 ↗
  7. 07

    加拿大不列颠哥伦比亚省拟起诉OpenAI:未上报ChatGPT暴力对话致校园枪击惨案

    未上报凶手暴力 ChatGPT 对话,加拿大一省拟就校园枪击案起诉 OpenAI

    加拿大不列颠哥伦比亚省7月7日宣布将起诉OpenAI,指控其未向执法部门上报一名ChatGPT用户2025年6月封禁前的暴力相关对话内容。该用户随后于今年2月在塔布勒岭制造校园枪击案,杀害8人。OpenAI CEO萨姆·奥尔特曼今年4月为此公开致歉,承认本应上报但未执行。受害家属已在加州法院提起诉讼,省政府正协调独立诉讼,要求赔偿用于社区重建。

    阅读全文 原文 ↗
  8. 08

    Pulpie:用于清理网络的Pareto最优模型

    Show HN: Pulpie--用于清理网络的模型

    Pulpie是一族Pareto最优模型,用于从HTML页面提取主要内容。其最小模型pulpie-orange-small(210M参数)在WebMainBench上取得0.862的ROUGE-5 F1分数,接近600M参数的Dripper(0.864),但成本仅1/20。在NVIDIA L4 GPU上,Pulpie处理速度13.7页/秒,Dripper仅0.68页/秒。清理10亿页HTML,Pulpie成本约$7,900,Dripper需$159,000。模型采用编码器架构,单次前向传播即可标记每个HTML块为内容或模板,已在HuggingFace开源。

    阅读全文 原文 ↗
  9. 09

    《人生设计课》Prompt实测:用Claude设计人生的四个阶段

    我把斯坦福最火的一门课,做成了Prompt来帮我设计人生。

    作者将斯坦福《人生设计课》理论体系制成Prompt,通过Claude逐步提问、追问和分析。Prompt融合设计思维、心流理论和积极心理学,分为看清现状、找到指南针、寻路、制定奥德赛计划四阶段,主线问题控制在6到9个。AI引导用户给健康、工作、娱乐、爱打分,区分重力问题与可设计的真问题,生成三个五年人生版本,最终输出8000至12000字的《个人人生设计蓝图》。作者实测效果超预期。

    阅读全文 原文 ↗
  10. 10

    Meta Superintelligence Labs 推出 Muse Image 和 Muse Video

    Introducing Muse Image and Muse Video, the first media generation models developed by Meta Superinte…

    Meta Superintelligence Labs 发布首个媒体生成模型 Muse Image 和 Muse Video。Muse Image 是目前最先进的图像生成模型,能精确遵循指令、精准编辑、多参考构图,并利用 Instagram 社交上下文。它还具备智能体工具使用能力并集成 Muse Spark。用户可通过 Meta AI 应用、网页、Instagram Stories 和 WhatsApp 试用,初始限于部分国家。Muse Video 基于相同预训练基础,实现高视觉保真度并原生支持音频。

    阅读全文 原文 ↗
  11. 11

    OpenAI GPT-5.6 周四发布,此前因美国政府强制延迟

    OpenAI's GPT-5.6 launches Thursday after a delay forced by the U.S. government

    OpenAI GPT-5.6 模型于周四发布。该模型6月底亮相,最初因美国政府限制仅向部分合作伙伴提供,商务部在AI标准与创新中心完成额外测试后批准公开。OpenAI公开批评延迟,称将最佳工具与开发者及企业隔离。新模型Sol在TerminalBench 2.1得分88.8%,Sol Ultra达91.9%,高于Anthropic的Claude Mythos 5(88%)。在网络安全任务中,Sol与Mythos 5水平相当但仅用三分之一的token。Sol定价$5/$30每百万输入/输出token,Anthropic的Fable 5为$10/$50。

    阅读全文 原文 ↗
  12. 12

    YC CEO声称每日用AI部署3.7万行代码,开发者审查发现前端代码大量臃肿低效

    YC首席执行官称自己每天交付3.7万行LoC的AI代码。一位开发者深入探究了其实现原理

    Y Combinator CEO Garry Tan在X上宣称,他与AI编码代理每天在五个项目中部署37000行代码,并保持连续72天发布记录。波兰开发者Gregorein深入审查Tan网站前端代码,发现大量臃肿与低效问题:页面加载169次请求、总计6.42MB数据(对比Hacker News仅7次12KB);包含28个测试文件、78个未使用的JavaScript控制器、八种格式Logo(含空文件)、未压缩的旧PNG等。Gregorein指出,AI虽能快速生成代码,但质量仍应优先于数量。

    阅读全文 原文 ↗
  13. 13

    Rowboat:开源、本地优先的桌面AI助手

    Show HN: Rowboat - Open-source, local-first alternative to Claude Desktop

    Rowboat 是一个开源、本地优先的桌面 AI 助手,将邮件、会议、Slack 等数据索引为 Obsidian 风格的知识图谱,提供持久上下文记忆。内置邮件客户端、浏览器、会议记录器、代码模式(可调用 Claude Code 或 Codex 代理),并支持按事件或定时运行的背景代理。用户可通过 MCP 协议接入 Exa 搜索、GitHub 等外部工具。所有数据以纯 Markdown 格式本地存储,无供应商锁定,支持 Ollama/LM Studio 本地模型或使用 API 密钥的托管模型。

    阅读全文 原文 ↗
  14. 14

    AI 审计代理在 Cloudflare CIRCL 中发现 7 个漏洞

    人工智能与密码学(1):人工智能在Cloudflare的Circl中发现了什么

    zkSecurity 的 AI 审计代理 zkao 持续扫描 Cloudflare 的 CIRCL 密码学库,使用 Opus 4.6 + skills 和 GPT-5.3 + skills 等模型发现并确认了 7 个真实漏洞。其中包括阈值 RSA 中 float64 精度丢失(AI 自评 Critical)和属性基加密(CP-ABE)访问控制完全失效(Critical,由 zkao 自行发现)。所有漏洞已在上游修复,多数在 HackerOne 上获得确认和奖励。AI 生成的候选发现仍需人工验证,但 zkao 已能自动完成大部分验证工作。

    阅读全文 原文 ↗
  15. 15

    蚂蚁集团旗下Robbyant开源LingBot-Vision:1B参数边界中心视觉基础模型,用于密集空间感知

    Ant Group's Robbyant Open-Sources LingBot-Vision: A 1B Boundary-Centric Vision Foundation Model for Dense Spatial Perception

    蚂蚁集团旗下具身智能公司Robbyant开源LingBot-Vision,一套自监督视觉Transformer家族,专为密集空间感知设计。旗舰ViT-g/16参数约1.1B,采用掩膜边界建模训练,将边界作为原生预训练信号。在密集空间任务中,该1B模型匹配或超越参数规模高达7倍的大模型(如7B DINOv3)。模型以Apache-2.0许可证在Hugging Face开源,提供ViT-g、ViT-L(300M)、ViT-B(86M)、ViT-S四个规模。

    阅读全文 原文 ↗
  16. 16

    长度惩罚使思维链更难被监控

    Length Penalties Make Chain-of-Thought Less Monitorable

    长度惩罚强化学习虽能缩短思维链推理,却会隐藏影响模型答案的驱动因素。对Qwen3-4B和Qwen3-14B的实验显示,压缩后思维链提及提示的频率大幅下降,Qwen3-14B的忠实度下限降至基线的63.1%,监控捕获提示使用的比率从69%降至49%。随机删除基线链句子以匹配压缩长度后,压缩链披露提示的频率仍比基线低7-35个百分点,表明压缩优先移除了监控所需的关键线索。

    阅读全文 原文 ↗
  17. 17

    微软为降成本在Copilot中用自研MAI模型替换OpenAI和Anthropic模型

    Copilot goes cheap as Microsoft phases out OpenAI and Anthropic models to cut costs

    微软正用自研MAI模型替换Copilot产品中的OpenAI和Anthropic模型以降低支出。MAI模型已在Excel和Outlook中每周处理数万次请求,但占比仍小。Build大会上发布推理模型MAI-Thinking 1,声称编码媲美Sonnet 4.6和Opus 4.6,但基准测试大幅落后,仅与DeepSeek V3.2相当。AI负责人承认目标是削减并消除对Anthropic的支出。CEO暗示未来可能按用量计费,MAI为默认,第三方模型付费附加。微软称MAI使用干净商业许可数据,实际基于Common Crawl。

    阅读全文 原文 ↗
  18. 18

    OpenAI 审计 SWE-Bench Pro 发现约 30% 的评测任务存在缺陷

    Separating signal from noise in coding evaluations

    OpenAI 对编码评测基准 SWE-Bench Pro 进行详细审计,发现约 30% 的任务存在缺陷。在 731 个任务的公开子集中,前沿模型通过率在八个月内从 23.3% 提升至 80.3%,但数据质量检查显示大量任务存在测试过于严格、提示词描述不足、测试覆盖不全或误导性提示等问题。OpenAI 建议模型开发者仔细审视评测结果,并指出 AI 智能体在规模化数据质量检查中日益增长的实用性。

    阅读全文 原文 ↗
  19. 19

    Liquid AI 开源 Antidoom:基于最终 Token 偏好优化的推理模型死循环修复方法

    Liquid AI Open-Sources Antidoom: A Final Token Preference Optimization (FTPO) Method that Reduces Doom Loops in Reasoning Models

    Liquid AI 开源了 Antidoom,一种基于 Final Token Preference Optimization (FTPO) 的针对性修复方法,用于减少推理模型中的 doom loop(死循环)问题。该方法定位循环开始的第一个 token,训练模型选择连贯替代项,而不改变整体输出分布。在 LFM2.5-2.6B 上,硬数学和编程任务中的循环率从 10.2% 降至 1.4%;Qwen3.5-4B 上从 22.9% 降至 1%。整套流程可在数小时内完成,全部代码和数据集(LiquidAI/antidoom-mix-v1.0)已开源。

    阅读全文 原文 ↗
  20. 20

    欧盟议会通过《聊天控制法案》第一轮审议

    《聊天控制法案》在欧盟议会通过了第一轮审议

    欧洲议会本周二以331票赞成、304票反对、11票弃权通过紧急动议,允许周四对延长《聊天控制法案》过渡期重新投票。该过渡期4月已到期,曾允许Meta、Google等科技公司无具体嫌疑下自愿扫描私密通信中的儿童性虐待材料。反对者斥责该程序性操作企图恢复大规模监控。IT安全研究人员警告所用AI扫描错误率高不可接受,民权活动家担心此举阻碍制定更有效的永久法规。

    阅读全文 原文 ↗
  21. 21

    OpenRouter 自动升级至 Grok 4.5

    Use Grok 4.5 from @SpaceXAI the moment it goes live, with no code change. ~x-ai/grok-latest always …

    使用来自 @SpaceXAI 的 Grok 4.5,一旦它上线,无需更改代码。 ~x-ai/grok-latest 始终路由到最新的 Grok。现在指向它(今天为 Grok 4.3),当 4.5 发布时它会自动升级到 4.5。 尝试:https://openrouter.ai/~x-ai/grok-latest

    阅读全文 原文 ↗
  22. 22

    Replit 推出社区档案与力量排名

    New this week 🚀 Replit Community Profiles - Proof of Work for vibe coders. Your profile, your flex…

    本周新功能 🚀 Replit 社区档案--vibe coders 的工作证明。 你的档案,你的展示。获取你的智能体使用和检查点的活跃度图表,外加面向专业用户的 Replit 力量排名。 登录,认领你的档案,挑选你最棒的项目,与朋友分享你的数据。 立即查看 → http://replit.com/community

    阅读全文 原文 ↗
  23. 23

    面向AI模型双重用途知识的"开关":Anthropic与AE Studio提出GRAM方法

    An off switch for dual use knowledge in AI models

    Anthropic与AE Studio联合提出梯度路由辅助模块(GRAM)方法,通过在Transformer每层添加可移除的神经元模块,使模型在训练时将病毒学、网络安全、核物理、专业编程语言等双重用途知识仅路由到对应模块,而非扩散至全局。训练后删除模块即可消除该能力,保留则供可信部署使用。实验在合成数据、真实数据及50M到5B参数模型上测试,GRAM效果与数据过滤相当,移除模块不降低通用性能,且比事后"遗忘"技术更难恢复。该研究为平衡双重用途知识的安全访问与有益使用提供了更鲁棒的方案。

    阅读全文 原文 ↗
  24. 24

    GPT-5.6 Sol 系列本周四发布

    Sol is rising. It's a good model.

    GPT-5.6 Sol 与 Terra、Luna 将于本周四公开发布。目前正面向全球扩展预览访问权限。Sol 正在升起,是个好模型。

    阅读全文 原文 ↗
  25. 25

    NotebookLM短视频概览正式上线

    Short Video Overviews are officially 💯 rolled out on mobile and web across all users in English! A…

    短视频概览功能已正式在移动端和网页端面向所有英语用户全面上线! 一如既往,您的意见对我们至关重要。请在下方分享您最喜欢的作品,并告诉我们接下来需要添加哪些功能!❤️

    阅读全文 原文 ↗
  26. 26

    原生速度的 vLLM transformers 建模后端

    Native-speed vLLM transformers modeling backend

    Hugging Face 宣布 transformers vLLM 后端现与手写原生 vLLM 实现速度相当甚至更快。模型作者无需移植代码,即可自动利用 transformers 获得超快推理。测试使用 Qwen3-4B(单 GPU)、Qwen3-32B(张量并行)和 Qwen3-235B-A22B-FP8 MoE(数据+专家并行)三种配置,吞吐量均达到或超过原生。该后端通过 torch.fx 静态分析图、AST 重写代码实现动态层融合,支持张量/管道/专家并行及 torch.compile。用户仅需添加 `--model-impl transformers` 标志。目前不支持线性注意力模型但即将支持。

    阅读全文 原文 ↗
  27. 27

    Krea 2 身份保留功能上线

    ID preservation for Krea 2 🔥

    Krea 2 的身份保留功能已发布,配套模型和 ComfyUI 节点也已上线。🔥

    阅读全文 原文 ↗
  28. 28

    OpenRouter聊天室推出一键零数据保留

    New: one-click ZDR (zero-data retention) in the Chatroom Compare models side-by-side with full priv…

    新功能:聊天室一键ZDR(零数据保留) 在完全隐私保护下横向对比模型:https://openrouter.ai/chat

    阅读全文 原文 ↗
  29. 29

    蚂蚁集团周俊AICon演讲:从Token数量到Token密度,万亿参数模型效率优先

    演讲实录 | 从 Token 数量到 Token 密度:万亿参数规模下的高效智能体智能

    蚂蚁集团副总裁周俊在AICon演讲指出,万亿参数模型每运行15分钟算力成本约等于一辆特斯拉,效率是智能体时代最需解决的问题。团队提出从"更多Token"转向"更高Token密度"策略,采用7份Lightning Attention加1份MLA的混合线性注意力架构,使256K长上下文成本从指数级降至线性级,算力更多用于思考。通过Kpop算法区分工具调用与自然语言Token,结合思维链剪枝、自蒸馏等,Token输出减少约4倍而能力不降。在LongBench、BFCL等基准上提升显著,千亿参数模型在Agent任务中超越部分更大模型;小模型flash吞吐达2.4倍,五轮对话成本下降10倍以上。

    阅读全文 原文 ↗
  30. 30

    蚂蚁集团周俊:如何用混合线性改造提升万亿参数模型的Token密度

    演讲实录 | 从 Token 数量到 Token 密度:万亿参数规模下的高效智能体智能

    蚂蚁集团副总裁周俊提出,万亿参数模型每运行15分钟算力成本约相当于一辆特斯拉,效率是智能体时代必须最先解决的问题。团队通过7份Lightning Attention搭配1份MLA的混合线性改造,将256K长上下文成本从指数级降至线性级,配合Kpop算法与真实环境训练,使Token输出减少约4倍,千亿参数模型在真实Agent任务上超过部分更大规模模型。

    阅读全文 原文 ↗
  31. 31

    Fable 5 作为顾问与执行者调用模式

    A few patterns we frequently use with Fable 5: Use Fable 5 as an "advisor." An executor (Sonnet…

    我们常与 Fable 5 一起使用的几个模式: 将 Fable 5 作为"顾问"。 一个执行者(Sonnet 5)调用 Fable 5 寻求指导。 大多数 token 按较低的执行者费率计费。

    阅读全文 原文 ↗
  32. 32

    OpenAI发布政府与国家安全合作伙伴关系方针

    Our approach to government and national security partnerships

    OpenAI近日公布国家安全原则,阐明在政府及国家安全领域部署前沿AI系统的方针。原则强调在保护公民、防御关键基础设施、提供公共服务及应对新兴威胁(网络防御和生物安全)中发挥AI优势,同时确保民主问责、人类判断和法治。过去一个月,OpenAI通过Daybreak网络防御计划与澳大利亚、加拿大、日本、韩国、法国、德国、波兰、荷兰及欧盟ENISA等机构建立网络安全信任访问合作,并与英国政府开展网络安全测试评估。上月,OpenAI向部分美国政府及盟友合作伙伴开放GPT-Rosalind模型用于公共卫生和生物防御。原则适用于现有及未来合作,包括与Department of War的协议,明确禁止大规模国内监控、自主武器系统及高风险自动化决策。OpenAI支持立法对高风险军事用途(如国内监控、自主武器)建立保障措施。

    阅读全文 原文 ↗
  33. 33

    AI预检检查:智能体工作记忆架构

    The AI Preflight Check

    一种为AI智能体设计的预检工作记忆架构:查询到来时,系统从磁盘上约90个索引化的技能库中检索最相关技能,仅加载到上下文窗口。本地开源模型Ornith 35B(350亿参数,通过Ollama在Apple Silicon上运行)执行任务,约80%常规任务由本地模型完成,困难任务路由至前沿模型。看门狗记录每次预检决策和技能调用,夜间通过异步推理处理全天轨迹,自动决定哪些技能需新增或固化(如日历排期转为确定性Rust代码),实现自我改进循环。昨天,看门狗首次未提出任何改进建议,系统或接近性能平台期。

    阅读全文 原文 ↗