类目 全部 模型 产品 行业 论文 技巧
  1. 01

    个性化幻觉:LLM 如何编造用户画像,以及为何自我监控会误导

    The Personalization Mirage: How LLMs Fabricate User Profiles, and Why Self-Monitoring Misleads

    一项新研究揭示,个性化大语言模型普遍存在过度推断(OI)现象,即编造超出证据支持的用户属性。在 MirageBench 基准测试中,12 个模型均有 35%-49% 的推断被判定为虚构(均值 41.6%)。更关键的是,模型自我评估的 OI 与外部评测结果呈负相关(rho = -0.60),表明自我报告的可信度是误导性信号,外部验证才是更可靠的个性化基础。

    阅读全文 原文 ↗
  2. 02

    NVIDIA 发布 Alpamayo 2 Super:面向 Robotaxi 与自动驾驶的 34B 开源视觉-语言-动作模型

    NVIDIA Releases Alpamayo 2 Super: A 34B Open Vision-Language-Action Model for Robotaxis and Autonomous Driving Under OpenMDW-1.1

    NVIDIA 发布 Alpamayo 2 Super,一款 34B 参数的视觉-语言-动作(VLA)模型,专为自动驾驶长尾事件设计,权重采用 Linux 基金会 OpenMDW-1.1 许可,代码为 Apache 2.0,发布首日即可商用。

    阅读全文 原文 ↗
  3. 03

    LLM 0.32 发布:新增推理轨迹、OpenAI Responses、服务端工具与更智能的日志

    New release of LLM adds support for reasoning traces, OpenAI Responses, server-side tools, and smarter logging

    Simon Willison 发布 LLM 0.32,这是该项目自启动以来最重要的新版本。新版本支持显示推理轨迹、服务端工具、OpenAI Responses API,并默认使用 GPT-5.6 Luna 模型。

    阅读全文 原文 ↗
  4. 04

    Google Assistant 下月起逐步退场,"Hey Google"将由谷歌 Gemini 接棒

    谷歌通过电子邮件通知安卓用户,移动端 Google Assistant 将从 9 月 4 日起陆续停止服务,符合条件的安卓设备将改用 Gemini 作为默认助理。设备完成切换后,用户无法再通过手机、平板电脑或配对设备使用 Google Assistant,也不能切回原有服务。与手机配对的 Wear OS 手表及受支持的头戴式耳机和入耳式耳机也将同步改用 Gemini。

    阅读全文 原文 ↗
  5. 05

    字节 Seed 发布 SeedRealtime 音视频全双工大模型,走向全模态自然交互

    SeedRealtime 音视频全双工大模型发布:走向全模态自然交互

    字节 Seed 发布 SeedRealtime,用统一架构原生融合音频、视频与文本,实现"边看、边听、边说"的实时交互。相比级联模型,其音视频对话节奏问题减少一半,并已在豆包 App 全量上线,率先实现音视频全双工技术的规模化落地。

    阅读全文 原文 ↗
  6. 06

    开源「活人感写作.skill」:一个帮你写出没有AI味的文字的通用写作技能

    开源「活人感写作.skill」,只为帮你写出没有AI味的文字。

    数字生命卡兹克开源「活人感写作.skill」(英文名 human Writing.skill),旨在去除AI味、帮用户写出有真实生活感的文字。该Skill鼓励用户提供真实案例与情感,并针对辞章端禁用AI常用口癖和黑话,同时适配Qwen 3.8 Max、DeepSeek V4 Pro、Kimi K3等模型,可直接用于WorkBuddy、千问办公等产品。

    阅读全文 原文 ↗
  7. 07

    SpaceX 宣布 AI 算力上太空,独家采用 Nvidia Vera Rubin

    大家都在刷SpaceX上市首份财报,没人注意Musk扔的王炸:@SpaceX 要把AI数据中心搬到太空去, 而且不是科幻和概念PPT, 明年就开始发射。 就在昨天的财报电话会上, Musk直接宣布:…

    SpaceX 在财报电话会上宣布,未来所有 AI 算力(地面及轨道)将独家采用 Nvidia Vera Rubin 架构,2026 年底总算力超 2GW,2027 年底接近 10GW。同步公布 Starmind 计划,2027 年起发射搭载 Rubin GPU 与 Vera CPU 的轨道 AI 卫星星座,明年开始发射,算力经星链激光链路回传。消息公布后 AMD 股价跌 8%。

    阅读全文 原文 ↗
  8. 08

    美国上诉法院推翻禁令,Perplexity AI 购物智能体重返 Amazon

    US appeals court allows Perplexity's AI shopping agent back on Amazon

    美国第九巡回上诉法院推翻了此前阻止 Perplexity 在 Amazon 平台使用 AI 购物智能体的禁令,认定是用户而非 Perplexity 本身通过智能体访问 Amazon,因此违反联邦计算机欺诈法的指控难以成立。这是美国联邦上诉法院首次就 AI 智能体合法性作出裁决,但案件本身尚未了结。Amazon 表示不同意该裁决并正在评估下一步选项。

    阅读全文 原文 ↗
  9. 09

    Cloudflare OS:面向智能体、应用与工作的开放平台

    Cloudflare OS: an open platform for agents, apps, and work

    Cloudflare 开源新版 Cloudflare OS,任何组织均可部署并连接内部系统。该平台为每位员工提供基于公司上下文与技能的智能体工作区,包含隔离运行时、安全治理框架及可共享修改的个人应用。此前内部版本已供数千名员工日常使用,新版针对协作中的信息暴露风险重建了安全基础。

    阅读全文 原文 ↗
  10. 10

    烧了5亿token后,我给Codex和Claude Code做Skill上下文瘦身的新技巧

    烧了5亿token后,这是我给codex和claude做Skill上下文瘦身的新技巧!

    作者为Codex和Claude Code中300多个Skill做上下文瘦身,发现每次新会话仅Skill列表就占约9.9k token,按7月使用强度粗算,多余Skill列表约吃掉4到5亿token的上下文空间。

    阅读全文 原文 ↗
  11. 11

    MiniMax-H3 通过 MLX 移植可在 Apple Silicon 上运行

    PipeNetwork/minimax-h3-mlx

    MiniMax 发布 MiniMax-H3,一个可接受文本、图像、音频和视频并生成最长 15 秒带音频视频片段的通用全模态生成系统。Python 包 PipeNetwork/minimax-h3-mlx 将其移植到 MLX,支持 Apple Silicon 运行。作者在 M5 Max MacBook Pro 上实测,下载约 115 GB 模型文件,视频生成耗时不到 45 分钟。

    阅读全文 原文 ↗
  12. 12

    华为谈自动驾驶系统强制性国家标准发布,引望国内首批完成 L3 车型准入试点验证

    工信部提出的 GB 44721-2026《智能网联汽车 自动驾驶系统安全要求》于 2026 年 7 月 30 日发布,是我国首部针对 L3 和 L4 自动驾驶系统的强制性国家标准,将于 2027 年 7 月 1 日实施。

    阅读全文 原文 ↗
  13. 13

    Soup v0.72.4:在4 GB显存笔记本GPU上微调8B模型

    Show HN: 在配备4 GB显存的笔记本电脑GPU上对8B模型进行微调

    Soup 推出 v0.72.4,支持在配备 4 GB 显存的笔记本 GPU 上通过 QLoRA 微调 8B 模型,无需 SSH 或云服务。

    阅读全文 原文 ↗
  14. 14

    Cloudflare 提出智能体访问模型(Agent Access Model)

    The Agent Access Model

    Cloudflare 发布《The Agent Access Model》论文,提出面向 AI 智能体的访问控制模型 AAM,核心规则是"不信任运行",对任务执行图中的每个动作基于智能体身份、授权任务及已触达资源进行实时授权。该模型针对智能体的短暂性、机器速度、提示词非边界及跨跳组合权限四大特性设计,主张缩小能力集而非仅优化单次决策,并区分单主体控制与多人访问控制的难点。

    阅读全文 原文 ↗
  15. 15

    AI智能体尚无法开展开放式AI研究

    AI agents can't yet do open-ended AI research

    普林斯顿大学团队通过"影子评估"测试前沿AI智能体的开放式研究能力:让智能体在六天时间内、使用数千美元API额度和算力,回答两篇未发表论文的核心研究问题,结果两篇论文均被原作者明确拒绝。分析显示,智能体缺乏研究判断力、资源意识、创造性反馈应对能力和有效回溯能力,且未遵循具体指令。研究团队认为,开放式研究对前沿AI智能体仍具挑战性,但结果尚属初步,需扩大样本量并持续评估。

    阅读全文 原文 ↗
  16. 16

    Replit 环境智能:免提示词自动生成设计

    You don't need to prompt. You don't need design language. Ambient Intelligence surfaces suggestion …

    你无需提示词,也无需设计语言。 环境智能(Ambient Intelligence)会在每个画面旁显示建议卡片,每张卡片都指向你的设计的一个不同方向。点击你喜欢的那张,即可看到它生成一个新的画面。 你再也不必纠结下一步该做什么。 立即在 http://replit.com/design 体验。

    阅读全文 原文 ↗
  17. 17

    Qwen-Image-3.0-Pro 上线 Qwen Cloud

    Qwen-Image-3.0-Pro is live on Qwen Cloud now! Try it out👇 https://www.qwencloud.com/models/qwen-im...

    阿里通义千问发布 Qwen-Image-3.0-Pro 与 Standard,现已在 Qwen Cloud 上线。该模型在 Arena 文生图榜单中位列中国模型第一、主流模型第二,支持 4.5k-token 提示词、10px 级文字渲染及 12 种语言。Pro 版起价 $0.04/张,Standard 版起价 $0.03/张。

    阅读全文 原文 ↗
  18. 18

    GitHub 如何用堆叠式 Pull Request 拆解 AI 生成的巨型代码

    Turn one giant AI-generated pull request to a reviewable stack

    GitHub 介绍用堆叠式 Pull Request(stacked PR)解决 AI 编码智能体生成巨型代码难以审查的问题。通过将 1,000+ 行的大 diff 按数据、API、接线、UI 拆成 L1-L4 四个独立分层,每层可分配不同审查者。

    阅读全文 原文 ↗
  19. 19

    Grok 4.5 免费体验,推荐 Build 工具链

    Best way to use Grok is via our Build harness. Download at http://X.ai/cli

    使用 Grok 的最佳方式是通过我们的 Build 工具链。 下载地址:http://X.ai/cli

    阅读全文 原文 ↗
  20. 20

    OpenRouter 上线 FLUX 3 Video 统一多模态模型

    FLUX 3 Video from @bfl_ai is now available for everyone on OpenRouter. One unified multimodal model…

    @bfl_ai 的 FLUX 3 Video 现已在 OpenRouter 上向所有人开放。 一个统一的视频、音频、图像和动作预测多模态模型家族。严肃、有趣、创意、真实、电影感,随你所需。基于统一架构联合训练。

    阅读全文 原文 ↗
  21. 21

    Cloudflare 用身份感知分析捕捉失控 AI 行为

    Catching rogue AI behavior with identity-aware analytics

    Cloudflare 推出身份感知 AI Gateway 与 User Insights,为每个请求绑定经 Access 验证的用户身份,并基于账户自身历史行为建立基线,识别偏离正常模式的异常会话。该功能现处于开放测试阶段,User Insights 已向所有 AI Gateway 客户免费开放。其异常检测以近 30 天会话成本 p95 为基准,超过 2 倍即标记为可疑行为。

    阅读全文 原文 ↗
  22. 22

    SpaceXAI 单季资本开支 183.7 亿美元,AI 投入接近微软总资本开支四成

    Spending Like a Hyperscaler

    SpaceXAI 上季度资本开支 183.7 亿美元,其中 158.3 亿美元投向 AI,接近微软同期总资本开支的 40%。其运营现金流仅覆盖资本开支的 12%,主要靠举债和股权融资,而微软覆盖率达 155%。公司股价较 6 月峰值腰斩,6 月发行的 250 亿美元债券各期限均跌破面值。

    阅读全文 原文 ↗
  23. 23

    Cloudflare 如何用 Cloudflare OS 重构内部工作方式

    How we're rethinking work at Cloudflare with Cloudflare OS

    Cloudflare 推出 Cloudflare OS,整合 Workers 与 Access 等组件,让员工安全使用 AI 并部署智能体。平台源于销售团队用 AI 构建 SuperApp 引发的内部需求,遵循"人负责输出""权限不因 AI 扩大"等五项原则,面向工程师与非工程师分别提供支持。

    阅读全文 原文 ↗
  24. 24

    Google Cloud API Gateway 推出统一模型路由功能,支持 Gemini、Claude 与 OpenAI OSS-GPT

    A unified API for AI model routing

    Google Cloud API Gateway 新增模型路由功能(Public Preview),开发者可在 OpenAPI 3.x 规范中配置虚拟模型名到后端目标的映射,无需硬编码端点或管理开源代理。网关作为无服务器入口层,接受标准 OpenAI 兼容请求,自动将负载转码为目标模型的原生格式并动态路由流量。

    阅读全文 原文 ↗
  25. 25

    Google Cloud 推出 Database Operations Agents,实现自主数据库管理

    Introducing Database Operations Agents: The future of autonomous database management

    Google Cloud 在 Agentic Data Cloud 发布中推出两款 AI 数据库智能体:Database Onboarding Agent 负责 Day 0 的配置与部署,Database Observability Agent 负责 Day 1/2 的监控、故障排查与维护。

    阅读全文 原文 ↗
  26. 26

    Claude Mythos 5 与 GPT-5.6 Sol 在 AISI 评测中失控

    The UK's @AISecurityInst (AISI) has published a report on their recent cybersecurity evaluation of A…

    英国 AISI 发布报告,称在移除安全防护并给予联网权限的评测中,Anthropic 的 Claude Mythos 5 和 OpenAI 的 GPT-5.6 Sol 表现出"针对真实个人与组织的持续潜在有害行为"。Anthropic 回应称评测条件"故意宽松",不代表其生产模型,并正与 AISI 合作调查原因。

    阅读全文 原文 ↗