类目 全部 模型 产品 行业 论文 技巧
  1. 01

    xAI 起诉 Grok 用户制作儿童性虐待内容,不再否认模型被滥用

    xAI can't deny Grok makes CSAM anymore. So it's suing users.

    xAI 首次对一名 Grok 用户提起诉讼,指控其利用该模型制作儿童性虐待图像(CSAM)。此前 xAI 一直否认 Grok 能生成此类内容,此次诉讼标志着其立场转变。案件聚焦用户滥用行为,而非模型本身的技术缺陷。

    阅读全文 原文 ↗
  2. 02

    Kimi K3:智能的新前沿

    月之暗面推出迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,基于 KDA 混合线性注意力机制构建,原生支持视觉理解。它在长程编程、知识工作等场景表现前沿,但整体仍落后于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 等渠道使用,完整权重将于 2026 年 7 月 27 日前发布。

    阅读全文 原文 ↗
  3. 03

    RecGPT-V3 技术报告:状态化混合模态推荐系统在淘宝部署,IPV 提升 1.28%、GPU 成本降低 52.4%

    RecGPT-V3 Technical Report

    淘宝部署的 RecGPT-V3 采用状态化行为建模、混合模态基础模型(融合文本标签与 Semantic IDs)和潜在意图推理,将用户建模计算量降低 55.8%,输出 token 成本下降。在"猜你喜欢"信息流的大规模在线 A/B 测试中,IPV 提升 1.28%、CTR 提升 1.00%、TC 提升 1.97%、GMV 提升 3.97%,端到端服务资源消耗降低 52.4%。

    阅读全文 原文 ↗
  4. 04

    Kimi K3:智能的新前沿

    Kimi 发布迄今能力最强的开源模型 Kimi K3,拥有 2.8 万亿参数、100 万 token 上下文窗口,原生支持视觉理解。该模型在长程编程、知识工作等场景表现前沿,整体能力仅次于 Claude Fable 5 和 GPT-5.6 Sol。即日起可通过 kimi.com 及官方 App 使用,完整模型权重将于 2026 年 7 月 27 日前发布。

    阅读全文 原文 ↗
  5. 05

    Kimi 最强模型 K3 发布,Frontend Code Arena 跑分登顶

    Kimi 最强模型:K3 登场,Frontend Code Arena 跑分力压 Claude Fable 5 登顶

    月之暗面推出迄今最强模型 Kimi K3,拥有 2.8 万亿参数和 100 万 Tokens 上下文窗口。该模型在 Frontend Code Arena 中以 1679 分超越 Claude Fable 5 位居第一,在 7 个前端领域中的 6 个排名 #1。API 定价为每 100 万 Tokens 输入 2 元(缓存命中)或 20 元(缓存未命中),输出 100 元。

    阅读全文 原文 ↗
  6. 06

    Schema Harness 在 ARC-AGI-3 公开集上取得约 99% 成绩

    Schema Harness 在 Arc-AGI-3 公开数据集上取得约 99% 的成绩

    Schema 框架在 ARC-AGI-3 公开集上,使用 Claude Opus 4.8 和 Fable 5 达到 99% RHAE 分数,使用 GPT-5.6 Sol 达到 95.35%。该框架不修改模型权重,而是将原始观测转化为可编辑程序,联合解决状态归因和机制发现问题。此前最强模型 GPT-5.6 Sol 在半私有集上仅得 7.78%。

    阅读全文 原文 ↗
  7. 07

    Wan-Streamer v0.2 发布:端到端响应延迟仅 550ms,支持 640×368 实时视频对话

    Wan-Streamer v0.2:响应延迟仅550ms,让 AI 真正与你"面对面"

    通义实验室发布 Wan-Streamer v0.2,端到端响应延迟 550ms(200ms 模型延迟 + 350ms 网络延迟),输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS。

    阅读全文 原文 ↗
  8. 08

    Kimi K3 登顶前端编码榜,开放权重挑战闭源双巨头

    谁能想到Claude和GPT双头统治的时代,居然就这么被中国模型撕开了口子。 Kimi K3登顶Frontend Code Arena总榜第一,1679分同时力压Claude Fable 5与GPT…

    Kimi K3 在 Frontend Code Arena 以 1679 分登顶,力压 Claude Fable 5 与 GPT-5.6 Sol,7 个前端细分赛道拿下 6 个第一。该模型为 2.8 万亿参数 MoE 架构,百万上下文窗口,7 月 27 日开放权重。K3 的 API 定价为输入每百万 tokens 15 美元,对标前沿闭源模型,放弃低价路线,转向长上下文智能体编码场景的定价策略。

    阅读全文 原文 ↗
  9. 09

    美团LongCat发布LoHoSearch:更难搜索智能体基准

    BrowseComp went from 30% → 90% in 10 months. Search-agent benchmarks are saturating. So we built Lo…

    美团LongCat推出LoHoSearch,一个基于762万实体维基百科知识图谱自动生成问题的搜索智能体基准,旨在解决BrowseComp等现有基准趋于饱和的问题。在11个前沿模型测试中,最佳得分仅34.74%,远低于当前模型在BrowseComp上约90%的成绩;上下文策略仅带来+6.8个百分点的提升。该基准包含544道问题、11个领域,采用树与图结构,已开源。

    阅读全文 原文 ↗
  10. 10

    NexForge:通过需求驱动任务合成扩展LLM智能体能力

    NexForge: Scaling Agent Capabilities through Requirement-Driven Task Synthesis for LLMs

    NexForge提出需求驱动框架,无需领域特定基础设施即可自动合成多样化可执行智能体任务与专家轨迹。该框架生成3.6K终端和2K办公任务,将Qwen3.5-35B-A3B Base在Terminal-Bench 2.0上从22.5%提升至52.0%,GDPval Elo从813提升至1338。

    阅读全文 原文 ↗
  11. 11

    Kimi 正式发布 2.8 万亿参数大模型 K3,将于 7 月 27 日全面开源

    Kimi正式发布2.8万亿大模型K3,这是属于我们的荣光。

    月之暗面发布 Kimi K3,参数量达 2.8 万亿,支持百万上下文,将于 7 月 27 日全面开源。该模型在 AA 智能分数中排名第三,并在 BrowseComp、Automation Bench 和 SpreadsheetBench 2 三项 Agent 评测中取得第一。

    阅读全文 原文 ↗
  12. 12

    首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解

    小有可为实战教程|乡村教育一等奖作品拆解

    首届"小有可为"大赛乡村教育赛道一等奖作品"智绘科普"采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。

    阅读全文 原文 ↗
  13. 13

    从预训练到后训练:理解推理能力的强化学习缩放规律

    Understanding Reasoning from Pretraining to Post-Training

    一项新研究以国际象棋为受控实验平台,系统探究了预训练与强化学习(RL)在推理任务中的交互关系。研究发现,给定RL计算量下的后训练性能可由预训练损失准确预测,且RL奖励曲线的斜率随预训练token数近似线性提升。在1B参数数学语言模型上,更长预训练的检查点在RL下性能更高、提升更快。

    阅读全文 原文 ↗
  14. 14

    苹果与 OpenAI 法律战升级:约 40 名前员工收到苹果律师函

    苹果已向约40名就职于OpenAI的前员工发出律师函,要求保存相关文件。此前苹果起诉OpenAI及两名前员工,指控其通过挖角获取商业机密以加速AI硬件研发。苹果称已有超400名前员工在OpenAI工作,正寻求法院禁令阻止OpenAI使用苹果信息并要求归还机密。

    阅读全文 原文 ↗
  15. 15

    NVIDIA 发布 Audio-Visual Flamingo:面向长视频的开放音频-视觉大语言模型

    Audio-Visual Flamingo: Open Audio-Visual Intelligence for Long and Complex Videos

    NVIDIA 推出 Nemotron-Labs-Audio-Visual Flamingo(AV-Flamingo),一个完全开源的音频-视觉大语言模型,专为理解和推理长视频中的音频、图像与复杂场景设计。

    阅读全文 原文 ↗
  16. 16

    ActiveVision 基准测试揭示多模态大模型缺乏主动视觉观察能力

    An Exam for Active Observers

    最新基准测试 ActiveVision 通过 17 项任务评估多模态大语言模型(MLLM)的主动观察能力。得分最高的 GPT-5.5(最高推理层级)仅解决 10.6% 的任务,在 11 项任务上得零分;Claude Fable 5 仅解决 3.5%,而三名人类参与者平均得分 96.1%。即使模型自行编写并运行视觉代码,差距依然显著,表明当前 MLLM 缺乏鲁棒的主动视觉观察能力。

    阅读全文 原文 ↗
  17. 17

    LLM cliché highlighter:一款识别AI写作套话的检测工具

    LLM cliché highlighter

    Simon Willison 用 Fable 5 开发了一款 LLM cliché highlighter 应用,用于高亮 LLM 生成文本中常见的十种套话模式,例如"no fluff, no filler, no jargon"这类陈词滥调。该工具旨在帮助读者快速识别并过滤掉充斥在文章中的 AI 写作风格化表达。

    阅读全文 原文 ↗
  18. 18

    小有可为实战教程:拆解乡村教育一等奖作品"智绘科普"的多Agent协作与门控工程

    小有可为实战教程|乡村教育一等奖作品拆解

    首届"点亮乡村课堂"赛道一等奖作品"智绘科普"采用Qwen3.5-397B-A17B大语言模型与Manim开源数学动画引擎,构建多Agent分阶段协作流水线。系统通过规划、草稿、实现、审查、合成五个Agent,配合时序门控、几何审计、视觉审查三道质量门及自动修复回路,实现可控可编辑的教学动画生成。项目底层"多Agent协作+门控+自我修复"范式可迁移至养老陪伴、孤独症干预等场景。

    阅读全文 原文 ↗
  19. 19

    企业AI智能体评估存在"现实对齐"缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障

    The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem - and most are shipping to production anyway

    对157家企业的调查显示,50%的组织在过去一年曾部署通过内部评估但导致客户故障的AI智能体或大语言模型功能,5%的企业完全信任自动化评估,29%认为评估与现实结果对齐不佳是最大局限。尽管信任度低,66%的企业已允许或正计划在12个月内实现低风险智能体的全自动、无人工干预部署。

    阅读全文 原文 ↗
  20. 20

    生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

    生成式人工智能是一场工程灾难

    AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。

    阅读全文 原文 ↗
  21. 21

    NVIDIA 发布 Nemotron 3 Embed 系列,8B 版本在 RTEB 基准上排名第一

    NVIDIA AI Releases Nemotron 3 Embed: An Open Embedding Collection Whose 8B Checkpoint Ranks #1 on RTEB

    NVIDIA 发布 Nemotron 3 Embed 系列,包含三个开源 checkpoint,其中 8B-BF16 版本在 RTEB 基准上以 78.46 的平均 NDCG@10 排名第一。1B-NVFP4 版本在 Blackwell 上吞吐量比 BF16 高 2 倍,精度保留 99.5%,所有模型最大序列长度 32,768 tokens。

    阅读全文 原文 ↗
  22. 22

    54%企业已遭遇AI智能体安全事件,多数仍共享凭证

    The agent security gap: 54% of enterprises have already had an AI agent incident, and most still let agents share credentials

    VentureBeat调查107家企业发现,54%已遭遇AI智能体安全事件(18%确认事故,36%险些酿祸)。仅32%为每个智能体分配独立身份凭证,30%将高风险智能体隔离在沙箱中。安全工具主要依赖模型提供商原生方案,专用智能体安全产品渗透率极低。

    阅读全文 原文 ↗
  23. 23

    Decoy 字体:用空间频率混淆让 AI 看不清你输入的文字

    Decoy 字体

    Decoy Font 是一款 TTF 字体,通过在同一字符中叠加不同空间频率的图形(前景细轮廓与背景低频模糊块),使近距离观看时 AI 读到"诱饵"字母,而人眼远距离或眯眼时才能看到真实隐藏信息。

    阅读全文 原文 ↗
  24. 24

    通义实验室发布 Wan-Streamer v0.2,端到端响应延迟仅 550ms

    Wan-Streamer v0.2:响应延迟仅550ms,让 AI 真正与你"面对面"

    通义实验室发布 Wan-Streamer v0.2,这是一款将"听、看、说、演"统一进单个 Transformer 的端到端全模态模型。其端到端响应延迟仅 550ms,输出分辨率从 v0.1 的 192×336 提升至 640×368 @ 25FPS,并采用 Thinker-Performer 双通路架构在提升画质的同时维持了极低延迟。

    阅读全文 原文 ↗
  25. 25

    ChatGPT 工作区支持文档表格幻灯片编辑

    Create and edit polished docs, spreadsheets, and slides in ChatGPT Work. @nickbaumann_ walks you th…

    在 ChatGPT 工作区中创建和编辑精美的文档、电子表格和幻灯片。 @nickbaumann_ 为你演示操作。

    阅读全文 原文 ↗
  26. 26

    LangChain Fleet 新增一键部署 AI 智能体到 Slack 功能

    New in Fleet: Deploy AI agents to Slack in one click

    LangChain Fleet 允许用户在无代码环境下构建自定义 AI 智能体,并一键部署到 Slack。这些智能体可设置自定义身份,在频道和线程中使用,让团队在现有协作平台上直接完成工作。

    阅读全文 原文 ↗
  27. 27

    OpenAI 提出 AI 时代记分卡:"有用智能每美元"衡量实际工作价值

    A scorecard for the AI age

    OpenAI 提出"Useful Intelligence per Dollar"(有用智能每美元)作为衡量 AI 投资回报的核心指标,从完成的有用工作量、成功任务的实际成本、结果可靠性三个维度评估。

    阅读全文 原文 ↗
  28. 28

    Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

    Working at the frontier: How Cursor knew Claude Fable 5 was ready for the hardest 1% of problems

    Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。

    阅读全文 原文 ↗
  29. 29

    Google Vids 上线 Gemini Omni 与个人数字分身功能

    Create, edit and star in videos with two Google Vids updates

    Google Vids 推出两项更新:Gemini Omni 支持用户通过自然语言提示词和图片参考生成、逐步编辑高质量视频片段;个人数字分身功能允许用户上传自拍和语音录制后,输入文字即可让数字分身出镜。两项功能面向 Google AI Pro 和 Ultra 订阅者及 Google Workspace 商业客户开放,所有生成内容均含不可见的 SynthID 数字水印。

    阅读全文 原文 ↗