类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Science One Framework:通过 Chain-of-Evidence 实现可验证的自主科研框架

    Science One Framework: A verifiable autonomous research framework via Chain-of-Evidence

    Google Research 推出 Science One Framework,一个原生构建证据链的自主科研原型,旨在消除模型幻觉,并配套自动化评估协议 CoE Audit。

    阅读全文 原文 ↗
  2. 02

    大语言模型的显著性偏差:常识推理中的知识压制而非缺失

    Would You Walk to the Car Wash? Revealing the Salience Bias of Large Language Models in Commonsense Reasoning

    研究提出"显著性偏差"概念,指大语言模型被输入中无用的显性干扰(如数字)劫持,忽略任务隐含的常识前提。基于新构建的 SaliTrap 基准评估 12 个主流模型,最佳模型仅 54.8% 查询避开陷阱,8/12 模型低于 30%;GLM-5.1 和 Kimi-K2 在识别陷阱后仍分别有 86.2% 和 81.8% 的遵从率。

    阅读全文 原文 ↗
  3. 03

    腾讯混元Hyra破解50年数学难题

    For a finite set of integers (A), how much faster can (|A+A|) grow than (|A-A|)? A 1969 theorem gav…

    腾讯混元借助研究智能体Hyra及Hy3模型,构造出整数集A使|A+A|与|A-A|的指数比精确达到2,解决了自1969年以来悬而未决的极值问题。此前50余年最佳构造仅略超1.1,新成果证明最优指数即为2。论文及形式化证明已公开。

    阅读全文 原文 ↗
  4. 04

    PhiZero:围绕"物理语言"构建的世界模型

    PhiZero: A World Model Built Around Physical Language

    PhiZero 是一种基于"物理语言"的物理世界模型,该语言通过自监督学习从野外视频中提取世界状态转移的紧凑离散表征。它采用先推理后渲染的范式,先以物理语言序列推断未来世界演化,再由扩散解码器渲染成视频。实验验证了其在物理一致性生成、细粒度动作条件模拟和零样本运动迁移上的能力。

    阅读全文 原文 ↗
  5. 05

    删除回避:LLM 代码编辑中的系统性缺陷与缓解之道

    To Add Is Machine, To Delete Is Human: Measuring and Mitigating Deletion Avoidance in LLM Code Editing

    研究发现,领先模型在 SWE-bench Verified 上对开发者补丁的删除召回率最高仅 71.7%,29.0% 的通过补丁采用 Guard-and-Go 模式保留目标代码。新基准 CanItDelete 含 200 个纯删除任务,最佳模型仍失败 19.5%。在 7B 模型后训练中加入 12.8k 删除示例(占 0.7% token)可将删除回避降低 13.9 个百分点。

    阅读全文 原文 ↗
  6. 06

    BM25 在大规模语料中胜出:检索增强生成范式的规模扩展研究

    BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

    一项受控研究在约450倍跨度、28个严格嵌套的语料规模层级上比较多种RAG范式,发现存在规模依赖的交叉点而非绝对赢家。File-System Agent在最小规模领先,但约1000万语料token时BM25反超并在所有更大层级保持领先,全规模下优势接近20个点。BM25还锚定了无需LLM构建的低成本帕累托前沿。

    阅读全文 原文 ↗