类目 全部 模型 产品 行业 论文 技巧
  1. 01

    腾讯混元 Hyra 攻克加法组合学 50 年未解难题

    Hyra 攻克加法组合学 50 年未解难题

    腾讯混元上周推出的科研智能体 Hyra,基于本月开源的 Hy3 模型(总参数 295B、激活参数 21B),为加法组合学中悬置半个多世纪的开放问题给出完整答案,证明 2 是该问题指数的上确界。Hyra 先在有限搜索中将最好结果从约 1.14 提高到 1.21,经约 24 小时运行提出核心构造思路,并给出 Lean 4 形式化证明。论文预印本、显式构造和形式化证明均已公开。

    阅读全文 原文 ↗
  2. 02

    DiffusionGemma 技术报告:基于离散扩散的高效文本生成模型

    DiffusionGemma Technical Report

    DiffusionGemma 是一个实验性开源权重语言模型,通过离散扩散并行迭代精炼 256 个 token 的块,而非逐 token 解码,从而避免自回归模型的顺序解码瓶颈。

    阅读全文 原文 ↗
  3. 03

    Zero-Mem:为 LLM 智能体实现零 token 记忆操作

    Zero-Mem: Zero-Token Memory Operations for LLM Agents

    Zero-Mem 提出零 token 记忆操作,除最终问答外,记忆构建、检索与校准等所有环节均不调用 LLM 或消耗其输入输出 token,仅用编码器计算。该方法保留原始交互轨迹,通过实体-上下文图与时间层级双视图组织证据,在长记忆与长上下文问答基准上达到竞争性表现,并将记忆操作时间成本较最快基线降低 57.6%。代码将在同行评审后公开。

    阅读全文 原文 ↗
  4. 04

    小红书 dots 团队发布 VibeLifeBench 与 VibeSearchBench:七个最强模型无一及格

    把最强模型丢进真实生活一个月,没有一个及格

    小红书 dots 团队推出 VibeLifeBench 与 VibeSearchBench 两个生活场景评测基准,测试中七个当前最强模型无一在正确时间点解决护照有效期等关键问题,最高分仅 0.325(Opus 5)。

    阅读全文 原文 ↗
  5. 05

    Show HN:将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制

    Show HN: 将 DeepSeek 整合到 GPT-OSS 中不会带来审查机制。试试看

    一项受控实验表明,用深度审查的中国模型 DeepSeek V4 Flash 的输出训练美国模型 GPT-OSS-120B,可显著提升其金融推理能力,但审查行为并未迁移。

    阅读全文 原文 ↗
  6. 06

    面壁智能ALIGN:自动对齐智能体与环境接口

    Everyone building LLM agents pours effort into the agent's strategy or into harder environments. The…

    面壁智能与清华NLP团队提出ALIGN,自动生成对齐接口解决智能体与环境间的失配问题。仅改写反馈措辞即可将Qwen2.5-7B智能体在ALFWorld上的成功率从13.4%提升至31.3%。该方法在四个基准上最高提升45.67%成功率,并减少65%连续无效动作,且接口可跨智能体架构和LLM骨干迁移。

    阅读全文 原文 ↗