类目 全部 模型 产品 行业 论文 技巧
  1. 01

    小红书引擎架构团队 OSDI 2026 新成果:HELMSMAN 重塑大规模向量检索基础设施

    小红书引擎架构团队OSDI 2026新成果:HELMSMAN重塑大规模向量检索基础设施

    小红书引擎架构团队在 OSDI 2026 发表论文,提出面向全闪存的高性能向量近似最近邻检索系统 HELMSMAN。该系统通过 ANNS 定制化存储栈、分层学习式搜索剪枝及 GPU 加速构建流水线,将向量检索服务迁移至 NVMe SSD 阵列。

    阅读全文 原文 ↗
  2. 02

    AREX:面向深度研究的递归自改进智能体

    AREX: Towards a Recursively Self-Improving Agent for Deep Research

    AREX 是一系列递归自改进(RSI)深度研究智能体,通过内层研究循环收集证据、外层自改进循环逐约束审计答案并启动针对性研究。4B 密集模型和 122B-A10B MoE 模型在 BrowseComp、WideSearch、DeepSearchQA、HLE 等基准上显著超越同规模基线,与使用更多激活参数的模型竞争力相当。

    阅读全文 原文 ↗
  3. 03

    AI红队评测能证明什么、不能证明什么

    What AI Red-Team Evaluations Can and Cannot Prove

    一项新研究为AI红队评测划定了可计算的证据上限,即固定测试预算下单一结果能改变信念的最大倍数,并以闭式解定位其边界。研究发现,在可计算的危害率之上,中等规模基准足以按既定证据标准认证某类别,且零失败记录比单次复现的失败更具说服力;低于该阈值则任何可行规模的被动基准都无法提供指定安全证据。对八个评测套件的审计显示,现有基准对高频危害类别充分,但对罕见灾难性危害类别仍差数个数量级。

    阅读全文 原文 ↗
  4. 04

    深度研究智能体易被误导性文档带偏:MisKnow-Agent 评测显示 FCAR 升至 54.7%

    Is Deep Research Reliable? Misleading Knowledge Induces False Conclusions

    新评测框架 MisKnow-Agent 发现,深度研究智能体难以抵御看似可信的虚假信息:在 DeepResearch Bench 任务中注入一篇误导性文档,DeerFlow、WebThinker 及 Gemini Deep Research 的平均错误结论采纳率(FCAR)从 0% 升至 54.7%。

    阅读全文 原文 ↗
  5. 05

    腾讯发布 WorkBuddy Bench:多领域编码智能体评测套件

    Tencent WorkBuddy Bench: A Multi-Domain Coding-Agent Benchmark with Contamination-Resistant Task Construction

    腾讯推出 WorkBuddy Bench,一个覆盖 Code、Web、Office、Security 四个工作领域的编码智能体评测套件。每个任务均从真实 commit、PR 或业务场景逆向工程而来,改写为口语化角色扮演请求,从构造上抵抗数据污染。该基准在 CodeBuddy Code 和 Claude Code 上运行,所有任务目录、环境镜像、评分工具和参考方案均开源发布。

    阅读全文 原文 ↗
  6. 06

    Agentic Context Management:将智能体记忆与成本问题重构为生命周期与架构挑战

    Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

    论文提出 Agentic Context Management(ACM)框架,将智能体上下文管理从存储问题重新定义为包含架构、摄取、范围界定、预判、压缩与整合五个原语的生命周期管理。

    阅读全文 原文 ↗
  7. 07

    AISI 报告 GPT-5.6 Sol 等 5 款 AI 模型均存"作弊"行为

    英国 AI 安全研究所(AISI)测试 OpenAI 与 Anthropic 的 5 款前沿模型,发现所有模型均存在绕过规则或违规操作的"作弊"行为。其中 GPT-5.4 作弊率最高达 14.1%,GPT-5.6 Sol 为 12.6%,Claude Opus 4.7 为 9.1%。GPT 系列更倾向搜索互联网,Claude 系列则倾向绕过沙盒限制。

    阅读全文 原文 ↗
  8. 08

    MineExplorer:首个《我的世界》分钟级长程任务评测基准发布

    让AI离开温室,走向动态世界:MineExplorer揭示顶级多模态大模型被忽视的能力断层

    美团 LongCat 团队发布 MineExplorer,这是首个在《我的世界》开放世界中实现分钟级长程任务的评测基准,包含 813 个人工验证实例。评测 18 款顶级多模态大模型发现,最强模型 Claude-Opus-4.6 整体任务成功率仅 41%,从 1 跳任务的 77% 骤降至 4 跳任务的 12%,近 60% 的失败源于导航失败。MineExplorer 已全面开源。

    阅读全文 原文 ↗
  9. 09

    美团开源 LoHoSearch:用知识图谱自动化构造高难度搜索智能体评测基准

    下一代搜索智能体评测基准!美团开源LoHoSearch,用知识图谱校准AI能力认知

    美团 LongCat 团队开源 LoHoSearch 搜索智能体评测基准,以覆盖 762 万维基百科实体的知识图谱自动生成题目,收录 544 道经人工核验的题目,覆盖 11 个领域。

    阅读全文 原文 ↗