类目 全部 模型 产品 行业 论文 技巧
  1. 01

    阿里开放 Qwen3.8-2.4T-A95B 模型权重:2.4T MoE、激活 95B、原生 256K 上下文

    阿里 Qwen 团队正式开放 Qwen3.8-2.4T-A95B 模型权重,这是 Qwen-Max 级别模型首次开源。模型总参数 2.4T,每个 Token 激活 95B,原生支持 262,144 Token 上下文并可扩展至 1,010,000 Token。

    阅读全文 原文 ↗
  2. 02

    DeepSeek V4 Pro与Grok 4.6同日发布,双双逼近Claude Fable 5体验

    一夜之间,DeepSeek V4 Pro和Grok 4.6把全球大模型推入了新的斩杀线。

    DeepSeek V4 Pro正式版与Grok 4.6在2小时内先后发布,均为1.6T/1.5T参数模型,逼近Claude Fable 5体验。

    阅读全文 原文 ↗
  3. 03

    AutoGPT 如何用 AGENTS.md 和技能门控管理 AI 生成的拉取请求

    Your contributors are AI-first now. Is your project?

    AutoGPT 维护者发现,AI 智能体不会主动阅读文档,因此将指令放在 AGENTS.md 和技能文件中,并置于代码目录旁。他们通过强制 PR 模板、测试计划、CI 覆盖率门槛和 CLA 签名等门控机制,将智能体提交的 PR 从"不可用"转变为"可用但不符合路线图"。其中 CLA 签名因需浏览器和 OAuth 流程,被用作区分人类与智能体的"人类探测器"。

    阅读全文 原文 ↗
  4. 04

    空货架还是丢钥匙?Google 研究:Recall 是参数化事实性的瓶颈

    Empty shelves or lost keys? Recall is the bottleneck for parametric factuality

    Google Research 提出知识画像框架,发现前沿 LLM(如 Gemini3、GPT-5)的事实编码接近饱和,但回忆(recall)能力不足,多数事实错误源于"丢钥匙"而非"空货架"。该框架将事实分为编码失败、回忆失败等五类画像,并配套推出 WikiProfile 基准,含 2,150 条维基百科事实,每条配 10 个问题,用于分别探测编码、回忆与识别能力。

    阅读全文 原文 ↗
  5. 05

    微软首发自研推理模型MAI-Thinking-1

    Our first reasoning model, MAI-Thinking-1, is built from scratch. Now available in Microsoft Foundry…

    我们的首个推理模型 MAI-Thinking-1 从零开始构建,现已在 Microsoft Foundry 上线。为团队点赞!更多详情如下。

    阅读全文 原文 ↗
  6. 06

    Claude in Chrome 侧边栏升级为 Claude Cowork 会话

    The Claude in Chrome side panel is now Claude Cowork

    Claude in Chrome 浏览器扩展的侧边栏现已升级为 Claude Cowork 会话,对话会保存至历史记录,技能和连接器可在浏览器中工作,且任务可在桌面、网页和移动端应用间无缝切换。

    阅读全文 原文 ↗