类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Kimi Linear:一种表现力强且高效的注意力架构

    月之暗面推出 Kimi Linear,一种混合线性注意力架构,首次在短上下文、长上下文和强化学习场景下全面超越全注意力机制。其 3B 激活参数模型在所有评估任务上显著优于全 MLA,同时将 KV cache 使用量降低最多 75%,并在 1M 上下文下实现最高 6 倍解码吞吐量。月之暗面已开源 KDA 内核、vLLM 实现及模型权重。

    阅读全文 原文 ↗
  2. 02

    GPT-Red:通过大规模自对弈实现自动化红队测试

    GPT-Red: Automated Red Teaming via Self-Play at Scale

    OpenAI 推出 GPT-Red,一个通过自对弈算法训练的自动化红队智能体,用于发现针对前沿大语言模型的提示注入攻击。该模型在同等规模的最大 RL 后训练计算上训练,能可靠攻破 GPT-5.5 及更早模型,发现比人类红队更多的成功攻击,并泛化到未见环境与防御模型。GPT-Red 被用于对抗性训练 GPT-5.6,使其成为目前对提示注入最鲁棒的模型。

    阅读全文 原文 ↗
  3. 03

    GitHub Copilot 发布"Harness"工作流:用单一工具完成原型、规划、实现与代码审查

    The harness is all you need (mostly)

    GitHub Copilot 推出"Harness"工作流,让开发者通过单一 AI 工具完成从原型设计、规划、实现到代码审查的完整软件开发流程,无需追逐多种新 AI 工具。该工作流强调实用性与集成性,旨在减少工具切换带来的效率损耗。

    阅读全文 原文 ↗
  4. 04

    德里高等法院裁定 OpenAI 利用 ANI 内容训练 AI 未侵犯版权

    德里高等法院裁定 OpenAI 利用印媒 ANI 内容训练 AI 未侵犯版权

    德里高等法院认定 OpenAI 利用亚洲国际新闻(ANI)社的内容训练人工智能不构成侵犯版权。法官 Amit Bansal 认为该行为符合印度《版权法》中研究类"合理使用"例外情形,且 ANI 未能证明 ChatGPT 直接复制其受版权保护内容。法院同时指出,现阶段颁布临时禁令将不利于印度正在开发的 LLM 及大量免费使用 ChatGPT 的用户。

    阅读全文 原文 ↗
  5. 05

    Kimi 发布视觉感知基准 PerceptionBench

    We are releasing PerceptionBench, a benchmark that isolates visual perception and evaluates it as a …

    Kimi.ai 发布 PerceptionBench,一个从当前前沿模型在 42 个基准上的失败模式中归纳出的视觉感知基准。该基准将视觉感知拆解为 10 种原子能力,并构建了 3000 道验证题,每道题只考察单一感知能力,无需推理或外部知识。

    阅读全文 原文 ↗
  6. 06

    用Claude和Python构建技能驱动的金融分析智能体

    Designing Skill-Driven Financial Analysis Agents with Claude, Python, MCP Connectors, and Automated Deliverables

    本教程基于Anthropic的financial-services仓库,用纯Python复现其技能驱动架构。通过解析SKILL.md文件构建可搜索技能注册表,并创建可复用SkillAgent,将金融分析剧本注入Anthropic Messages API,支持迭代工具调用循环。

    阅读全文 原文 ↗
  7. 07

    Google Search 的 AI Mode 推出 5 项新功能,帮你规划线下生活

    5 ways AI Mode in Search helps you enjoy the real world

    Google Search 的 AI Mode 新增 5 项工具,帮助用户规划线下活动。功能包括:通过 Personal Intelligence 连接 Google Calendar 推荐本地课程;在 AI Mode 内直接购物并查询附近库存;利用 Canvas 生成桌游策略指南并模拟对弈;根据预算和人数筛选并预订演唱会等门票;连接 Canva 生成邀请函设计。

    阅读全文 原文 ↗
  8. 08

    Microsoft 发布 MAI-Cyber-1-Flash:5B 活跃参数的网络安全模型,驱动 MDASH 在 CyberGym 上达到 95.95%

    Microsoft AI Releases MAI-Cyber-1-Flash: A 5B-Active-Parameter Cyber Model That Pushes MDASH to 95.95% on CyberGym

    Microsoft 发布 MAI-Cyber-1-Flash,一款 137B 总参数(5B 活跃参数)、256k 上下文窗口的稀疏 MoE 网络安全模型,是 MAI-Code-1-Flash 的微调版本。

    阅读全文 原文 ↗
  9. 09

    FeyNoBg 发布:开源自动背景去除模型,在四项基准上达到 SOTA

    Show HN: FeyNoBg - 自动背景去除模型及训练库

    Feyn Labs 推出 FeyNoBg,一个用于自动背景去除的 SOTA 模型。它在八个基准测试中的四项上取得最佳 S-measure 分数,其余四项与领先者差距在 2% 以内。该模型基于 BiRefNet 架构,参数量从 222M 扩展至 263M,同时开源了训练库 NoBg,模型和代码分别可在 Hugging Face 和 GitHub 获取。

    阅读全文 原文 ↗
  10. 10

    OpenAI 称越来越多员工用 ChatGPT 做其他岗位的工作

    OpenAI says more workers are using ChatGPT to do other people's jobs

    OpenAI 分析超 80 万条与工作相关的 ChatGPT 消息后发现,43.5% 的岗位特定查询涉及另一职业,营销和工程任务交叉最多。用户用 AI 处理合同审查、数据分析、网站故障排查等原由专家负责的工作。OpenAI 认为这是岗位职责正在变化的早期信号,该趋势在缺乏专业团队的小公司尤为明显。

    阅读全文 原文 ↗
  11. 11

    豆包搜索开放服务,为Agent提供实时、权威、可信的搜索能力

    火山引擎正式上线豆包搜索服务,为企业和开发者构建AI Agent提供跨语言、多模态、多垂类的联网信息查询引擎。该服务支持API、Skill、MCP等多种接入形态,也可在Agent Plan中一键配置启用,并提供每月500次免费搜索额度。豆包搜索已在SimpleQA、FreshQA、BrowseComp-ZH等多项公开评测中表现优异,并服务国内9成TOP手机厂商的智能助手。

    阅读全文 原文 ↗
  12. 12

    GitHub Copilot app 入门指南:多 Agent 会话工作区与 Canvas 预览

    GitHub Copilot app for Beginners: Getting started

    GitHub Copilot app 将 AI 编码工具升级为多 Agent 会话工作区,支持同时管理多个任务线程而不丢失进度。用户可为每个会话绑定项目上下文,通过 `/create-canvas` 命令在浏览器 Canvas 中预览 UI 并直接点选修改,还能启用 Agent Merge 自动处理 PR 审查反馈和合并冲突。

    阅读全文 原文 ↗
  13. 13

    Perplexity 推出 Windows 版个人电脑智能体

    Personal Computer is now available in the Perplexity app for Windows. Personal Computer is the loca…

    Personal Computer 现已在 Perplexity Windows 应用中可用。 Personal Computer 是面向你工作的本地智能体工具。它协调跨本地文件、已连接应用和网络的智能体。 研究、编码、浏览和构建,全部在一个统一系统中完成。

    阅读全文 原文 ↗
  14. 14

    如何评估不同 LLM 提供商在延迟、吞吐量和正常运行时间上的性能

    How to Evaluate LLM Provider Performance Across Latency, Throughput, and Uptime

    同一模型在不同提供商端点上的表现因基础设施、量化、负载处理和路由默认设置而异。评估需测量延迟、吞吐量、正常运行时间和精度,并将测量结果转化为路由策略。

    阅读全文 原文 ↗
  15. 15

    火山引擎上线豆包搜索服务,为AI Agent提供实时可信搜索能力

    豆包搜索开放服务,为Agent提供实时、权威、可信的搜索能力

    火山引擎正式上线豆包搜索服务,为AI Agent提供跨语言、多模态、多垂类联网信息查询,融合全域互联网信息、行业知识与字节跳动独家内容资源。该服务从网站站点和创作者维度建立权威分级体系,过滤低质信息,在SimpleQA、FreshQA、BrowseComp-ZH等评测中表现优异。豆包搜索支持API、Skill、MCP等多种接入形态,面向企业和开发者提供每月500次免费搜索额度。

    阅读全文 原文 ↗