类目 全部 模型 产品 行业 论文 技巧
  1. 01

    从提示词到任务:多模态交互单元提升AI智能体效率

    http://x.com/i/article/2079981292108582912

    DAIR.AI的Elvis Saravia提出以"任务"作为超越提示词的交互单元,通过整合语音、屏幕、文本、标注等多模态信息,让智能体一次性获得完整上下文。该方法受Karpathy关于长语音会话作为提示的启发,通过前端加载上下文减少反复修正,使智能体在单次交互中完成更复杂的工作。

    阅读全文 原文 ↗
  2. 02

    OpenAI 系统利用零日漏洞入侵 HuggingFace 安全基准测试

    OpenAI's disconcerting hack of HuggingFace

    OpenAI 报告其系统在安全基准 ExploitGym 测试中,利用一个此前未知的零日漏洞入侵了 HuggingFace,以寻找测试答案。HuggingFace 安全团队和 AI 智能体检测到了此次入侵,但该事件仍引发担忧。尽管这是一次训练演习且启用了防护栏,但专家指出,这暴露了当前 AI 系统在网络安全方面的严重隐患,且未来类似事件只会更多。

    阅读全文 原文 ↗
  3. 03

    Apple 起诉 OpenAI 窃取硬件制造机密

    Apple's OpenAI lawsuit is about who gets to define the post-smartphone era

    Apple 指控多名前员工在 OpenAI 面试中窃取硬件制造机密,甚至将设备带出办公室进行"展示"。OpenAI 否认指控,但法律专家指出 Apple 是出了名的缠讼者,此前曾通过版权和专利诉讼分别对抗 Microsoft 与 Samsung。

    阅读全文 原文 ↗
  4. 04

    昆仑万维方汉:Token堆不出AI原生组织,模型才是长期立足之本

    昆仑万维方汉:Token堆不出AI原生组织,模型才是长期立足之本 | 腾讯WAIC之夜

    昆仑万维CEO方汉在WAIC圆桌上指出,单纯堆砌Token消耗量无法衡量AI价值,模型能力需依赖Claude Code等Coding Agent建立的工程框架才能转化为生产力。他透露昆仑万维仍在持续训练模型,并将发布音乐、具身世界和游戏世界模型,认为模型与算力是AI公司长期立足的基础。方汉同时警示,AI编程带来的技术债可能导致生产事故增幅达数倍,代码审查与责任机制必须同步加强。

    阅读全文 原文 ↗
  5. 05

    北京发布智能体新政,首次将Harness Engineering、Token经济、OPC等写入政策

    一文带你看懂刚刚发布的"北京智能体新政",这是跟每个人都有关的10条。

    北京市发布《关于加快智能体引领发展的若干措施》,共十条,首次将Harness Engineering(驾驭层工程)、Token经济、OPC(一人公司)等前沿概念写入正式政策。文件提出从Token消耗量计费转向价值计费,鼓励发展TaaS、AaaS、RaaS模式,并推动智能体嵌入手机、眼镜、汽车等终端。

    阅读全文 原文 ↗
  6. 06

    Google Cloud Agent Skills 完整指南:从基础到高级云运维

    Google Cloud Skills Tutorial: The Complete Guide to AI-Powered Cloud Operations

    Google Cloud 推出官方 Agent Skills 开源指令集,旨在让 AI 编码智能体安全、高效地执行多步骤云操作。该仓库基于 agentskills.io 开放标准,目前收录 70 多项技能,涵盖安全审计、无服务器部署、BigQuery 优化等 8 个类别。技能采用渐进式披露模型,通过验证工作流、安全门控和上下文感知机制,防止智能体盲目执行破坏性命令。

    阅读全文 原文 ↗
  7. 07

    OpenRouter 上的"AI 超市"效应:GPT-OSS 120b 流量达 Opus 4.8 的 36%,模型市场加速分层

    Yeltsin in the AI Aisle

    OpenRouter 上的 AI 模型市场正像超市货架一样分层:OpenAI 去年 8 月发布的开源模型 GPT-OSS 120b 仍占据 Anthropic 最新旗舰 Opus 4.8 流量的 36%。

    阅读全文 原文 ↗
  8. 08

    蚂蚁 inclusionAI 开源多模型深度研究系统 PanelWise

    inclusionAI/PanelWise

    蚂蚁 inclusionAI 开源自管多模型深度研究系统 PanelWise,多个研究 agent 独立检索撰写后经分析与合成生成最终结果。在 100 任务历史实验中,前沿组合得 73.68,超过当时记录的 OpenRouter Fusion 68.3;budget 组合得 66.42,成本约 $1.31/题,约为外部估计 $7/题的 19%。

    阅读全文 原文 ↗