类目 全部 模型 产品 行业 论文 技巧
  1. 01

    pxpipe:通过图像化压缩输入token降低Claude Code成本

    通过将代码转换为图像并由模型进行OCR识别,将《Fable》的开发成本降低了60%

    pxpipe是一个本地代理,将系统提示、工具文档和历史记录等密集文本渲染为PNG图像,利用图像token成本取决于像素尺寸的特性压缩输入token。在Fable 5模型上,约25k文本token压缩为约2.7k图像token,端到端账单降低59-70%。SWE-bench Lite 10个实例全部通过,成本从$54降至$27;SWE-bench Pro 19对测试中18对判定一致,单次请求成本降低约60%。该方法有损(精确ID等需保持文本),默认仅处理`claude-fable-5`请求,可通过`PXPIPE_MODELS`变量控制。

    阅读全文 原文 ↗
  2. 02

    我国研制全球首款基于可控存内计算的忆阻器神经动力学芯片

    我国研制全球首款神经动力学芯片,首次将单步运算时延压缩至 2.12 毫秒

    北京大学集成电路学院联合中科院上海微系统所,发布全球首款基于可控存内计算的忆阻器神经动力学芯片,首次将单步运算时延压缩至2.12毫秒。芯片采用40纳米工艺,存内计算阵列与外围电路总面积0.28平方毫米,运行频率50 MHz,单步积分仅需9级流水。在脑皮层重建等任务中较当前GPU提速50至478倍,突破神经动力学实时计算瓶颈。相关成果7月3日发表于《科学》。

    阅读全文 原文 ↗
  3. 03

    Vera:大规模LLM智能体安全测试框架

    Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

    Vera是一个端到端自动化安全测试框架,通过三阶段自增强流水线对LLM智能体进行规模化的安全检验:文献驱动探索持续发现新兴风险;组合生成跨维度构造可执行安全用例;自适应执行在隔离沙箱中运行异构agent并基于环境状态与工具调用证据验证结果。在OpenClaw、Hermes、Codex、Claude Code四个生产级agent框架上测试,多通道攻击下平均攻击成功率达93.9%。同步发布Vera-Bench,包含1600个可执行安全用例,覆盖124个风险类别。代码已公开。

    阅读全文 原文 ↗
  4. 04

    26000名学生研究显示AI隐藏学习成本需两年才显现

    A 26,000-student study shows AI's hidden learning cost takes two full years to surface

    一项追踪26000名7-12年级中学生30个月的面板数据研究发现:使用AI后作业分数提升18%,完成时间从64分钟降至45分钟,但闭卷考试分数下降20%,升学考试成绩下降18%至24%,且完全影响约两年才显现。81%长期用户作业完成时间低于50分钟(外包迹象)。社会学科下降27%,STEM下降22%,英语下降17%,语文下降9%。每周使用AI一小时损失约5%,五小时损失30%。早期损失从约25%降至16%但未消失。

    阅读全文 原文 ↗
  5. 05

    Fable 的判断力:Simon Willison 从 Claude Code 团队获得的效率技巧

    Fable's judgement

    Simon Willison 在 AIE 上与 Claude Code 团队交流后建议,让 Fable(以及 Opus)用自己的判断力工作,而非硬性规定行为。例如,直接让 Fable 自行决定何时编写测试,比给出具体规则更好。为应对价格即将上涨、节省 Fable token,Jesse Vincent 的另一个技巧是告诉 Fable 将较小任务委托给较低功耗模型(Sonnet 用于实质性实现、Haiku 用于机械修改),主循环保留判断、审计和数据合成等任务。Willison 已将提示词存入 Claude Code 记忆文件,实际效果良好,Fable token 消耗速度明显下降。

    阅读全文 原文 ↗
  6. 06

    NVIDIA 联合多所大学提出 ASPIRE:自我改进机器人框架,零样本成功率最高提升 77 分

    NVIDIA AI Introduces ASPIRE: A Self-Improving Robotics Framework Reaching 31% Zero-Shot on LIBERO-Pro Long Tasks

    NVIDIA 联合密歇根大学、UIUC、UC Berkeley 等提出 ASPIRE,一个持续学习机器人框架。它通过协调器-执行器架构、闭环执行引擎、技能库和进化搜索,编写并优化机器人控制程序。编程智能体使用 Claude Code(Claude Opus 4.6,1M token 上下文窗口)。在 LIBERO-Pro 上最高比最强基线提升 77 分;Robosuite 双手交接成功率从 20% 提升至 92%;BEHAVIOR-1K 收音机拾取任务从 56% 提升至 88%。利用 LIBERO-90 积累的技能,ASPIRE 在零样本条件下对 LIBERO-Pro Long 任务达到约 31% 成功率,此前方法饱和在 4% 附近。

    阅读全文 原文 ↗
  7. 07

    Fable使用指南:发现你的未知

    http://x.com/i/article/2073090223194755072

    作者分享与Claude Fable的协作经验,指出"地图≠领土":提示词与上下文(地图)与实际代码库和约束(领土)之间存在未知。他将未知分为四象限:已知-已知、已知-未知、未知-已知、未知-未知。顶级智能体程序员善于减少未知并预设预案。Fable是首个模型,其工作质量受限于用户澄清未知的能力。Claude可通过快速搜索代码库和互联网、从失败中迭代,帮用户定位未知。具体技巧包括实施前的"盲点检查"及迭代优化;避免指令过于具体或模糊,应让Claude协助发现未知。

    阅读全文 原文 ↗
  8. 08

    Harness Engineering for Self-Improvement:AI装备层设计模式与自改进

    Harness Engineering for Self-Improvement

    Lilian Weng 近日系统探讨了 AI 的"装备层"(Harness)--位于基础模型与现实世界之间的系统层,负责编排执行、控制模型思考与规划。文章归纳三种核心设计模式:1)工作流自动化,采用"计划-执行-观察-改进"循环;2)将文件系统作为持久化内存,解决长程任务上下文窗口与状态持久化问题;3)子智能体与后台任务,实现并行执行与隔离管理。案例聚焦于 Claude Code、Codex 等编程智能体的装备层设计。未来方向包括上下文工程、工作流优化以及通过进化搜索联合优化模型权重。

    阅读全文 原文 ↗