类目 全部 模型 产品 行业 论文 技巧
  1. 01

    首届"小有可为"大赛乡村教育一等奖作品"智绘科普"技术拆解

    小有可为实战教程|乡村教育一等奖作品拆解

    首届"小有可为"大赛乡村教育赛道一等奖作品"智绘科普"采用 Qwen3.5-397B-A17B 大语言模型与 Manim 动画引擎,通过多Agent分阶段协作与自动修复机制,将知识主题转化为可控、可编辑的教学动画。系统包含规划、草稿、实现、审查、合成五个阶段,渲染失败时可自动提取日志并修复,该工程范式可迁移至其他赛道。

    阅读全文 原文 ↗
  2. 02

    LLM cliché highlighter:一款识别AI写作套话的检测工具

    LLM cliché highlighter

    Simon Willison 用 Fable 5 开发了一款 LLM cliché highlighter 应用,用于高亮 LLM 生成文本中常见的十种套话模式,例如"no fluff, no filler, no jargon"这类陈词滥调。该工具旨在帮助读者快速识别并过滤掉充斥在文章中的 AI 写作风格化表达。

    阅读全文 原文 ↗
  3. 03

    小有可为实战教程:拆解乡村教育一等奖作品"智绘科普"的多Agent协作与门控工程

    小有可为实战教程|乡村教育一等奖作品拆解

    首届"点亮乡村课堂"赛道一等奖作品"智绘科普"采用Qwen3.5-397B-A17B大语言模型与Manim开源数学动画引擎,构建多Agent分阶段协作流水线。系统通过规划、草稿、实现、审查、合成五个Agent,配合时序门控、几何审计、视觉审查三道质量门及自动修复回路,实现可控可编辑的教学动画生成。项目底层"多Agent协作+门控+自我修复"范式可迁移至养老陪伴、孤独症干预等场景。

    阅读全文 原文 ↗
  4. 04

    企业AI智能体评估存在"现实对齐"缺口:半数组织曾将通过内部测试的智能体部署到生产环境后导致客户故障

    The agent evaluation gap: Enterprise AI organizations have a reality-alignment problem, not a coverage problem - and most are shipping to production anyway

    对157家企业的调查显示,50%的组织在过去一年曾部署通过内部评估但导致客户故障的AI智能体或大语言模型功能,5%的企业完全信任自动化评估,29%认为评估与现实结果对齐不佳是最大局限。尽管信任度低,66%的企业已允许或正计划在12个月内实现低风险智能体的全自动、无人工干预部署。

    阅读全文 原文 ↗
  5. 05

    生成式人工智能是一场工程灾难:AI公司抢购70%高端内存,推高电脑价格

    生成式人工智能是一场工程灾难

    AI公司为维持大语言模型(如ChatGPT、Claude)运行,可能已购买全球70%的高端计算机内存,导致内存与存储价格飙升:两年前350美元的硬盘现已涨至800美元且缺货,部分笔记本电脑涨价50%。科技公司计划未来几年将美国数据中心容量扩大8倍,部分站点甚至用喷气发动机供电。预测称,平价入门级电脑可能在2028年前消失,内存短缺预计持续数年。

    阅读全文 原文 ↗
  6. 06

    OpenAI 提出 AI 时代记分卡:"有用智能每美元"衡量实际工作价值

    A scorecard for the AI age

    OpenAI 提出"Useful Intelligence per Dollar"(有用智能每美元)作为衡量 AI 投资回报的核心指标,从完成的有用工作量、成功任务的实际成本、结果可靠性三个维度评估。

    阅读全文 原文 ↗
  7. 07

    Cursor 评估负责人确认 Claude Fable 5 在 CursorBench 达 72.9% 新高

    Working at the frontier: How Cursor knew Claude Fable 5 was ready for the hardest 1% of problems

    Cursor 的模型评估负责人 Nate Schmidt 发现,Claude Fable 5 在其内部基准 CursorBench 上以 Max effort 模式达到 72.9%,创下新高。该模型在模糊的真实编程任务中表现出全局推理能力,例如在航天模拟器中仅凭一句提示自主规划并成功登月,而此前 Claude Opus 运行 12 小时以上仍无结果。

    阅读全文 原文 ↗