类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Swiftlet:在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

    Show HN: 在 Mac 上运行 80B 版 Qwen(内存 4.3 GB),在 iPhone 上运行 35B 版

    Swiftlet 是一个 Swift + Metal 运行时,可在普通 Apple 设备上运行 Qwen3-Next 和 Qwen3.5/3.6 MoE 混合模型,仅将小型稠密核心驻留内存,按需从存储流式加载路由专家权重。

    阅读全文 原文 ↗
  2. 02

    Reflex 开源 XY:基于 Rust 的超快 Python 绘图库,可保持 1 亿点图表交互流畅

    Reflex Open Sources XY: A Rust-Backed Super-Fast Python Charting Library That Keeps 100 Million Point Charts Interactive

    Reflex AI 发布 Apache-2.0 许可的 Python 交互式 2D 绘图库 XY,通过 Rust 原生核心、二进制缓冲传输和 WebGL2 渲染,在 1 万至 1 亿点范围内保持约 0.08 秒的渲染时间。

    阅读全文 原文 ↗
  3. 03

    Anthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议

    Anthropic signs $10B computing deal with infrastructure startup Volta, a cloud company that is only …

    Anthropic 与成立仅数月的云初创公司 Volta 签署 100 亿美元算力协议,约合每年 17 亿美元。Volta 估值 24 亿美元,硬件几乎全为租用:算力来自比特币矿商 Bitdeer 挪威 121MW 站点,芯片由 Nvidia 供应、Dell 组装。Anthropic 买的是交付速度,代价是承担超大规模云厂商合同从未有过的交易对手风险。

    阅读全文 原文 ↗
  4. 04

    面壁智能开源 ForgeStencil:一周自动优化 100+ 工业与科学软件,全程零人工介入

    面壁智能开源 ForgeStencil:一周优化 100+ 工业与科学软件,全程 0 人工介入,国产「智」造升级加速

    面壁智能联合 OpenBMB 开源全球首个支持 Stencil 自动研究、自动部署的 AI 优化系统 ForgeStencil,由 Kernel Agent 与 App Agent 闭环协作,实现从算子优化到应用集成的全自动流程。

    阅读全文 原文 ↗
  5. 05

    在单颗 AMD MI300X 上运行 DeepSeek V4 Flash

    一个开源仓库提供了在单颗 AMD MI300X 上生产运行 DeepSeek-V4-Flash-0731 的完整配置与补丁,无需额外量化或权重卸载。该 304B 参数模型在 192 GB HBM 上实现单流 168.6 tok/s 解码、8 并发流 542 tok/s 聚合吞吐,并验证了 256K 上下文。

    阅读全文 原文 ↗
  6. 06

    Any-OPD:面向流匹配模型的异构同策略蒸馏框架

    Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

    Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

    阅读全文 原文 ↗
  7. 07

    AirLLM 实现单块 4GB GPU 运行 70B 模型推理

    使用单块 4GB GPU 进行 AirLLM 70B 推理

    AirLLM 项目支持在单块 4GB 显存 GPU 上运行 70B 参数大模型推理,无需多卡或大规模显存配置。该项目已开源,相关讨论在 Hacker News 上获得 103 点热度,引发社区关注。

    阅读全文 原文 ↗
  8. 08

    用 NVIDIA SkillSpector、LangGraph、YARA 规则、SARIF 与 CI 策略门构建高级 AI 技能安全审计流水线

    Building an Advanced AI Skill Security Auditing Pipeline with NVIDIA SkillSpector, LangGraph, YARA Rules, SARIF, and CI Policy Gates

    本教程演示如何用 NVIDIA SkillSpector 评估 AI 技能的安全态势,构建包含干净、风险、恶意及 MCP 示例的合成技能市场,并通过 LangGraph 检查流水线扫描每个技能。

    阅读全文 原文 ↗
  9. 09

    Video-DeepResearch:迈向下一代多模态深度研究智能体

    Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

    Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。

    阅读全文 原文 ↗
  10. 10

    OpenRouter 推出 ori CLI:为 Claude Code 等 Harness 提供开箱即用的优化配置

    Ori Harness: The Best Way to Use OpenRouter with Any Harness

    OpenRouter 发布 ori CLI,用户安装并登录后即可获得针对 Claude Code、Codex、OpenCode、Hermes 等 harness 的优化配置,省去手动设置大量环境变量的麻烦。

    阅读全文 原文 ↗
  11. 11

    欧盟《人工智能法案》透明度规则生效,违规最高罚 1500 万欧元

    Europe's AI labeling and transparency rules are now in effect

    欧盟《人工智能法案》下的新透明度义务于 8 月 2 日生效,要求公司披露用户何时与 AI 模型互动,并为合成音视频和文本添加机器可读标记。欧盟还推出了一套可选的 AI 披露标签供平台采用,但标注要求本身是强制性的。违规公司面临最高 1500 万欧元(约 1720 万美元)或全球年营业额 3% 的罚款,8 月 2 日前推出的模型有 4 个月宽限期。

    阅读全文 原文 ↗
  12. 12

    论文揭示 LangGraph、CrewAI 等五个智能体工作流框架的检查点与恢复语义缺陷

    Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers

    一项研究为智能体工作流持久化层提出"恢复契约",规定前缀延续、效果恰好一次等六项属性,并用 TLA+ 模型穷举验证了 740 万状态。实测发现 LangGraph 1.2.9 在崩溃后重复执行已持久化工作,CrewAI 1.15.2 违背其书面声明,pydantic-graph 1.x 无法在节点中途崩溃后恢复。研究还给出经 Verus 验证的参考实现 REMIT,修复了分叉与有效性缺陷。

    阅读全文 原文 ↗
  13. 13

    SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

    SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

    SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。

    阅读全文 原文 ↗
  14. 14

    SpecForge v0.3.0 发布:统一解耦与共置投机解码栈,新增开放 SpecBundle 草稿模型

    Blog SpecForge v0.3.0: a Unified Disaggregated and Colocated Speculative Decoding Stack, and New Open SpecBundle Draft Models When we first released SpecForge, a training job owned both the frozen target model and the draft model being optimized. This made EAGLE3 draft-model training practical and directly compatible with SG… The SpecForge Team

    SpecForge v0.3.0 将目标模型推理与草稿模型训练分离,支持 EAGLE3、EAGLE3.1、P-EAGLE、DFlash、Domino、DSpark 等多种投机解码算法,并统一在线、离线与解耦工作流。

    阅读全文 原文 ↗
  15. 15

    工信部发布首部L3/L4自动驾驶系统安全要求强制性国标,2027年7月实施

    工信部:《智能网联汽车自动驾驶系统安全要求》发布实施,为自动驾驶产品明确统一安全准入基线

    工信部组织制定的《智能网联汽车 自动驾驶系统安全要求》(GB 44721-2026)强制性国家标准获批发布,拟于2027年7月1日起实施。这是我国首部针对L3级有条件自动驾驶和L4级高度自动驾驶系统的强制性国标,由2024年推荐性国标GB/T 44721-2024升级而来,为自动驾驶产品明确了统一的安全准入基线。

    阅读全文 原文 ↗
  16. 16

    Palantir 强劲季度后,CEO Alex Karp 称 AI 行业"马克思主义"

    After killer quarter, Palantir CEO Alex Karp calls AI industry 'Marxist'

    Palantir CEO Alex Karp 在季度股东信中警告,前沿 AI 实验室对企业过于不可信,并称其意图"占有所谓合作伙伴的生产资料",带有"马克思主义色彩"。该公司第二季度营收 19 亿美元,同比增长 93%,利润 11 亿美元。Karp 主张 Palantir 提供模型无关的 AI 与分析软件,让企业掌控自身数据与 AI"废气"(提示词、编排、上下文)。

    阅读全文 原文 ↗
  17. 17

    Cloudflare 如何用软件工厂将 Astro 的 GitHub issue 数降至零

    How we built a software factory to drive Astro's GitHub issue count to zero

    Cloudflare 在 Astro 仓库上运行自动化 triage 流水线,通过隔离的 AI 子代理复现、诊断并修复 bug,将开放 issue 从 200 多个降至约 30 个,预计下月归零。该流水线由 issue 标签驱动,修复后自动发布预览版本供用户验证。其底层引擎已发展为 Flue,一个开源的平台无关框架,用于构建持久化智能体与工作流。

    阅读全文 原文 ↗
  18. 18

    NVIDIA Alpamayo 2 Super 开放商用,面向 Robotaxi 与自动驾驶的前沿开源模型

    NVIDIA Alpamayo 2 Super, the Frontier Open Model for Robotaxis and Autonomous Vehicles, Now Available for Commercial Use

    NVIDIA Alpamayo 2 Super 现已开放商用,基于 Cosmos 3 Super Reasoner 构建,采用强化学习后训练,支持轨迹预测、因果链推理、元动作、自动标注及视觉问答等多任务输出。

    阅读全文 原文 ↗
  19. 19

    Cloudflare 让智能体通过本地追踪调试 Workers

    Your agent can now debug Workers with local tracing

    Cloudflare 即日起在 wrangler dev 和 vite dev 中自动为本地 Worker 调用捕获 OpenTelemetry 追踪,无需安装 SDK 或配置智能体。智能体可通过 Local Explorer API 查询追踪数据,定位失败操作、修复本地环境并验证结果。开发者也可在浏览器界面 Local Explorer 中可视化查看 spans、时序、错误及关联控制台日志。

    阅读全文 原文 ↗
  20. 20

    商汤 SenseNova U1 开源:统一推理与图像生成

    Thanks Dan for testing SenseNova U1 - our open-source AI model that reasons and generates images in …

    商汤发布开源模型 SenseNova U1,可在统一流程中同时进行推理与图像生成。其信息图模式可将单条提示词转为结构化幻灯片,交错模式则逐步生成图文内容,如演示六步画龙教程。模型已上线 SenseNova Studio、HuggingFace 及 GitHub。

    阅读全文 原文 ↗
  21. 21

    蚂蚁百灵发布Ling-3.0-flash开源权重

    Today, we're releasing the open weights for Ling-3.0-flash. 🎉 Official BF16 and FP8-quantized vers…

    今天,我们发布了 Ling-3.0-flash 的开源权重。🎉 官方 BF16 和 FP8 量化版本现已可用,您可以根据自己的硬件、性能要求和部署需求选择最合适的版本。

    阅读全文 原文 ↗
  22. 22

    Cloudflare 推出 Agents 平台,率先上线智能体追踪功能

    Introducing: Cloudflare Agents

    Cloudflare 推出 Cloudflare Agents,将部署在平台上的智能体会话统一到一个视图中,并率先上线 agent tracing 功能。该功能支持 OpenTelemetry 兼容的 Think、Flue 和 AI SDK 等智能体框架,可测量每次模型调用、工具执行和 token 消耗。

    阅读全文 原文 ↗
  23. 23

    GPT-5.6 Luna降价80%永久生效

    Some fine folks apparently misunderstood, but the GPT-5.6 Luna price reduction by 80% is not a tempo…

    有些人显然误解了,但 GPT-5.6 Luna 降价 80% 不是临时噱头,而是永久的。效率提升不会消失。幸运的是。

    阅读全文 原文 ↗
  24. 24

    GPT-Live实时音频新架构发布

    GPT-Live is a new architecture and stack for realtime audio:

    GPT-Live 是一种用于实时音频的新架构和栈: GPT-Live 可以在说话的同时聆听。 为了让这种体验在 ChatGPT 规模下显得自然,我们从客户端到模型重建了语音栈。 这一新架构让音频持续流动,因此更深入的推理和工具使用不会打断对话。

    阅读全文 原文 ↗
  25. 25

    腾讯混元发布 Hy ASR 3.0 preview:真正懂上下文的语音识别

    Hy ASR 3.0 preview发布:真正懂上下文的语音识别

    腾讯混元发布新一代语音识别模型 Hy ASR 3.0 preview,基于大语言模型 Hy3 与 MoE 架构,融合高精度识别与语义理解。其在开源评测集中中文普通话 WER 3.34%、英语 WER 2.62%、粤语 WER 3.12%,并支持上下文纠错、热词注入及高噪耳语等场景。该模型已上线腾讯云 API,元宝 App 首发并免费开放。

    阅读全文 原文 ↗
  26. 26

    Claude Code 连接器可复用至 Artifacts

    I think a lot of people don't realize- if you connect a Claude Connector (e.g. your gmail, calendar,…

    我想很多人没有意识到--如果你连接了一个 Claude 连接器(例如你的 Gmail、日历、Slack 等),Claude Code 也将能够使用它们,包括在 Artifacts 中。

    阅读全文 原文 ↗
  27. 27

    微软开源 Orchard 智能体训练框架

    Orchard is an open-source framework for the research community to train and evaluate AI agents acros…

    Orchard 是一个面向研究社区的开源框架,用于跨任务类型训练和评估 AI 智能体。它降低了复杂性,同时通过让研究人员复用同一套基础设施,支持较小模型也能实现强劲性能。https://msft.it/6019a8fqP

    阅读全文 原文 ↗
  28. 28

    从零开始,教你用Codex搓出属于你自己的第一个硬件

    从零开始,教你用Codex搓出属于你自己的第一个硬件。

    作者以零基础身份,全程通过与Codex对话,从需求讨论、电路搭建、代码烧录到3D打印组装,5天内做出一个能提醒久坐的猫爪硬件。文中还介绍了用Agent调试宏键盘、以及OpenAI与Work Louder联名发布的Codex Micro键盘(13个机械按键,售价230美元)等案例,强调"干中学"的AI开发方式。

    阅读全文 原文 ↗
  29. 29

    杰文斯悖论还能持续吗:AI 定价分层如何支撑算力需求增长

    Racing to Sustain Jevons' Paradox

    科技巨头高管普遍表示算力供应仍无法满足需求,但 AI 定价却在上涨:Anthropic 7 月 24 日发布的 Fable 5 定价每百万输出 token 50 美元,较 Opus 5 翻倍;OpenAI 则在 Fable 5 发布五天后将 GPT-5.6 Luna 价格下调 80%。

    阅读全文 原文 ↗
  30. 30

    NVIDIA 开源 cuFile API,推动 GPU 直连存储

    As AI Increases Demands on Memory, Storage Steps Up

    NVIDIA 在 FMS 大会上宣布开源 cuFile API 及底层存储软件栈,让 GPU 可直接读写存储,访问延迟降至微秒级。其 Vera CPU 在两级压缩与加密流水线中吞吐量比 x86 CPU 最高提升 3.21 倍,并联合 40 多家厂商推出 Storage-Next 计划。

    阅读全文 原文 ↗
  31. 31

    Cloudflare 推出 Agent Development Lifecycle,让智能体接管更多软件开发生命周期

    The Agent Development Lifecycle has arrived on Cloudflare

    Cloudflare 宣布推出 Agent Development Lifecycle(ADLC),以取代传统 SDLC,让 AI 智能体从仅生成代码扩展到承担更多开发流程。

    阅读全文 原文 ↗
  32. 32

    Cloudflare 推出 CI SDK:在 Cloudflare 上为百万级仓库运行 CI/CD 流水线

    Run CI/CD for millions of repos - on your platform, on Cloudflare

    Cloudflare 推出基于 Workflows 和 Sandbox SDK 的 CI SDK,让平台方直接在 Cloudflare 上运行 CI/CD 流水线,支持构建、lint、类型检查、单元测试、依赖缓存及条件部署。

    阅读全文 原文 ↗