类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Karpathy:用语音与LLM长谈可提升理解效率

    One pattern I find useful for working with LLMs is a nice long ramble session. Sometimes the LLM nee…

    Andrej Karpathy分享了一种与LLM协作的有效模式:开启语音输入,进行10分钟左右的自由漫谈,即使内容混乱、意识流式也无妨。他发现LLM擅长从长篇不连贯的语音中重构意图,回应的内容往往比用户最初的思路更清晰,从而减少后续修正次数、提升人机对齐效率。

    阅读全文 原文 ↗
  2. 02

    OpenRouter 新增音频转写 API,支持 Whisper 与 token 计价 STT 模型

    Transcription on OpenRouter

    OpenRouter 推出 POST /api/v1/audio/transcriptions 端点,用户可使用同一 API key 将 base64 编码音频发送至该端点,返回 JSON 格式文本与用量对象。

    阅读全文 原文 ↗
  3. 03

    实测Qwen-Image-3.0:19大场景挑战GPT Image2,中文长文本与多图融合表现亮眼

    19大场景实测Qwen-Image-3.0,GPT Image2不再是生图的唯一选择了

    Qwen-Image-3.0上线,支持最高4.5k token输入、12种语言、20多种字体,以及多图融合、图中图和图片编辑。实测显示,其在中文长文本生成、多语言混合排版、UI设计、多图融合与图片编辑等19个场景中均能稳定输出,文字不崩且信息对应准确,图片质量已能与GPT Image2媲美。该模型在国内可直接使用,速度快且价格不贵。

    阅读全文 原文 ↗
  4. 04

    Claude 不是编译器--它比编译器更好

    Claude 不是编译器

    Claude 等大语言模型能跨越战略、产品、架构、代码到机器码的整个技术栈垂直工作,无需安排会议或请求许可,因此比传统编译器更强大。以 exe.dev 为例,团队用 LLM 研究分布式 DNS 系统设计、历史安全缺陷和替代实现策略,并通过多智能体循环构建了完整系统。LLM 虽在单项任务上不及资深人类,但能同时处理所有层级,实现跨层协作。

    阅读全文 原文 ↗
  5. 05

    GitHub Copilot 推出 canvases 扩展,实现开发者与 AI 智能体实时协作

    How to build interactive experiences with canvases

    GitHub Copilot 在应用中推出 canvases 扩展,这是一种共享交互式界面,开发者和 AI 智能体可在其中实时协作。用户通过 `/create-canvas` 指令创建画布,Copilot 可动态更新内容,用户则通过点击、编辑等操作与同一工作区交互。示例包括快速分类 Issue、生成交互式代码库关系图、管理会话工作树、优化提示词质量以及跨平台搜索知识联系人。

    阅读全文 原文 ↗
  6. 06

    开源模型季度盘点:Kimi K3、Qwen 3.8、WAIC 演讲、知识蒸馏与开源闭源差距

    Open models recap: more on Kimi K3, Qwen 3.8, Xi's WAIC speech, distillation, the open-closed gap, and what's next

    Nathan Lambert 与 Florian Brand 在播客中盘点开源模型最新动态。Kimi K3 发布后,中美 AI 地缘政治、开源与闭源模型的经济性、前沿安全等问题加速演进。Qwen 宣布下一代大模型将开源权重,中国厂商在开源策略上持续加码。讨论还涉及开源模型与闭源前沿的性能差距、知识蒸馏争议,以及后训练对特定任务的价值。

    阅读全文 原文 ↗