类目 全部 模型 产品 行业 论文 技巧
  1. 01

    通义千问发布Qwen-Audio-3.0-TTS,登顶TTS排行榜

    Introducing the Qwen-Audio-3.0-TTS. Our latest text-to-speech model, in two flavors: • Flash: real-…

    阿里通义千问推出最新文本转语音模型Qwen-Audio-3.0-TTS,提供Flash(实时交互)和Plus(高质量生成)两个版本。新功能包括细粒度内联标签控制(如【whisper】、【angry】)、自然语言风格控制、支持16种语言,以及一次生成长达3分钟的长文本。该模型目前在Artificial Analysis TTS排行榜上排名第一。

    阅读全文 原文 ↗
  2. 02

    SANA-Video 2.0:混合线性注意力与注意力残差实现高效视频生成

    SANA-Video 2.0: Hybrid Linear Attention with Attention Residuals for Efficient Video Generation

    SANA-Video 2.0 是一个混合视频扩散 Transformer,提供 5B 和 14B 两种规模,可在单 GPU 上生成最高 720p 视频。其 Hybrid Linear-Softmax Attention 以 3:1 比例混合线性与 softmax 注意力,配合 Block Attention Residuals 将深层有效秩提升约 12%。

    阅读全文 原文 ↗
  3. 03

    Gemini 3.6 Flash 与 3.5 Flash-Lite 正式版发布

    Gemini 3.6 Flash & 3.5 Flash-Lite: Developer guide

    Google 发布 Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 正式版。3.6 Flash 在复杂智能体和多模态任务上性能更强,输出 token 价格降至 $7.50/1M,支持 1M token 上下文窗口和 Computer Use 工具。

    阅读全文 原文 ↗
  4. 04

    Cactus 发布 Gemma 4 E2B Hybrid:可在设备端为每个回答输出置信度分数,低分时自动路由至更大模型

    Show HN: 《仙人掌杂交种》:我们教4岁的杰玛如何分辨对错

    Cactus 推出基于 Gemma 4 的混合模型"Cactus Hybrid",在模型检查点内嵌入置信度探针,为每个生成答案输出 0-1 之间的结构化置信度分数。高置信度时在设备端直接回答,低分时可自动路由至更大模型。该探针在零音频训练数据下,于四个音频基准上达到 0.79-0.88 AUROC,远超 token 熵基线(均值 0.549),且 MIT 协议开源。

    阅读全文 原文 ↗
  5. 05

    FLUX 3 发布:Black Forest Labs 多模态模型,支持原生音频、图像生成与动作预测

    FLUX 3 - Real World Models: Towards Multimodal Flow Models as the Backbone of Visual Intelligence.

    Black Forest Labs 发布多模态模型 FLUX 3,面向视频领域,原生支持音频、图像生成与动作预测。该模型旨在成为视觉智能的骨干,目前官方已展示其能力与早期结果。

    阅读全文 原文 ↗