类目 全部 模型 产品 行业 论文 技巧
  1. 01

    面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,含 1.5B VLA 与 0.9B 跟踪模型

    WAIC 2026 | 面壁智能首个具身智能成果 MiniCPM-Robot 系列模型正式发布!

    面壁智能联合 OpenBMB 发布并开源 MiniCPM-Robot 系列,包括通用 VLA 模型 MiniCPM-RobotManip(1.5B 参数)与移动跟踪模型 MiniCPM-RobotTrack(0.9B 参数)。

    阅读全文 原文 ↗
  2. 02

    Qwen-Audio-3.0-TTS 发布:从"能说话"到"会表达"

    从"能说话"到"会表达":Qwen-Audio-3.0-TTS 发布

    通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型,含 Flash 与 Plus 两个版本,首包延迟约 300ms。模型支持 16 种语言和 20 种方言,Plus 版在 Artificial Analysis 榜单夺冠,平均说话人相似度达 82.75。新增 Free-style 自然语言指令、细粒度标签控制及嘈杂环境鲁棒性,音频输出提升至 48K,单次合成最长 3 分钟。

    阅读全文 原文 ↗
  3. 03

    NVIDIA 发布 Cosmos 3 Edge:4B 参数开源世界模型,为机器人及边缘 AI 提供实时推理与动作生成

    Introducing Cosmos 3 Edge

    NVIDIA 在 Hugging Face 上开源了 Cosmos 3 Edge,一个 40 亿参数的世界模型,旨在帮助机器人和视觉 AI 智能体在边缘设备上理解环境、实时推理并生成动作。

    阅读全文 原文 ↗
  4. 04

    通义实验室发布 Qwen-Audio-3.0-TTS 实时语音合成模型

    从"能说话"到"会表达":Qwen-Audio-3.0-TTS 发布

    通义实验室发布 Qwen-Audio-3.0-TTS,含 Flash(首包延迟约300ms)和 Plus 两个版本。Plus 版本在 Artificial Analysis 榜单夺冠,支持16种语言和20种中文方言,平均 WER/CER 低至3.87(Flash),说话人相似度最高达82.75(Plus)。

    阅读全文 原文 ↗
  5. 05

    上海科学智能研究院开放科学多模态基础模型"神珍"

    多模态 AI 模型"神珍"开放,能处理蛋白质、天气等六类科学信息

    上海科学智能研究院开放科学多模态基础模型"神珍",总参数约110亿,可处理DNA、RNA、蛋白质、小分子、地球系统和医学影像六类数据。在生物序列20项任务中,该模型9项取得最优结果;医学影像分割平均Dice得分91.20,在7种参评方法中最优。模型权重及代码已在星河启智、Hugging Face和GitHub开放。

    阅读全文 原文 ↗
  6. 06

    面壁智能发布首个具身智能成果 MiniCPM-Robot 系列模型,正式进军机器人领域

    WAIC 2026 | 面壁智能首个具身智能成果 MiniCPM-Robot 系列模型正式发布!

    面壁智能联合 OpenBMB 在世界人工智能大会上发布并开源首个具身智能成果 MiniCPM-Robot 系列,包括 1.5B 通用 VLA 模型 MiniCPM-RobotManip 与 0.9B 跟踪模型 MiniCPM-RobotTrack。

    阅读全文 原文 ↗
  7. 07

    昆仑万维发布并开源可交互世界模型 Matrix-Game 3.5

    游戏引擎将死,世界模型奇点临近,Matrix Game-3.5引领游戏世界开源模型第一品牌

    昆仑万维在 WAIC 2026 发布并开源新一代可交互世界模型 Matrix-Game 3.5。该模型通过 Patch Memory 与 Warped PRoPE 实现长期记忆与几何一致性建模,可在单张 GPU 上以 720P 分辨率、约 20FPS 实时生成流式视频。

    阅读全文 原文 ↗
  8. 08

    Introducing Fugu-Cyber: our new orchestration model that achieves state-of-the-art performance on real-world cybersecurity benchmarks

    阅读全文 原文 ↗