类目 全部 模型 产品 行业 论文 技巧
  1. 01

    蚂蚁集团 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型

    Ant Group's Robbyant Unveils LingBot-VA 2.0: A Causal Video-Action Model Built Natively for Physical AI

    蚂蚁集团旗下具身智能团队 Robbyant 发布 LingBot-VA 2.0,首个原生具身基础模型。该模型采用因果 DiT 架构,视频专家约 13.0B 参数(约 1.9B 激活),训练规模约 15.3B 参数,推理时每 token 约 2.5B 激活。模型引入多块预测(MCP)实现 2.3 倍训练加速,并通过前瞻推理将推理延迟降至 142 ms/chunk。在 RoboTwin 2.0 的 50 个任务上,干净与随机演示数据平均成功率分别达 93.8% 和 93.4%。

    阅读全文 原文 ↗
  2. 02

    GPT-5.6 提升健康智能,Luna 性能更强成本更低

    GPT-5.6 is a major step forward for health intelligence. Across the lineup, we're delivering strong…

    GPT-5.6 是健康智能领域的一大进步。 在整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    阅读全文 原文 ↗
  3. 03

    GPT-5.6 健康智能升级,Luna 性能提升成本降 25 倍

    GPT-5.6 for health intelligence, the team has been focusing hard on improvements here:

    GPT-5.6 用于健康智能,团队一直专注于这方面的改进: 整个产品线中,我们以更低成本提供更强性能:GPT-5.6 Luna 在最高推理设置下性能优于 GPT-5.5,而成本降低 25 倍。 这些进步共同提升了质量,同时让全球更多人能够使用先进模型。

    阅读全文 原文 ↗
  4. 04

    GigaChat Audio:支持120分钟输入的时间感知音频大语言模型

    GigaChat Audio: Time-aware Large Audio Language Model

    GigaChat Audio 是一种时间感知的音频大语言模型,支持长达120分钟的输入,并能生成带有明确时间戳的问答、片段描述和摘要。该模型通过将周期性时间标记与连续音频 token 交错,并利用级联合成数据管道进行大规模训练,在短时和长时基准上均实现了强时间定位精度。研究团队已开源模型权重及超过1万小时的时序数据集。

    阅读全文 原文 ↗