类目 全部 模型 产品 行业 论文 技巧
  1. 01

    腾讯混元开源 HyOCR-1.5:1B 端到端 OCR 大模型推理提速 6.37 倍

    训推全开源:HyOCR-1.5 让端到端 OCR 大模型跑得更快、看得更准、功能更全

    腾讯混元开源端到端 OCR 大模型 HyOCR-1.5,仅 1B 参数覆盖 8 种以上 text-centric 任务,在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

    阅读全文 原文 ↗
  2. 02

    腾讯混元发布 HyOCR-1.5:端到端 OCR 大模型全栈开源,推理提速 6.37 倍

    训推全开源:HyOCR-1.5 让端到端 OCR 大模型跑得更快、看得更准、功能更全

    腾讯混元发布 HyOCR-1.5,这是端到端 OCR 大模型领域首个将训练、推理、模型权重完整开源的专家模型。仅 1B 参数,覆盖 8 种以上 text-centric 任务。引入 DFlash 投机解码框架,在 Transformers 下实现 6.37× 加速,vLLM 下 2.14× 加速,端到端推理达每页 1.408s。支持 4K 分辨率与 128K 上下文窗口,通过 Agentic Data Flow 扩展低资源 OCR(331 种语言)、古文字识别与多图问答能力。在 OmniDocBench v1.6 上以 94.74 分居端到端第一。

    阅读全文 原文 ↗
  3. 03

    腾讯混元发布Hy3模型:295B参数MoE架构,Agent向LLM定位,已集成微信服务10亿+用户

    这个我看第一眼直接卧槽,效果有点炸裂, 腾讯这几个月到底发生了什么,前面组织架构调整,老登高管退位,年轻一代掌权的结果吗? 兄弟们看这个,腾讯Hy3 把你摄像头直接调起来了, 手往镜头前一伸,整只手的…

    腾讯混元团队发布Hy3模型,采用295B总参数、21B激活参数的MoE架构,推理效率可打平参数规模2-5倍的旗舰模型。Hy3定位为Agent向LLM,从preview到正式版基于50多个真实业务反馈迭代,内部WorkBuddy任务成功率从72%提升至90%,耗时降低34%,幻觉和常识错误持续下降。实测显示其在coding、办公、复杂任务规划方面表现突出,纯视觉能力为短板。Hy3已集成至微信服务10亿+用户,视频演示包括生成HTML网页、Agent网页和10页PPT,模型具备自检和主动说明不足的能力。

    阅读全文 原文 ↗
  4. 04

    德国AI协会发布开源模型Soofi S,在英语和德语基准测试中领先

    German AI consortium releases Soofi S, an open 30B model that tops benchmarks in both English and German

    德国AI协会协调的研究联盟发布开源大语言模型Soofi S 30B-A3B。该模型总参数量316亿,每个token仅激活约32亿参数,采用Mamba-2与标准注意力层混合的MoE架构。模型完全在德国电信慕尼黑工业AI云上训练,训练数据中德语占比从第一阶段的7.2%提升至第二阶段的15.3%。在基准测试中,Soofi S在所有完全开源模型中取得英语和德语综合最高分,超越OLMo 3 32B和Apertus 70B。在HumanEval上得分73.8%,MBPP得分70.2,德语版MBPP得分84.2。上下文窗口支持最高100万token,在4万token长度下,生成吞吐量约为同规模稠密模型的8倍。模型权重已开源。

    阅读全文 原文 ↗