类目 全部 模型 产品 行业 论文 技巧
  1. 01

    Any-OPD:面向流匹配模型的异构同策略蒸馏框架

    Any-OPD: Heterogeneous On-Policy Distillation for Flow-Matching Models via Representation-Space Bridging

    Any-OPD 提出首个支持任意异构流匹配生成器对的同策略蒸馏框架,仅通过冻结的 DINOv2 表示空间桥接教师与学生模型,无需共享 VAE、架构或噪声调度。将 FLUX.1-dev 蒸馏至 SD3.5-Medium 后,学生模型 PickScore 与 HPSv3 均显著提升,以教师五分之一的参数量达到接近其性能,而直接潜在回归训练完全失败。

    阅读全文 原文 ↗
  2. 02

    Video-DeepResearch:迈向下一代多模态深度研究智能体

    Video-DeepResearch: Towards the Next-Generation Multimodal Deepresearch Agent

    Video-DeepResearch(Video-DR)将多模态智能体从静态图像扩展到连续视频流,提出解耦感知-探索流水线与分阶段工具解锁,以应对模态偏差和参数知识泄漏两大瓶颈。

    阅读全文 原文 ↗
  3. 03

    论文揭示 LangGraph、CrewAI 等五个智能体工作流框架的检查点与恢复语义缺陷

    Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers

    一项研究为智能体工作流持久化层提出"恢复契约",规定前缀延续、效果恰好一次等六项属性,并用 TLA+ 模型穷举验证了 740 万状态。实测发现 LangGraph 1.2.9 在崩溃后重复执行已持久化工作,CrewAI 1.15.2 违背其书面声明,pydantic-graph 1.x 无法在节点中途崩溃后恢复。研究还给出经 Verus 验证的参考实现 REMIT,修复了分叉与有效性缺陷。

    阅读全文 原文 ↗
  4. 04

    SIGNPOST-Bench:多模态大模型文本-视觉冲突消解新基准

    SIGNPOST-Bench: Benchmarking Text-Vision Conflict Resolution in Multimodal Large Language Models

    SIGNPOST-Bench 是一个用于评估多模态大模型文本-视觉冲突消解能力的受控反事实基准,包含来自四个数据集的 5,111 个反事实组和 25,555 个图像变体。

    阅读全文 原文 ↗