TensorX
返回文献探索

Paper · arXiv 2604.09450

ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion

Lifeng Chen, Tianqi You, Hao Liu, Zhimin Bao, Jile Jiao, Xiao Han, Zhicai Ou, Tao Sun, Xiaofeng Mou, Xiaojie Jin, Yi Xu

23 upvotesApril 10, 2026arXiv 预印本
AI 摘要

ECHO is an efficient diffusion-based vision-language model for chest X-ray report generation that achieves faster inference through direct conditional distillation and response-asymmetric diffusion training while maintaining high clinical accuracy.

vision--language modelsdiffusion-based modelsautoregressive modelsdenoising iterationsmean-field biastoken-factorized denoisersDirect Conditional DistillationResponse-Asymmetric Diffusionon-policy diffusion trajectoriesjoint token dependenciesinference speedupclinical accuracy

Abstract

Chest X-ray report generation (CXR-RG) has the potential to substantially alleviate radiologists' workload. However, conventional autoregressive vision--language models (VLMs) suffer from high inference latency due to sequential token decoding. Diffusion-based models offer a promising alternative through parallel generation, but they still require multiple denoising iterations. Compressing multi-step denoising to a single step could further reduce latency, but often degrades textual coherence due to the mean-field bias introduced by token-factorized denoisers. To address this challenge, we propose ECHO, an efficient diffusion-based VLM (dVLM) for chest X-ray report generation. ECHO enables stable one-step-per-block inference via a novel Direct Conditional Distillation (DCD) framework, which mitigates the mean-field limitation by constructing unfactorized supervision from on-policy diffusion trajectories to encode joint token dependencies. In addition, we introduce a Response-Asymmetric Diffusion (RAD) training strategy that further improves training efficiency while maintaining model effectiveness. Extensive experiments demonstrate that ECHO surpasses state-of-the-art autoregressive methods, improving RaTE and SemScore by 64.33\% and 60.58\% respectively, while achieving an 8times inference speedup without compromising clinical accuracy.

北京市昌平区探索星信息技术及软件开发工作室

京ICP备2026059466号
ECHO: Efficient Chest X-ray Report Generation with One-step Block Diffusion | TensorX