Abstract
Medical question answering in healthcare systems requires advanced reasoning that integrates domain knowledge with clinical workflows. However, existing large language models (LLMs) often generate reasoning chains that lack factual accuracy and clinical reliability. We propose Ranking-Guided Preference Optimization for Reliable Clinical Reasoning (RGPO), a framework that combines reinforcement learning with preference-driven reasoning refinement to enhance clinical chain-of-thought performance in LLM-based healthcare systems. RGPO employs task-adaptive reasoning templates aligned with clinical protocols and a probabilistic evaluation mechanism that integrates with healthcare information systems, including EHRs and clinical documentation, while automatically identifying and correcting low-quality reasoning chains. Unlike traditional pairwise preference methods, RGPO introduces groupwise ranking optimization based on the Bradley-Terry model with KL-divergence regularization for stable clinical deployment. The framework addresses key challenges, including multimodal data integration, clinical validation, and real-world interoperability. Experiments on PubMedQA, MedQA-USMLE, and real-world validation at Far Eastern Memorial Hospital (FEMH) demonstrate consistent improvements over strong baselines. Our 2B-parameter model outperforms larger 7B-20B models, including medical-specialized variants, while maintaining computational efficiency for healthcare deployment. These results demonstrate that combining preference optimization with quality-driven refinement provides a scalable, clinically validated approach to building reliable medical LLMs for practical healthcare applications.
| Original language | English |
|---|---|
| Journal | IEEE Transactions on Artificial Intelligence |
| DOIs | |
| State | Accepted/In press - 2026 |
Keywords
- Chain-of-Thought
- Diagnostic Reasoning
- Electronic Health Records
- Medical QA
- Preference Optimization
- Reinforcement Learning
Fingerprint
Dive into the research topics of 'RGPO: Ranking-Guided Preference Optimization for Reliable Clinical Reasoning'. Together they form a unique fingerprint.Cite this
- APA
- Author
- BIBTEX
- Harvard
- Standard
- RIS
- Vancouver