Re$^3$Cap: Retrieval-Guided Refinement for Image Captioning Enhancement via Reinforcement Learning
Re³Cap uses multimodal retrieval to find caption omissions and hallucinations before refinement, offering a concrete retrieval-and-review pattern for vision agents.
**Re³Cap** uses multimodal retrieval as a reasoning signal, with a Caption Refinement Suggester and Caption Quality Assessor targeting hallucinations and omissions. It reports an average **8.64% improvement** over GRPO on COCO-LN500 relation reasoning.
Builders of vision agents can test retrieved examples or evidence as inputs to a separate suggestion-and-assessment loop. The design separates finding likely caption defects from judging the revised output and requires no extra annotations.
**Re³Cap** uses multimodal retrieval as a reasoning signal, with a Caption Refinement Suggester and Caption Quality Assessor targeting hallucinations and omissions. It reports an average **8.64% improvement** over GRPO on COCO-LN500 relation reasoning. Builders of vision agents can test retrieved examples or evidence as inputs to a separate suggestion-and-assessment loop. The design separates finding likely caption defects from judging the revised output and requires no extra annotations. The reported gain is specific to **COCO-LN500** relation reasoning, and the supplied material gives no latency or compute costs. Broader caption quality and production tradeoffs remain unclear.
This provides narrow evidence that retrieval can improve visual refinement when it is structured as a defect-suggestion and quality-assessment loop rather than simply appended as context. It strengthens retrieval-guided agent design for relation errors, but does not establish broader caption quality or production viability because the reported gain is benchmark-specific and omits latency and compute costs.