The Sim-to-Real Gap in Indoor Segmentation

Mohammed Faisal Parvez · Hyderabad, IN

Abstract
Do synthetic validation scores predict real-world performance?
Method
SegFormer-B0 fine-tuned on a 1,458-image labeled real indoor dataset.
Key Result
0.676 mIoU on real-frame validation — while a synthetic-trained counterpart scored 0.988 val mIoU yet failed on real footage.
Implication
Synthetic metrics can wildly overstate deployability.
Fig. 4 — Validation mIoU: sim vs real
0.988 sim (synthetic val) 0.676 real (deployed) same architecture · different training reality