%PDF-1.7 % 1 0 obj > endobj 2 0 obj > endobj 3 0 obj > stream <alt><li xml:lang="x-default">When Semantics Mislead Vision: Mitigating Large Multimodal Models Hallucinations in Scene Text Spotting and Understanding</li></alt>

  • Yan Shu
  • Hangui Lin
  • Yexin Liu
  • Yan Zhang
  • Gangyan Zeng
  • Yan Li
  • Yu Zhou
  • Ser-Nam Lim
  • Harry Yang
  • Nicu Sebe
  • http://arxiv.org/licenses/nonexclusive-distrib/1.0/
  • cs.CV
  • endstream endobj 4 0 obj > endobj 5 0 obj > endobj 6 0 obj > endobj 7 0 obj > endobj 8 0 obj > endobj 9 0 obj > endobj 10 0 obj > endobj 11 0 obj > endobj 12 0 obj > endobj 13 0 obj > endobj 14 0 obj > endobj 15 0 obj > endobj 16 0 obj > endobj 17 0 obj > endobj 18 0 obj > endobj 19 0 obj > endobj 20 0 obj > endobj 21 0 obj > endobj 22 0 obj > endobj 23 0 obj > /Border [ 0 0 0 ] /C [ 0 1 1 ] /H /I /Rect [ 161.203 465.847 450.797 478.749 ] /Subtype /Link /Type /Annot >> endobj 24 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 304.817 124.379 311.791 133.126 ] /Subtype /Link /Type /Annot >> endobj 25 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 314.699 124.379 321.673 133.126 ] /Subtype /Link /Type /Annot >> endobj 26 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 324.582 124.279 331.556 133.126 ] /Subtype /Link /Type /Annot >> endobj 27 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 334.464 124.379 341.438 133.126 ] /Subtype /Link /Type /Annot >> endobj 28 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 344.347 124.279 351.321 133.126 ] /Subtype /Link /Type /Annot >> endobj 29 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 354.23 124.279 361.204 133.126 ] /Subtype /Link /Type /Annot >> endobj 30 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 364.112 124.279 371.086 132.857 ] /Subtype /Link /Type /Annot >> endobj 31 0 obj > /Border [ 0 0 0 ] /C [ 0 1 0 ] /H /I /Rect [ 373.995 124.279 380.969 133.126 ] /Subtype /Link /Type /Annot >> endobj 32 0 obj > /BS > /NM (fitz-L0) /Rect [ 12 227.13 32 564.87 ] /Subtype /Link >> endobj 33 0 obj > stream x+