{"as_of":"2026-08-20T10:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a59127f37be75a6e334fbddafef204f8b5c579035deb9f6e81b5dde3a8f91d37","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:27:19.422402Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T04:55:07.037081Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.17901","snapshot_observed_at":"2026-07-31T04:55:07.037081Z","title":"Postalign: Multimodal grounding as a corrective lens for mllms.arXiv preprint arXiv:2506.17901,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28516","last_updated":"2026-07-30T16:55:00Z","snapshot_observed_at":"2026-08-10T14:40:08.313631Z","submitted_at":"2026-07-30T16:55:00Z","title":"Beyond Frame Selection: Generative Latent Evidence Aggregation for Long-Video Understanding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T04:55:07.037081Z"},"links":{"cited_paper":"/paper/2506.17901","citing_paper":"/paper/2607.28516"},"observation_digest":"sha256:fae793c0c3a9fb5befb5d4ef98ed600f83343a3b1f0b27fd6bb9ae6e1b710982","observation_id":"aabe33ca-8363-46f4-84c2-e6edcf9dd92d","resolution":{"observed_at":"2026-07-31T04:55:07.037081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.17901/citation-record","integrity":"/paper/2506.17901/integrity","json":"/paper/2506.17901/citation-record.json","paper":"/paper/2506.17901"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T23:27:19.137072Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.137072Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:99c38bf1a0ed7b78e182f8a623ddf39f85cb785d7ace51e8e9d5b34bf8b7c948","observation_id":"273b3927-c791-4d73-ae2b-d1bc481b4586","resolution":{"observed_at":"2026-08-06T23:27:19.137072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T23:27:19.142549Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.142549Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c6c9d2a7630898c13297f1be28cf786b6892949bd346bf373e93a69e84d34d12","observation_id":"aa400c8d-d4ca-4635-95fa-5316f5e2134a","resolution":{"observed_at":"2026-08-06T23:27:19.142549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T23:27:19.147296Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.147296Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5c30fbd70388edc3b5c14f73fbfb43d76830ae917d78e0ebf179a57ad51ede05","observation_id":"32175eb1-23fc-440a-8e50-8f07e4a0e8bf","resolution":{"observed_at":"2026-08-06T23:27:19.147296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T23:27:19.153898Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.153898Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:859725bf2128351d9d58534de54f957e030588d3c14b1681ace295f802e2eabe","observation_id":"d4b16d96-276a-42a5-9803-672a34bcd566","resolution":{"observed_at":"2026-08-06T23:27:19.153898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.159315Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.159315Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:786aad4c714988075c8d254bdfffbffc1b49df2b1262c95ca3a99305b3415f31","observation_id":"d19aa91a-eb45-4ff2-ad7c-43d7846ad7cd","resolution":{"observed_at":"2026-08-06T23:27:19.159315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.164043Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.164043Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:20b8faeb4079c09059138f4c79eb99cc18a4ea7e7e45951140ab832fbd960511","observation_id":"ca2a5fca-638c-4e0f-9852-7cb5c097dad5","resolution":{"observed_at":"2026-08-06T23:27:19.164043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T23:27:19.168676Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.168676Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c1c167d2b91a5aa062aa34ac1cbeac5c8cc74ed1cda5bc0b4515d7c9dff7439c","observation_id":"f82fde58-886e-4f91-9968-e168b67e6bee","resolution":{"observed_at":"2026-08-06T23:27:19.168676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-06T23:27:19.173386Z","title":"A survey on hallucination in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.173386Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:86adb2cb57a37ce1506f7a4cbbbf7ca48ce135175845643f927a8d7edde80e3e","observation_id":"93ceceb7-6b52-404b-913f-734d14c999be","resolution":{"observed_at":"2026-08-06T23:27:19.173386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-06T23:27:19.178110Z","title":"Hallucination of multimodal large language models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.178110Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:44d5faaca6fc722acffdf4d0cb3a6efeb285d1c8217ea42e56d8bb0d88681d8d","observation_id":"02ba2f93-d8a2-4594-a6b1-07d36ce67313","resolution":{"observed_at":"2026-08-06T23:27:19.178110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-17T08:51:17.513002Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-08-06T23:27:19.182352Z","title":"Analyzing and mitigating object hallucination in large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.182352Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:4514e29bccee58f9a1b8985ad65ddbc1861063479bb412760df24bcaad866a82","observation_id":"40e6b8fc-6543-44f4-93fa-f8dc726fa650","resolution":{"observed_at":"2026-08-06T23:27:19.182352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.186869Z","title":"The deluge of spurious correlations in big data","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.186869Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f83e955799a83c362dfaf5b4e627654f5a66ebf28baf4846e29ec9fe067a22db","observation_id":"bbe7b840-b758-452b-ad9d-111b7f59d2b0","resolution":{"observed_at":"2026-08-06T23:27:19.186869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.191298Z","title":"Spurious correlations in machine learning: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.191298Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:81923b75731763a85ecf2c3e077a81206f17acbaa1b3b3fd143dd161fd919bff","observation_id":"dd9ca390-6541-4b3a-9a8a-5272bd001bbe","resolution":{"observed_at":"2026-08-06T23:27:19.191298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.243206Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":"5b31c66e-531e-469e-89a4-d7b94f010420","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.196105Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:4f2b1206419e580490d58124c2808dcf7229796f587b7fd16c6e811bc24ad56f","observation_id":"48703dd0-3329-485b-9045-e787be222265","resolution":{"observed_at":"2026-08-06T23:27:20.248345Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.229552Z","title":"Described object detection: Liberating object detection with flexible expressions","venue":null,"work_id":"f33c1465-b02d-48ce-9bcb-60bfdc04d18d","year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.200189Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:cfdf1666d3dc908f2b177a7989e2bba20b04610791da4267de1b44215b251898","observation_id":"52ba5597-4e00-4d45-bd0d-02cfdc97634e","resolution":{"observed_at":"2026-08-06T23:27:20.233649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.216099Z","title":"Mattnet: Modular attention network for referring expression comprehension","venue":null,"work_id":"bb7a96f7-cb44-466a-9d46-ca7239e6bcd8","year":2018},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.205034Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:1d6f3aadaec181c464cfe315e5b8c6db5734ed5b335f6449c08872f978889afc","observation_id":"b42d05f7-f51c-4955-a2e2-1cbf62a10090","resolution":{"observed_at":"2026-08-06T23:27:20.220220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.203305Z","title":"A fast and accurate one-stage approach to visual grounding","venue":null,"work_id":"c52f5eff-063c-4cd1-8728-c1500407a60e","year":2019},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.209588Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:96abfa5087f956197b29c62c45ab03aa6922bc67f22833bdd5bf722ea578ef8d","observation_id":"9f7685f1-b46c-4210-9ca0-edab7be1a164","resolution":{"observed_at":"2026-08-06T23:27:20.207560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.190360Z","title":"Mdetr: Modulated detection for end-to-end multi-modal under- standing","venue":null,"work_id":"dd1d5cd9-59df-456c-888f-7e98bb36721b","year":2021},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.213891Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5118a290aaeaa864d664f75166375287c238ade5f4db88fc199f55a1c15bc20a","observation_id":"a588206f-1b12-4e05-bdeb-c69053877f28","resolution":{"observed_at":"2026-08-06T23:27:20.194646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.176466Z","title":"Detclip: Dictionary-enriched visual-concept paralleled pre-training for open-world detection","venue":null,"work_id":"fda829e9-ef15-47a8-8085-22f64afc15e0","year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.217883Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:46b1fc99d4bdc5dbbddef96f233231751a8da2e4e53bb83c81ac01e6a5cf3545","observation_id":"45b28f3a-55ae-4190-ad07-926b025c1485","resolution":{"observed_at":"2026-08-06T23:27:20.181167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.222225Z","title":"Grounded language-image pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.222225Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:018d517729f9cd98dc6dcb80439d76feba859426f66aaf85b4d41f9b8e2cc0d6","observation_id":"d3c8b111-2b48-48c6-ba44-67752411513b","resolution":{"observed_at":"2026-08-06T23:27:19.222225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.226753Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.226753Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:e8d8d951099023dc957db39b0d9ee9e5594b81304e741a69731cf8e31db2dcaa","observation_id":"18aadb9d-8643-4a34-9cc2-8673b052e883","resolution":{"observed_at":"2026-08-06T23:27:19.226753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.147357Z","title":"Phrasecut: Language- based image segmentation in the wild","venue":null,"work_id":"4e1ad604-91e7-499f-82f5-71a9c1745858","year":2020},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.230979Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:6b14dc01396a43bc9df5d7525952b6e90d0762e0138cb2c77b83040cc3f495d3","observation_id":"0827b9be-23cc-4579-8685-d2ad90942133","resolution":{"observed_at":"2026-08-06T23:27:20.151548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.134685Z","title":"Advancing referring expression segmentation beyond single image","venue":null,"work_id":"718aa3f5-e965-458b-8e22-1e1418e3d1d7","year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.235705Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:ed2cc6347740efe09522cd8f47cfb356d5704447eaa2126a4976be46b6d8a438","observation_id":"a711b74c-fd5d-4930-b514-ea8bfed4ece3","resolution":{"observed_at":"2026-08-06T23:27:20.138869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.121602Z","title":"Language as queries for referring video object segmentation","venue":null,"work_id":"5eb28ef5-35ad-44b6-8aaf-f1ae0ad3c1f5","year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.239704Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5f32f7c9383bf61a017f9728a168837d71f37c1336079c8bede9c6fd6818d351","observation_id":"a943a3ac-de6c-4415-8207-6933e1295116","resolution":{"observed_at":"2026-08-06T23:27:20.125731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T23:27:19.244352Z","title":"Kosmos-2: Grounding multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.244352Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:82236be08c7899dc7a6251da41bd88cd61b9920db7ed028875fee9d8a8086a73","observation_id":"67ce0251-1079-440a-83eb-03fc44b7c557","resolution":{"observed_at":"2026-08-06T23:27:19.244352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-06T23:27:19.249169Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.249169Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:cbb6f247289b1b18dc5af70beb2af72b3fbbbe2b974677648c5671b1926fd17f","observation_id":"89fc4323-c67c-43ff-a2a0-cf1dfbfb5186","resolution":{"observed_at":"2026-08-06T23:27:19.249169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.106096Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":"ef6b2f29-9f50-419e-b275-49c551812870","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.254479Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:698185f88826299c98a66d22b06ebdd5294418183a1a87787035194bd8513215","observation_id":"e9eb3e5b-e6f3-4f26-84dc-86866fc8b19a","resolution":{"observed_at":"2026-08-06T23:27:20.111553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08581","last_updated":"2023-07-17T15:51:47Z","snapshot_observed_at":"2026-08-16T15:15:39.618749Z","submitted_at":"2023-07-17T15:51:47Z","title":"BuboGPT: Enabling Visual Grounding in Multi-Modal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08581","snapshot_observed_at":"2026-08-06T23:27:19.259475Z","title":"Bubogpt: Enabling visual grounding in multi-modal llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.259475Z"},"links":{"cited_paper":"/paper/2307.08581","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f05a9eed00801e52360f982785f016d89d5d9fa7201dcdd0b58067bf905f2859","observation_id":"49669868-d3c4-4eed-8c4e-67a765c3624d","resolution":{"observed_at":"2026-08-06T23:27:19.259475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.264438Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.264438Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:97d26b0d0ff56b3c211eea5373ef7950d1e03ffb62d52d7123a5afd34caf1977","observation_id":"c608b4a2-7148-4b59-8f83-29cd6fb8de7a","resolution":{"observed_at":"2026-08-06T23:27:19.264438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.080762Z","title":"Gsva: Generalized segmentation via multimodal large language models","venue":null,"work_id":"4f9e5985-b141-400d-9784-52d3ddf861a1","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.268906Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:102ef7f11772c7e93621e690bcc93149b24ef88d5e8214a70a8aee5b3e9568ed","observation_id":"2df227a7-fe8c-42da-9e7c-5d795981635f","resolution":{"observed_at":"2026-08-06T23:27:20.085128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.274135Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.274135Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:34dc5cf56d514729fdd3a469db0fb76edb581b339eddd05eddfae492d614ae21","observation_id":"3d5202c9-d0da-4c77-b193-e2d61653cb87","resolution":{"observed_at":"2026-08-06T23:27:19.274135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.058857Z","title":"Pixellm: Pixel reasoning with large multimodal model","venue":null,"work_id":"bd8af02e-a018-4367-94d5-d43114182c2b","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.278494Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f31e240d1e217cbf6bfd4dee37bbf8935821f35aaf78628a08ba2fae8bb2d904","observation_id":"eac4a933-149b-4c56-8259-00a0d42a7e3a","resolution":{"observed_at":"2026-08-06T23:27:20.063536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.045415Z","title":"Ground- hog: Grounding large language models to holistic segmentation","venue":null,"work_id":"78ed46b0-80ea-422d-97d8-3fbf7ea5b30d","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.282891Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:b60734b578110d22d4ecfbca197a052c611aed68c3426eb26a3b9fd39cfbd614","observation_id":"c6ec7099-6cf0-421d-883e-b59151bb6fe6","resolution":{"observed_at":"2026-08-06T23:27:20.049650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.030928Z","title":"Woodpecker: Hallucination correction for multimodal large language models","venue":null,"work_id":"5951630b-032d-4c13-be1c-ed766217dc99","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.287227Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:e47b1190ce03f8fba703a363fe304b2337b6787577674cdb86ada18ea2184a72","observation_id":"0038e964-8c30-4998-bc21-3b7d57f2bec4","resolution":{"observed_at":"2026-08-06T23:27:20.035923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07362","last_updated":"2024-04-02T04:12:43Z","snapshot_observed_at":"2026-08-19T02:01:42.352429Z","submitted_at":"2023-11-13T14:26:24Z","title":"Volcano: Mitigating Multimodal Hallucination through Self-Feedback Guided Revision","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07362","snapshot_observed_at":"2026-08-06T23:27:19.291980Z","title":"V olcano: mitigating multimodal hallucination through self-feedback guided revision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.291980Z"},"links":{"cited_paper":"/paper/2311.07362","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:2462b848ed78692b37b989699393169a4b60e13b9559a3b1c8cf6a900d31984f","observation_id":"ffdafa19-6a83-46f6-8203-d7442500db88","resolution":{"observed_at":"2026-08-06T23:27:19.291980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:20.016046Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation","venue":null,"work_id":"480eda99-0b70-4989-a703-92d8b897b9a0","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.297724Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:cd0df1a56acf8791f93986845edd0bc71cc144f653dfeef81d3ae1fef38e5431","observation_id":"2d8a7ba5-f0f8-42b4-9f20-5a7d4346ee61","resolution":{"observed_at":"2026-08-06T23:27:20.020444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00425","last_updated":"2024-06-10T15:21:41Z","snapshot_observed_at":"2026-08-18T12:56:00.724645Z","submitted_at":"2024-03-01T10:21:52Z","title":"HALC: Object Hallucination Reduction via Adaptive Focal-Contrast Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00425","snapshot_observed_at":"2026-08-06T23:27:19.302520Z","title":"Halc: Object hallucination reduction via adaptive focal-contrast decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.302520Z"},"links":{"cited_paper":"/paper/2403.00425","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c4733a37114ee7de86d12ced99c571ba4c30bd2d9ca3610bbee0f5a3c5316183","observation_id":"8e69ed7f-7f4b-442c-afca-f7e6eafabd88","resolution":{"observed_at":"2026-08-06T23:27:19.302520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18476","last_updated":"2024-02-28T16:57:22Z","snapshot_observed_at":"2026-08-16T14:14:27.512651Z","submitted_at":"2024-02-28T16:57:22Z","title":"IBD: Alleviating Hallucinations in Large Vision-Language Models via Image-Biased Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18476","snapshot_observed_at":"2026-08-06T23:27:19.308057Z","title":"Ibd: Alleviating hallucinations in large vision-language models via image-biased decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.308057Z"},"links":{"cited_paper":"/paper/2402.18476","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5f939586056c65c39ed182dcbaa9e536682b6040cce675060850a944424edb33","observation_id":"a788739c-d432-430e-ab17-4578f08fca09","resolution":{"observed_at":"2026-08-06T23:27:19.308057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08680","last_updated":"2025-06-11T21:33:21Z","snapshot_observed_at":"2026-08-16T14:18:52.863427Z","submitted_at":"2024-02-13T18:59:05Z","title":"Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08680","snapshot_observed_at":"2026-08-06T23:27:19.313207Z","title":"Mitigating object hallucination in large vision-language models via classifier-free guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.313207Z"},"links":{"cited_paper":"/paper/2402.08680","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:cff547cea37f81cc09e935ab52789d3ad3fa418a7e776820bb89f6d274f94e30","observation_id":"26c07d63-eb7f-4cfe-b766-28ba79cd7a93","resolution":{"observed_at":"2026-08-06T23:27:19.313207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15300","last_updated":"2024-04-23T09:32:25Z","snapshot_observed_at":"2026-08-18T09:54:15.367447Z","submitted_at":"2024-02-23T12:57:16Z","title":"Seeing is Believing: Mitigating Hallucination in Large Vision-Language Models via CLIP-Guided Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15300","snapshot_observed_at":"2026-08-06T23:27:19.317381Z","title":"Seeing is believing: Mitigating hallucination in large vision-language models via clip-guided decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.317381Z"},"links":{"cited_paper":"/paper/2402.15300","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:b4b87e198aa0d0bbceefcbbe0eeb91cac87b4dccc25e753c2e3a6ced78d55412","observation_id":"941699a5-a68d-4549-b759-f20cd207bae8","resolution":{"observed_at":"2026-08-06T23:27:19.317381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11779","last_updated":"2025-02-23T15:14:47Z","snapshot_observed_at":"2026-08-16T13:09:06.765616Z","submitted_at":"2024-10-15T16:57:44Z","title":"MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11779","snapshot_observed_at":"2026-08-06T23:27:19.322266Z","title":"Mllm can see? dynamic correction decoding for hallucination mitigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.322266Z"},"links":{"cited_paper":"/paper/2410.11779","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:6add729ab0e1cd77636a8e2276ab8f8d1659a773cafabb2aed581d19653d0945","observation_id":"a0289201-04d8-4b11-abd7-52c0fd50dc5c","resolution":{"observed_at":"2026-08-06T23:27:19.322266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T23:41:03.981699Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T23:27:19.327237Z","title":"Mitigat- ing hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.327237Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:cb7ecb92923cd5a5e01b0480e108cf76abe60024e254883c0d33a59ff0fd7d78","observation_id":"83809ade-bc12-4f4c-a9f3-9d932fe0c3fa","resolution":{"observed_at":"2026-08-06T23:27:19.327237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.331587Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.331587Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:06afc3b3cee9571db3ac92e928cd8bd42575f0e9b8efc80b552fb1735b970a7a","observation_id":"9266776b-4b02-4827-9325-d3ce05895f3b","resolution":{"observed_at":"2026-08-06T23:27:19.331587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.994630Z","title":"Mitigating fine-grained hallucination by fine-tuning large vision-language models with caption rewrites","venue":null,"work_id":"01f93e2e-3070-4fb5-b12d-1d854337360d","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.335920Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:cc8252328f5dfea42ad031efcdad5255c0c22525911955893175e895258bd206","observation_id":"44f50dc7-c9ee-46c5-a2bb-9acd531102e8","resolution":{"observed_at":"2026-08-06T23:27:19.998872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14545","last_updated":"2024-05-29T05:55:09Z","snapshot_observed_at":"2026-08-16T14:16:15.314341Z","submitted_at":"2024-02-22T13:33:13Z","title":"Less is More: Mitigating Multimodal Hallucination from an EOS Decision Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14545","snapshot_observed_at":"2026-08-06T23:27:19.340811Z","title":"Less is more: Mitigating multimodal hallucination from an eos decision perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.340811Z"},"links":{"cited_paper":"/paper/2402.14545","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:f7699059886bb8b223e6707022bd78bda91d2aeaa18b89e650760432baa78ceb","observation_id":"5a4157b9-c626-4e58-ae53-43ce1a26264a","resolution":{"observed_at":"2026-08-06T23:27:19.340811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16839","last_updated":"2024-02-06T16:43:31Z","snapshot_observed_at":"2026-08-16T19:33:05.632918Z","submitted_at":"2023-11-28T14:54:37Z","title":"Beyond Hallucinations: Enhancing LVLMs through Hallucination-Aware Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16839","snapshot_observed_at":"2026-08-06T23:27:19.345738Z","title":"Beyond hallucinations: Enhancing lvlms through hallucination-aware direct preference optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.345738Z"},"links":{"cited_paper":"/paper/2311.16839","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:908a0aba9f7bd8a43829d63d3815ee617ac602451c2d1fcf4969eda0cba79b69","observation_id":"a79bad53-b962-41ef-921b-072ee2ab4e2b","resolution":{"observed_at":"2026-08-06T23:27:19.345738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10665","last_updated":"2023-12-17T09:44:27Z","snapshot_observed_at":"2026-08-16T14:34:02.863082Z","submitted_at":"2023-12-17T09:44:27Z","title":"Silkie: Preference Distillation for Large Visual Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10665","snapshot_observed_at":"2026-08-06T23:27:19.350818Z","title":"Silkie: Preference distillation for large visual language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.350818Z"},"links":{"cited_paper":"/paper/2312.10665","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5557d2796af336d4c0e2cc061aa23213c28fc22c3c02fbb443dabb4bc5710420","observation_id":"c32024ec-ed48-4892-8f1a-7e24be6b056e","resolution":{"observed_at":"2026-08-06T23:27:19.350818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.980934Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":"f60cd4b2-3273-4b2f-a144-bef117b78daa","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.355853Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:eda7d55f1a0f22963c6e00c0a3fa8773b8bddd4d273c20e304c131f1582818ac","observation_id":"2e1ece5e-0ad4-4f77-827f-bbcf6daad7bb","resolution":{"observed_at":"2026-08-06T23:27:19.985299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-08-15T23:42:34.277075Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-06T23:27:19.360031Z","title":"Aligning large multimodal models with factually augmented rlhf","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.360031Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:e1964f0777db5575bda7f991a0892009633ec3f890cd6372bc13c6d8e5f9338d","observation_id":"73579177-224d-48bb-b450-acc716d508dc","resolution":{"observed_at":"2026-08-06T23:27:19.360031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-11T00:52:12.225793Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-06T23:27:19.364377Z","title":"Mul- timodal chain-of-thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.364377Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c3e8fb8c78b0d876f9bd1cf6bb8e85924fc0bc3d3e978fbd0f4051f6ccb27a5b","observation_id":"df92342c-82be-4b17-ab21-c721e7ac7c18","resolution":{"observed_at":"2026-08-06T23:27:19.364377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.368667Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.368667Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5eadd9c7f0a55d56a5f92d2e4bd43e1a77e2e698b96420eb467fe7b31078b616","observation_id":"270c8a6e-257e-4f8a-88e7-8247fbfbe69f","resolution":{"observed_at":"2026-08-06T23:27:19.368667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.373049Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.373049Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:a76bc3c0bb13d76d2325f2b5c9f83c3c4d364c46a89c3aba4c6de5a723f4b912","observation_id":"a16614ee-0a09-4571-a35c-29ce190a0800","resolution":{"observed_at":"2026-08-06T23:27:19.373049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T23:27:19.377682Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.377682Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:13ca5c92b4665c696a591c32ea1aff260ad56b8aa5a439c1cad938ba5e5748b7","observation_id":"6087d896-7570-4182-b910-32cb740d880a","resolution":{"observed_at":"2026-08-06T23:27:19.377682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.949034Z","title":"Haloquest: A visual hallucination dataset for advancing multimodal reasoning","venue":null,"work_id":"d2cef9d3-35ce-42c3-b27b-38db7ed0a69c","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.381749Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:927a6414776bbdde981bbc7f203262a7f67b29f9bbee2c75b9134be708b20f07","observation_id":"721e8b60-a827-4b75-bf89-3337f723d851","resolution":{"observed_at":"2026-08-06T23:27:19.954610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T23:27:19.385833Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.385833Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:c39434ebc8d2d6d24f92914ad3ed0a6e284eba8c3617e9ed50c9a0525aab09df","observation_id":"8cc0add7-bea0-48fe-baad-d63090dd7ee1","resolution":{"observed_at":"2026-08-06T23:27:19.385833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.390047Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.390047Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:fc6066a3902eb3d6b1872d7af338ddde35d18d5ab90f54df0a0786736403a6d6","observation_id":"c82111ec-6b2e-4b60-9ff0-465307f7a97b","resolution":{"observed_at":"2026-08-06T23:27:19.390047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.395003Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.395003Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:d2e007b00608a454be3fd67e400a14e0a816772cf950ce73712d6030f0b3bc77","observation_id":"9220180b-39ae-4622-aa9e-460ed9cef1f2","resolution":{"observed_at":"2026-08-06T23:27:19.395003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.918114Z","title":"A survey of multimodel large language models","venue":null,"work_id":"61e191b9-e91d-4946-be81-9ef5c4248af3","year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.399460Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:1aca1e0090ba330de17c9f49265892e17873d20babf7d5c8b347630674994a81","observation_id":"4ca48f0e-6a07-4bc5-ad2c-1bd431309bfb","resolution":{"observed_at":"2026-08-06T23:27:19.923518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.403801Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.403801Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:6da8f0c116cedf94e996a399daac398704209c86da546f91863f8ab81b297107","observation_id":"be649093-e7c6-4ac7-bd39-c3a49928230a","resolution":{"observed_at":"2026-08-06T23:27:19.403801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14141","last_updated":"2024-03-21T05:36:25Z","snapshot_observed_at":"2026-08-16T14:07:48.610653Z","submitted_at":"2024-03-21T05:36:25Z","title":"Empowering Segmentation Ability to Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14141","snapshot_observed_at":"2026-08-06T23:27:19.407889Z","title":"Empowering segmentation ability to multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.407889Z"},"links":{"cited_paper":"/paper/2403.14141","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:29e8e77e4b18f79267083caff4be9f1948f48aeef8807dea054e748e04061a49","observation_id":"517d6065-62a0-40aa-91b7-816888cdbd26","resolution":{"observed_at":"2026-08-06T23:27:19.407889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-06T23:27:19.413192Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.413192Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:3c255aec26601a1c5f10eff2cf9b4afbdfa69c30452bcd51013818018953d9e0","observation_id":"5d59454f-1ad6-49e5-9138-13c7cecfad0e","resolution":{"observed_at":"2026-08-06T23:27:19.413192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-08-12T17:07:18.793418Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-06T23:27:19.418235Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.418235Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:5bf369d810cd7bdf15879df6da6fe695206a003dd9c16cdc5e9aff204b4c6932","observation_id":"e0cc1135-b213-4530-bd64-d317a063904d","resolution":{"observed_at":"2026-08-06T23:27:19.418235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:27:19.893339Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":"3c959beb-e359-4357-9da0-939dc074940c","year":2025},"citing_paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:19.422402Z"},"links":{"citing_paper":"/paper/2506.17901"},"observation_digest":"sha256:400950723f06073a8d6ff7c742d2659e16de5d2f38bb1cdebb00c6adf653b350","observation_id":"b6a2fb75-2e9a-4ac6-b8cc-131aba5b33ac","resolution":{"observed_at":"2026-08-06T23:27:19.899780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17901","last_updated":"2025-06-22T05:11:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T04:19:09.681652Z","submitted_at":"2025-06-22T05:11:46Z","title":"PostAlign: Multimodal Grounding as a Corrective Lens for MLLMs"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2506.17901."}