{"as_of":"2026-08-09T19:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b49ea3fe45a14619b1549ab2017ea969ab2f0bcd10711750eba341a05851521c","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T19:17:00.316424Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28055/citation-record","integrity":"/paper/2607.28055/integrity","json":"/paper/2607.28055/citation-record.json","paper":"/paper/2607.28055"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:56.775817Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:56.775817Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:b0f19573de9a1a467d8aa1377cbe4dbb3dcbd77413af2adee6cdea09b499018a","observation_id":"c096f139-c23d-47ca-9b35-95cffd21e711","resolution":{"observed_at":"2026-07-31T19:16:56.775817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:56.891967Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:56.891967Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:dca6682f03f39743fece11b1a063988cbc7d1203c55f3e2d30db5d173d0a3d71","observation_id":"22a05806-9a3c-4796-87a9-5821d70dfe8c","resolution":{"observed_at":"2026-07-31T19:16:56.891967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:57.338909Z","title":"Proceedings of the 48th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:57.338909Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:c59546026a6d2c053d0407a73960d5d93fa0a385a172353af4127ff70ea9b0d6","observation_id":"0395c142-2b20-4767-b957-0239cc6d37d8","resolution":{"observed_at":"2026-07-31T19:16:57.338909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:57.415565Z","title":"2024 , journal =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:57.415565Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:d805dbe2dbe90edb81beb5fed30d0b4044baed6b404e7b6619d652d90486c881","observation_id":"0b9deee8-e7dc-41d6-9fe9-b5af87a22e3e","resolution":{"observed_at":"2026-07-31T19:16:57.415565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:57.506538Z","title":"2024 , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:57.506538Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:a9bd5a540121dfe845939da7e30fe5910363c7e05ba95af330d9b23e72af2f63","observation_id":"4f09eb41-3ad5-4beb-89f7-c7795a48d0be","resolution":{"observed_at":"2026-07-31T19:16:57.506538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:57.593970Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:57.593970Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:2da4513a6e643d7e5949ed1a8f436985aa34ee3cdb1c799a4cd7e8d5508f7817","observation_id":"138422c9-7de1-43be-bcea-b8dfd2889fe9","resolution":{"observed_at":"2026-07-31T19:16:57.593970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:57.740655Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:57.740655Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:c2c5a77169394c278c4d009b105ecceefd4b10da4e2a6b0f02db177ffa294c5e","observation_id":"61ee72b4-9727-452d-a5e5-213317a5dc66","resolution":{"observed_at":"2026-07-31T19:16:57.740655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:57.774833Z","title":"National Science Review , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:57.774833Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:4712905c59e5980b8d609f134e8224556036e4183c588ed6f64c5a7db851762b","observation_id":"53e04150-065d-488f-b00b-0230e6017d6b","resolution":{"observed_at":"2026-07-31T19:16:57.774833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:57.963506Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:57.963506Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:93fa93adb2d4c7a81912ed381ce1620ff7ea2e2a0f24efbf43f8d51de0a24cd1","observation_id":"b88dd505-38d5-420d-ad7e-6beaea877f20","resolution":{"observed_at":"2026-07-31T19:16:57.963506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.008905Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.008905Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:b0cc38a79b0a582f52398e252ae50d77a7166e1899d1ed724d0dc10b9f0d66b6","observation_id":"000f114a-173d-4f29-b0bf-7c577071d20b","resolution":{"observed_at":"2026-07-31T19:16:58.008905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.135379Z","title":"arXiv preprint arXiv:2509.13642 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.135379Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:9709e1c031990fbd1be89e17b21b0c79f9d67b0a91aaffdf25c30643eb850129","observation_id":"37523ead-59e7-4707-9882-03eb28d41408","resolution":{"observed_at":"2026-07-31T19:16:58.135379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.212979Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.212979Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:ef93479fe3d9957e460b3cc296ce55919255d76ba2b5ba5281f4bd4ef3853ae6","observation_id":"fa0985b6-2d01-4a88-a472-553291838814","resolution":{"observed_at":"2026-07-31T19:16:58.212979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.253017Z","title":"Forty-first International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.253017Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:a1731db1d862ccf4ee0acf3ebf65b8ccd95978851c161ee333edf52caee8011b","observation_id":"52378bf2-8123-40bb-9900-bb9945efb2d8","resolution":{"observed_at":"2026-07-31T19:16:58.253017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.306528Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.306528Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:334af452c453d02c05137d5382e05385edc53bdbf5f1d4d3f398b26e8fb86c01","observation_id":"1e49da34-f1bc-4d07-bd54-ecfa3e4f5377","resolution":{"observed_at":"2026-07-31T19:16:58.306528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.345060Z","title":"Proceedings of the 31st International Conference on Computational Linguistics: System Demonstrations , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.345060Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:bf2b8d56aaae02be39b974cf45b864069632056e3ac50a56ccf7d1579916ee4a","observation_id":"59120bf5-2f7d-405f-bbda-47d0613b1759","resolution":{"observed_at":"2026-07-31T19:16:58.345060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.453035Z","title":"Findings of the Association for Computational Linguistics: ACL 2024 , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.453035Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:2ca9e901ee076755c894f9380eadcda4a4afe79fa92f8e6446737a5b30bf5c1e","observation_id":"dcdcc31e-2433-493c-aa75-14631f6bab4d","resolution":{"observed_at":"2026-07-31T19:16:58.453035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-07-31T19:16:58.483265Z","title":"arXiv preprint arXiv:2309.15112 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.483265Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:16a54735c7c991f53b7285889a2437e028b24c3815ea9395965898b88cb2c03f","observation_id":"edcfe875-9729-4fd4-b2a6-521312c36c1c","resolution":{"observed_at":"2026-07-31T19:16:58.483265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-31T19:16:58.520210Z","title":"arXiv preprint arXiv:2401.10208 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.520210Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:061acc7610cd338540bd81c2e3e57c48b7b8aa311f699ac96098937852e6e4c6","observation_id":"6bdf76df-c86b-47da-a336-704c311ec056","resolution":{"observed_at":"2026-07-31T19:16:58.520210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.658049Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.658049Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:44ada22392ba58fa37daf19667eeafb67e9ab41fccc3c24b6bcae03279df987d","observation_id":"83ff10fb-f006-40e0-875a-4d62292f040b","resolution":{"observed_at":"2026-07-31T19:16:58.658049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.688078Z","title":"2024 , eprint=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.688078Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:c81161f61f83e22a317eff9ebc0a0ca4cab8bf697000caa562a713cb3e85a6f4","observation_id":"a2e5d839-9845-43d3-9aa6-8410d00adc8b","resolution":{"observed_at":"2026-07-31T19:16:58.688078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.708026Z","title":"Proceedings of the 62nd Annual Meeting of the Association for Computational Linguistics (Volume 3: System Demonstrations) , address=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.708026Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:41301e1cc8fb3005859f1e23425dd582e7ea11cba4f6210f15d7e75894a920d9","observation_id":"d9426ec8-12c8-4931-9263-71829781402b","resolution":{"observed_at":"2026-07-31T19:16:58.708026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.748236Z","title":"OpenAI Blog , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.748236Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:49b513285e852aea87886580b08e7a0f8cb85cb00f866427585ab22cf0a1153a","observation_id":"26e6b8ce-a6f3-4e8f-b2b9-10befcb85588","resolution":{"observed_at":"2026-07-31T19:16:58.748236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-31T19:16:58.796948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.796948Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:e9721d7aeb964314a15f4e427ee4611aa6ee84cda76b65e1164cca0b63df4a42","observation_id":"0c812587-cf25-41aa-ae14-f68990e576ec","resolution":{"observed_at":"2026-07-31T19:16:58.796948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:58.826579Z","title":"D.; Dhariwal, P.; Neelakantan, A.; Shyam, P.; Sastry, G.; Askell, A.; et al","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.826579Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:9de96fddd55ff8584fa4d891e2ef917a214bf56209f91348b31288d063593e69","observation_id":"34469902-d321-4f73-9a99-4a1bb85ac6f0","resolution":{"observed_at":"2026-07-31T19:16:58.826579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03216","last_updated":"2025-12-12T11:26:32Z","snapshot_observed_at":"2026-07-06T17:25:35.493362Z","submitted_at":"2024-02-05T17:26:49Z","title":"M3-Embedding: Multi-Linguality, Multi-Functionality, Multi-Granularity Text Embeddings Through Self-Knowledge Distillation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03216","snapshot_observed_at":"2026-07-31T19:16:58.876199Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.876199Z"},"links":{"cited_paper":"/paper/2402.03216","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:f646af0e128b228628f296cb2b71f0c8885cad3bd830afd211116491344224b7","observation_id":"e871082c-c93d-4a5b-874d-6337dfc7e90f","resolution":{"observed_at":"2026-07-31T19:16:58.876199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-31T19:16:58.927588Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.927588Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:622ad0ece9fb637b7afd27671bbab807156622fde669906decfe728253a56306","observation_id":"5eab63c7-ad33-46e5-9c9d-c1c020f5199f","resolution":{"observed_at":"2026-07-31T19:16:58.927588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-09T05:47:14.092221Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-07-31T19:16:58.978808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:58.978808Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:54b1b39edfa2649800858a2cf704281227d5852695bc15ad1e37e3614c6398c2","observation_id":"114e8193-2dd6-4389-9d07-a0d85a9da3be","resolution":{"observed_at":"2026-07-31T19:16:58.978808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-31T19:16:59.027434Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.027434Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:44d7634a9ae57098b0a3798e718049aa718ba488c20239e9256b19b1393f762f","observation_id":"cd62ef74-e2a0-4623-a546-2f506cdce25b","resolution":{"observed_at":"2026-07-31T19:16:59.027434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.051843Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.051843Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:d8f2ed3f7046f45cc3d8a5044faae632ab624ded8ea068e796711bf8b71af64f","observation_id":"4a2a9741-9fd8-4db2-87cf-af730c25bae8","resolution":{"observed_at":"2026-07-31T19:16:59.051843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-31T19:16:59.098579Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.098579Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:1e5c45cb92b4e15845c39ac3007c828c490bb0874a6e6de9ec6b9231b5d4134b","observation_id":"dc214723-7ec6-49ee-a5de-087d0c9a9b36","resolution":{"observed_at":"2026-07-31T19:16:59.098579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-07-31T19:16:59.168428Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.168428Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:3543c93a87e21f38855ea30074eb12ddda0bb88100dcd3acc601ff2779cd1091","observation_id":"2aa60c3c-684b-41e1-90c0-3a82cb06cd8d","resolution":{"observed_at":"2026-07-31T19:16:59.168428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.222344Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.222344Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:388417b22d34bd44484e12d1b09a1067e99d6559feffc251a9d58a9306d25f7e","observation_id":"122b934e-4d6e-4fa2-8fa3-8de2d76a3879","resolution":{"observed_at":"2026-07-31T19:16:59.222344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-31T19:16:59.270450Z","title":"P.; Perelman, A.; Ramesh, A.; Clark, A.; Ostrow, A.; Welihinda, A.; Hayes, A.; Radford, A.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.270450Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:1b27144dd3e72e1d56e9350f71d4cf73188098ea3f9afd3c7d1513b00ba2074c","observation_id":"bed9a3d4-3861-447b-b110-72be9afd43ac","resolution":{"observed_at":"2026-07-31T19:16:59.270450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-31T19:16:59.286736Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.286736Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:fe81325b322b5866f0f7f49f20d58b7c3ca5ea4040ee3960365ea8f32811aab5","observation_id":"6f04a1b0-3c9b-45f6-b241-ac1196be2fb7","resolution":{"observed_at":"2026-07-31T19:16:59.286736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09516","last_updated":"2025-08-05T19:08:38Z","snapshot_observed_at":"2026-07-06T20:51:28.022519Z","submitted_at":"2025-03-12T16:26:39Z","title":"Search-R1: Training LLMs to Reason and Leverage Search Engines with Reinforcement Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09516","snapshot_observed_at":"2026-07-31T19:16:59.311573Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.311573Z"},"links":{"cited_paper":"/paper/2503.09516","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:aed055cb251fcf2799465440cf7fa8043ba403efcfe7d5df8490f279cb2afd8e","observation_id":"bc9ece4d-b79f-478d-b9b7-90855a836d6a","resolution":{"observed_at":"2026-07-31T19:16:59.311573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.341240Z","title":"Y.; Fried, D.; and Salakhutdinov, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.341240Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:d2ae5c2fdbd74b75760a9c68827f8a04605f709ee9e48b6326fc45e5274f1398","observation_id":"8282f36b-bdaf-4bfa-9f0c-a38638468346","resolution":{"observed_at":"2026-07-31T19:16:59.341240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-31T19:16:59.387677Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.387677Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:c4dccc848883c8765c01ef17fc12d7122fbe97b7456cf1fca8aca3e81536fa25","observation_id":"dc82121e-7ac8-46b8-9112-f3bf904e5741","resolution":{"observed_at":"2026-07-31T19:16:59.387677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16365","last_updated":"2025-05-23T14:05:39Z","snapshot_observed_at":"2026-08-03T03:27:56.520381Z","submitted_at":"2024-11-25T13:20:19Z","title":"Multi-modal Retrieval Augmented Multi-modal Generation: Datasets, Evaluation Metrics and Strong Baselines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16365","snapshot_observed_at":"2026-07-31T19:16:59.415912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.415912Z"},"links":{"cited_paper":"/paper/2411.16365","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:9f9351cf479ff16ca6b12d09bb70aeed1c23eb41d81dbb9775aa2ccddc958195","observation_id":"d0c29815-e7a5-43b0-8928-f93c760ef92b","resolution":{"observed_at":"2026-07-31T19:16:59.415912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.450694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.450694Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:e4fba4ffefb3995ce43b1967649db254cc13e4d7283ba70b5b8627d3fdbd13bd","observation_id":"a49d75af-093d-44f2-8001-2411cfeaac42","resolution":{"observed_at":"2026-07-31T19:16:59.450694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.513216Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.513216Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:31cbb4e54ca148153c564403d21eef11723a3943ab7aded35da5e8ebdbd927ff","observation_id":"5d184895-fb49-4403-a034-a8067c2f0fec","resolution":{"observed_at":"2026-07-31T19:16:59.513216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-07-31T19:16:59.572564Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.572564Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:8ed786306dd0823d738d35a65d76a1c695722b2ac52bdc6c4f441b30979f94fb","observation_id":"f80fbf11-0e8a-468a-95f0-fe84bfa8630c","resolution":{"observed_at":"2026-07-31T19:16:59.572564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-07-31T19:16:59.602456Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.602456Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:0c9ffc88b1d3eed57eecc263d5ec818cfd784ce05383e0d9ecd267232c5fd2ff","observation_id":"d2548c00-91b6-498e-a399-ae7eb2d2fcb2","resolution":{"observed_at":"2026-07-31T19:16:59.602456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.661015Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.661015Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:5cf76d68cdb51d879cdf0a0bd07eecc9746103cc4aa3bf6326a15a0a056ee810","observation_id":"98b7b20b-421a-4b45-ba80-20dd941038c5","resolution":{"observed_at":"2026-07-31T19:16:59.661015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05592","last_updated":"2025-03-18T08:32:24Z","snapshot_observed_at":"2026-08-09T05:07:17.305244Z","submitted_at":"2025-03-07T17:14:44Z","title":"R1-Searcher: Incentivizing the Search Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05592","snapshot_observed_at":"2026-07-31T19:16:59.690976Z","title":"X.; Fang, L.; and Wen, J.-R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.690976Z"},"links":{"cited_paper":"/paper/2503.05592","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:5d121d71fff8055b63357f3d464eb7677fa674dc10dd9d08a59c89572b7eaefe","observation_id":"12a6872a-ce64-44fb-a1e6-40d4a9fc45bb","resolution":{"observed_at":"2026-07-31T19:16:59.690976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-07-31T19:16:59.718709Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.718709Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:4f3a5a76867bcc9251312781a3a5d31041177006b57c796dde5779b7fc549e61","observation_id":"9160e200-9618-4573-b751-3ff4ee117d1b","resolution":{"observed_at":"2026-07-31T19:16:59.718709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.778117Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.778117Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:333e79869abfe994a8cc8d35a0cb545f74826458c80fffda094269415ead9524","observation_id":"7a091575-739a-4049-9d9c-d59a4cf4e5b8","resolution":{"observed_at":"2026-07-31T19:16:59.778117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18869","last_updated":"2024-09-27T16:06:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T16:06:11Z","title":"Emu3: Next-Token Prediction is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18869","snapshot_observed_at":"2026-07-31T19:16:59.829124Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.829124Z"},"links":{"cited_paper":"/paper/2409.18869","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:245b854e1decf833fe30d7bd8d87cab729564e187d3ac5e535108b3901b23f0b","observation_id":"e7da3174-0c87-4419-88f6-e8932f12f212","resolution":{"observed_at":"2026-07-31T19:16:59.829124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.20670","last_updated":"2025-06-25T17:59:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-25T17:59:42Z","title":"MMSearch-R1: Incentivizing LMMs to Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20670","snapshot_observed_at":"2026-07-31T19:16:59.859725Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.859725Z"},"links":{"cited_paper":"/paper/2506.20670","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:91af5fd9bce41a05aeecc14e2ce32b5d16123ee18380acb358bfc19a0e3d4f39","observation_id":"5baf118b-e99b-4f23-9cf4-4312e2ea67a0","resolution":{"observed_at":"2026-07-31T19:16:59.859725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.889048Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.889048Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:3b4c2b6db1c2ca58c533c92e066dfaacf6a3913d6d3abd6f2c497d2128935512","observation_id":"4fb94c48-7878-4701-baa5-5af8bed9f455","resolution":{"observed_at":"2026-07-31T19:16:59.889048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06328","last_updated":"2025-08-08T14:00:19Z","snapshot_observed_at":"2026-08-07T04:03:29.651506Z","submitted_at":"2025-08-08T14:00:19Z","title":"M2IO-R1: An Efficient RL-Enhanced Reasoning Framework for Multimodal Retrieval Augmented Multimodal Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06328","snapshot_observed_at":"2026-07-31T19:16:59.955507Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.955507Z"},"links":{"cited_paper":"/paper/2508.06328","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:325023228807aea285d7f78c0612b7bb1cdf9dfc314e3daf3e61625d05c30652","observation_id":"dc9f4070-00c3-4a44-b032-cd62d2a31c2c","resolution":{"observed_at":"2026-07-31T19:16:59.955507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:16:59.984148Z","title":"J.; Wang, W.; Lin, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-31T19:16:59.984148Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:977bd6aaa8f6ce1f5f6fdbfcdcaae4d60a5090af7258a72d55e311efef3deea0","observation_id":"c14c566a-94ce-444d-88a7-5df692b0507a","resolution":{"observed_at":"2026-07-31T19:16:59.984148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03629","last_updated":"2023-03-10T01:00:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-06T01:00:32Z","title":"ReAct: Synergizing Reasoning and Acting in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03629","snapshot_observed_at":"2026-07-31T19:17:00.035691Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-31T19:17:00.035691Z"},"links":{"cited_paper":"/paper/2210.03629","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:f9463dc51228fc6fa6b809758784ada83ce21c1c604a7d33d4293dbd2cfb43fa","observation_id":"3d4b3941-3eaf-404f-a94d-d4042f696652","resolution":{"observed_at":"2026-07-31T19:17:00.035691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:17:00.068621Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-31T19:17:00.068621Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:dcb3b00e3e303080ee66f70956058b7f3fce9d9955e5fc33e8d2fb8f9c694815","observation_id":"81f04118-ae6f-42c3-9815-5cd799cbd871","resolution":{"observed_at":"2026-07-31T19:17:00.068621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:17:00.131007Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-07-31T19:17:00.131007Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:53708a83b394a013fb957f47d9764f0cb121979238b43982c82a314133502b5f","observation_id":"c58e4d7c-0664-4683-b7a6-e884cfb7f7d7","resolution":{"observed_at":"2026-07-31T19:17:00.131007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:17:00.193074Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-07-31T19:17:00.193074Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:e4d2ac020af04b94ce2b21750ed42848360e21c0e7a83aea9b6b90f7417f0d16","observation_id":"36536853-9161-436d-95b2-d25b64360a36","resolution":{"observed_at":"2026-07-31T19:17:00.193074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:17:00.249399Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-07-31T19:17:00.249399Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:0c1ee4305ab799d57789b65c24599bc85601cc02a316ef5de17818e4de0ca37d","observation_id":"9cd0a76f-190e-4e05-8ed0-51735f282a91","resolution":{"observed_at":"2026-07-31T19:17:00.249399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14475","last_updated":"2024-12-19T02:49:55Z","snapshot_observed_at":"2026-08-06T11:46:20.152196Z","submitted_at":"2024-12-19T02:49:55Z","title":"MegaPairs: Massive Data Synthesis For Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14475","snapshot_observed_at":"2026-07-31T19:17:00.310323Z","title":"J.; Lian, D.; and Xiong, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-07-31T19:17:00.310323Z"},"links":{"cited_paper":"/paper/2412.14475","citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:055365986453b480f7c59af448b0e296598ec6d1346b843cc69d3255bfb90d14","observation_id":"e53ef929-4874-470e-85a3-9a1a25468bc8","resolution":{"observed_at":"2026-07-31T19:17:00.310323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T19:17:00.316424Z","title":"S.; Feujio, L.; Maharaj, A.; and Li, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-07-31T19:17:00.316424Z"},"links":{"citing_paper":"/paper/2607.28055"},"observation_digest":"sha256:4080dda20ac4058edd230758e6b00ab7199083e5fa0ab598d1a51622aafa848b","observation_id":"b4782604-f1e8-42ac-b89a-a5937a7def64","resolution":{"observed_at":"2026-07-31T19:17:00.316424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28055","last_updated":"2026-07-30T11:34:55Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-05T20:01:13.896714Z","submitted_at":"2026-07-30T11:34:55Z","title":"VIG-RL: Learning to Search and Insert for Verified Image Grounding"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2607.28055."}