{"as_of":"2026-08-09T11:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21dc9fffd80b3692ff209053946bf57e71276db1af5a157729dafa59368356d4","coverage":[{"denominator":99,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":99,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T05:54:16.148845Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.08254/citation-record","integrity":"/paper/2502.08254/integrity","json":"/paper/2502.08254/citation-record.json","paper":"/paper/2502.08254"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-08T05:54:15.808010Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.808010Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:ac634fbc0239fb576ae91051db487fd999a9df9020b068abce8dc3eedd38f1eb","observation_id":"38d6ddc2-c253-4ba6-a33a-97550b330624","resolution":{"observed_at":"2026-08-08T05:54:15.808010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.812393Z","title":"Learning attribute representations with local- ization for flexible fashion search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.812393Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6eca88f4284d4f832d4c57e6935b6a64322b9108e6408e1305847acd1a438bf3","observation_id":"c558e5bf-2f8e-45f7-b00a-23bdc8214473","resolution":{"observed_at":"2026-08-08T05:54:15.812393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.815852Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.815852Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e3f10e2c3edc3ff1a89003b5c38a3b002854fac344501854f34f99deb537e4de","observation_id":"2a2b8b81-bc1c-4b50-9095-641d36a52911","resolution":{"observed_at":"2026-08-08T05:54:15.815852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.819291Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.819291Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:356e80e39a497974d5ef1dbbfc0f697a1fe637b10ca5c06b0cfc71ba3eb3788a","observation_id":"b52e3554-78f2-4aa7-a5e2-19a3cc08e183","resolution":{"observed_at":"2026-08-08T05:54:15.819291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.822811Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.822811Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d961c5697644443435097b9994c0c9b7f0cb08249181477b5daf8f5e84bdce23","observation_id":"992f8b97-ed79-42cf-be80-18f80ad192f2","resolution":{"observed_at":"2026-08-08T05:54:15.822811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.826342Z","title":"Effective conditioned and composed im- age retrieval combining clip-based features","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.826342Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5a4fc8de92b9deb124c213bf256926767675c68c77168c5c45e39bbffffa2e67","observation_id":"d9590b7f-e4e7-4517-aa01-fb2b35046b20","resolution":{"observed_at":"2026-08-08T05:54:15.826342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.829572Z","title":"Zero-shot composed image retrieval with textual inversion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.829572Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:f76a7919681c3b8bb27cc376f8911d5c1ba750e6e078a94e4e6d914e751d1767","observation_id":"8034d24e-c299-4e48-9ba7-8187cac9e97b","resolution":{"observed_at":"2026-08-08T05:54:15.829572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.833054Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.833054Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d571582e9dcb0b199780c69fe7da9b86ecb24f6c5c2fc56910990be8d8d04152","observation_id":"c2c2326d-a5c4-4552-bb9f-fcde8a26abd2","resolution":{"observed_at":"2026-08-08T05:54:15.833054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.836907Z","title":"Tomayto, tomahto","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.836907Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:102169d6863ed44155ac8aedb507bb769da227f273818329de1b20ee4ecf1f8d","observation_id":"06e54353-c76a-4c4a-a521-e9f159eade34","resolution":{"observed_at":"2026-08-08T05:54:15.836907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03668","last_updated":"2023-10-20T13:18:06Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T16:38:05Z","title":"A Suite of Generative Tasks for Multi-Level Multimodal Webpage Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03668","snapshot_observed_at":"2026-08-08T05:54:15.840236Z","title":"A suite of generative tasks for multi- level multimodal webpage understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.840236Z"},"links":{"cited_paper":"/paper/2305.03668","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:9bf1c43412e7f1123280028ea63b3363b8bdc904b16219594c331c981d4220f9","observation_id":"d4a09c30-4cdf-40c6-a317-5863e240dfcf","resolution":{"observed_at":"2026-08-08T05:54:15.840236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.843793Z","title":"Plummer, Kate Saenko, Jianmo Ni, and Mandy Guo","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.843793Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:0e55d8381c24533ef20d8257f07e75a2254fa232e3f964a704ae23dafb3331d0","observation_id":"bbd4ef3c-0289-4215-9ebd-abf83f7d2828","resolution":{"observed_at":"2026-08-08T05:54:15.843793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.847113Z","title":"Wiki-llava: Hierarchical retrieval-augmented gener- ation for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.847113Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:9e5201abcb69aed73a621630fb65d6ff0a93d04120784183b1f2e7ce99a2e8fa","observation_id":"a669727d-692c-4509-ba45-bcbbc5839f3d","resolution":{"observed_at":"2026-08-08T05:54:15.847113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02928","last_updated":"2022-10-20T17:16:27Z","snapshot_observed_at":"2026-08-06T23:46:49.824788Z","submitted_at":"2022-10-06T13:58:03Z","title":"MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02928","snapshot_observed_at":"2026-08-08T05:54:15.850481Z","title":"Murag: Multimodal retrieval-augmented generator for open question answering over images and text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.850481Z"},"links":{"cited_paper":"/paper/2210.02928","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:8ab5685a24e4c85b34255a635cba6218faff104abdc3c0a69afdfd475c998779","observation_id":"9a0755fe-5633-45ce-a0dc-c5be88c1260e","resolution":{"observed_at":"2026-08-08T05:54:15.850481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-07-06T16:32:37.715900Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-08T05:54:15.853944Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.853944Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:87bdf61f9a645295bd5c38061c8dcaf345d31f75924da1026fb1b12d0179a48e","observation_id":"1369fc8e-ca41-41cd-ab5d-3da27cc877e4","resolution":{"observed_at":"2026-08-08T05:54:15.853944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.857665Z","title":"Image search with text feedback by visiolinguistic attention learn- ing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.857665Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:64bd5dbb69941454eb705ee1dd72bb0340a1b1c6330625763300b22a1fbb6229","observation_id":"bed027d4-31ba-4427-b29e-619051466185","resolution":{"observed_at":"2026-08-08T05:54:15.857665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.860861Z","title":"Image search with text feedback by visiolinguistic attention learn- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.860861Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5eef0edb3788b3784611e4e1a55f7ec1ceaa6b1af722eeb5072e0211a63f3821","observation_id":"3add3c2b-6dd9-44a2-b881-b45c5638c29a","resolution":{"observed_at":"2026-08-08T05:54:15.860861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11713","last_updated":"2023-10-17T14:19:13Z","snapshot_observed_at":"2026-08-07T03:19:53.953867Z","submitted_at":"2023-02-23T00:33:54Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11713","snapshot_observed_at":"2026-08-08T05:54:15.864357Z","title":"Can pre-trained vision and language models answer vi- sual information-seeking questions? arXiv preprint arXiv:2302.11713, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.864357Z"},"links":{"cited_paper":"/paper/2302.11713","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d729e1d0280124115fb1219379bb6272dd08c7498ade90fb3e808746bc946860","observation_id":"3109636d-67a5-415a-baff-0e63cb21a129","resolution":{"observed_at":"2026-08-08T05:54:15.864357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.868000Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open- source suites, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.868000Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:3df69e94ab139b04b9c9eaaf52690c559516cebebc6f2abb6df3144ca3036a02","observation_id":"4ef45408-0c61-4f29-abdb-4b6c0de8ec1d","resolution":{"observed_at":"2026-08-08T05:54:15.868000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.871260Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.871260Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:44f017a2a9a1fa82d44c3f6bf5f0dd76cd5df32a9eaa3d95abb90001810c2922","observation_id":"425d9efd-8881-43fa-b621-d4a2072ea104","resolution":{"observed_at":"2026-08-08T05:54:15.871260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.874549Z","title":"Meteor universal: Lan- guage specific translation evaluation for any target language","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.874549Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:4585c1b32cb7c4070a4e9bcbc17eda4b6d25842094650ae044a45298e44d240f","observation_id":"bafc4799-8cb8-4f13-a03e-a855dd5c3956","resolution":{"observed_at":"2026-08-08T05:54:15.874549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.877970Z","title":"Hyper- bolic image-text representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.877970Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:ecb714f4165b4400f69acfc1771ec64456d644413fa7558bc8983b1c2900096a","observation_id":"fcec966b-795a-4e81-85ad-db0c89a83a69","resolution":{"observed_at":"2026-08-08T05:54:15.877970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.881162Z","title":"Toutanova","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.881162Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:4c5b00c81fffc92f50fb7ec3d17c2d65e96e97d6f3f8996e724473782c2a0c0a","observation_id":"5ff08aba-4c39-439f-b204-4a38fe95f237","resolution":{"observed_at":"2026-08-08T05:54:15.881162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T05:54:15.884750Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.884750Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:7b14d6abaf5c51f13f6621017954d38e7ab27c7941e4fd6dabe72ff66842f67c","observation_id":"1073d162-89b2-4794-983c-09792b776666","resolution":{"observed_at":"2026-08-08T05:54:15.884750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07202","last_updated":"2020-10-06T19:00:27Z","snapshot_observed_at":"2026-08-08T19:46:34.152150Z","submitted_at":"2020-04-15T17:00:05Z","title":"Entities as Experts: Sparse Memory Access with Entity Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07202","snapshot_observed_at":"2026-08-08T05:54:15.888711Z","title":"Entities as ex- perts: Sparse memory access with entity supervision","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.888711Z"},"links":{"cited_paper":"/paper/2004.07202","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:9cada7af7c9abf0a30342703a818c194853700ac21fac66375d55ee0d530c7dd","observation_id":"16874e68-f265-4254-b4cf-48e4ff28f391","resolution":{"observed_at":"2026-08-08T05:54:15.888711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.892674Z","title":"Pyramidclip: Hierarchi- cal feature alignment for vision-language model pretrain- ing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.892674Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:040b094e1d181aa736cb3eb85ffe9915344d31cd41ba3276625a1251e459e2da","observation_id":"033cdd40-4ff8-48c0-8b12-7f28458d3ef7","resolution":{"observed_at":"2026-08-08T05:54:15.892674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17561","last_updated":"2023-12-16T16:27:57Z","snapshot_observed_at":"2026-08-09T09:56:29.420408Z","submitted_at":"2023-03-30T17:27:22Z","title":"SoftCLIP: Softer Cross-modal Alignment Makes CLIP Stronger","version":2},"cited_work":{"arxiv_id":"2303.17561","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.17561","snapshot_observed_at":"2026-08-08T05:54:16.441409Z","title":"SoftCLIP: Softer Cross-modal Alignment Makes CLIP Stronger","venue":"cs.CV","work_id":"74877700-ecc1-46ba-a943-8495d59ff770","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.895975Z"},"links":{"cited_paper":"/paper/2303.17561","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:f8d13416c7425e63dfaed73f6d21aae1364a19ad2f50603fa31768d28bd0421d","observation_id":"dc07771b-3808-4fa9-8b0a-7919c7744148","resolution":{"observed_at":"2026-08-08T05:54:16.446151Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01218","last_updated":"2023-10-02T14:03:02Z","snapshot_observed_at":"2026-08-02T03:02:58.907220Z","submitted_at":"2023-10-02T14:03:02Z","title":"Making LLaMA SEE and Draw with SEED Tokenizer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01218","snapshot_observed_at":"2026-08-08T05:54:15.899573Z","title":"Making llama see and draw with seed tokenizer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.899573Z"},"links":{"cited_paper":"/paper/2310.01218","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:4db09062e295b8b629ce6cd9cfbea8929b71c9588f665cf738d74d9de3527a9a","observation_id":"4f9696d8-933d-4d91-8b84-0d05be0fc9a4","resolution":{"observed_at":"2026-08-08T05:54:15.899573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.902988Z","title":"Cyclip: Cyclic contrastive language-image pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.902988Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:aee5eaf19cd73dfee1c74d86593e533755ef29444d117163b479c9ab82098b04","observation_id":"67f67b07-c0a4-4475-8e0d-f043e95af363","resolution":{"observed_at":"2026-08-08T05:54:15.902988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.942802Z","title":"Fashionvlp: Vision language transformer for fashion re- trieval with feedback","venue":null,"work_id":"2310676c-2023-42b2-9d18-9b02b77574af","year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.906213Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:dbf8902e7daf1dc19e0af8f1f04a628eefa0203e9c39393121f75741db60f6db","observation_id":"f34a8fe8-19ff-46b6-9529-34b77634a9ef","resolution":{"observed_at":"2026-08-08T05:54:16.946462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.932165Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"f404f879-53d8-4d9a-b1c9-795a52967c0d","year":2017},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.909463Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:164afbed7147558188efaebfd7058416ecf505e94767b19c591339d8363c1b60","observation_id":"53408d33-2e4e-41c6-8db8-c566824c86b0","resolution":{"observed_at":"2026-08-08T05:54:16.935833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.921859Z","title":"Language-only training of zero-shot com- posed image retrieval","venue":null,"work_id":"76bcfd68-dd82-411c-9f1e-b8dd64d342d7","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.912732Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:1e2e1c86e75556fb12689599f14132de57d79bb19a45b1604d8e13d6ef24b2aa","observation_id":"a5810dab-5893-47e6-b4fe-c280901bc02d","resolution":{"observed_at":"2026-08-08T05:54:16.925444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.911798Z","title":"Dialog-based interactive image retrieval","venue":null,"work_id":"ba5fc641-1569-4a21-af52-c95772dd854e","year":2018},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.915885Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:c6b2d23f7f0f1485b5a65a9556fc77caa6cfde62719082e47c38f8f1f7d19972","observation_id":"efdad6e1-a744-4786-9a69-dbe3c71d3d7b","resolution":{"observed_at":"2026-08-08T05:54:16.915546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12794","last_updated":"2020-11-25T22:10:37Z","snapshot_observed_at":"2026-07-06T07:56:36.079573Z","submitted_at":"2019-05-30T00:15:12Z","title":"Fashion IQ: A New Dataset Towards Retrieving Images by Natural Language Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.12794","snapshot_observed_at":"2026-08-08T05:54:15.919336Z","title":"The fashion iq dataset: Retrieving images by combining side information and relative natural language feedback","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.919336Z"},"links":{"cited_paper":"/paper/1905.12794","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:bd513ff04c23804d3a00a420a16b603a2772d292d48d94d85a9d579e95fcecdd","observation_id":"1ffed5d6-3957-444a-8568-7c2949410145","resolution":{"observed_at":"2026-08-08T05:54:15.919336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.922958Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.922958Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:7d3ceee04d62d4ed5ba16b159b1ce5c8d8305f82f35a897e92cf3de9f75ce9e7","observation_id":"c70ead6c-7350-4f67-9286-00a82bb5d4b7","resolution":{"observed_at":"2026-08-08T05:54:15.922958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.926563Z","title":"Retrieval augmented language model pre- training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.926563Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:b1dc36a70e449511b1d3134b10e1b46c9adbdcb6f9afc63845b742965dd63bb4","observation_id":"4eca5215-0015-4a15-99d2-9b72b539afee","resolution":{"observed_at":"2026-08-08T05:54:15.926563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.890599Z","title":"Au- tomatic spatially-aware fashion concept discovery","venue":null,"work_id":"16baaedf-c77d-4c25-9f5d-c64d15883a78","year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.929768Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:acc5b5ca49c9020f90f5766c7ca1d184945220349a81f98ed044dfacd93cb9a1","observation_id":"a3130d19-48be-4574-bc75-17cbf7b07ff9","resolution":{"observed_at":"2026-08-08T05:54:16.893871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.881235Z","title":"Learning attribute-driven disentangled represen- tations for interactive fashion retrieval","venue":null,"work_id":"13b433f5-c00b-40b7-b3a0-6caee5a06d02","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.933138Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:515b2c6d01ec39ef828766247c9ac9496a3fe47de1c07961e36b2f21896a3d55","observation_id":"8472be4a-c96f-495f-b465-d90702b91cfa","resolution":{"observed_at":"2026-08-08T05:54:16.884577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.871457Z","title":"Open-domain visual entity recognition: Towards recognizing millions of wikipedia entities","venue":null,"work_id":"509c17f7-e153-4b66-afa8-e0e2dcbe2dc4","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.936531Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e0a96348cf82e364c84d6889e674cb8907727cd40f1b3c4d94a8d1d971a75523","observation_id":"6e15b028-1da2-4866-996b-1d52a2d3d25a","resolution":{"observed_at":"2026-08-08T05:54:16.874761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.861663Z","title":"Reveal: Retrieval-augmented visual-language pre-training with multi-source multimodal knowledge mem- ory","venue":null,"work_id":"7265e5a4-f561-4232-b88e-52c5eca945f9","year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.939817Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:f9a1bf6b456e2e13f4ed6b7c946b91143f487eba13f6faef2ff7625edd1a3aa6","observation_id":"97fb0400-2a4e-4e51-8ccb-fad1c82afafc","resolution":{"observed_at":"2026-08-08T05:54:16.865028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.852151Z","title":"Openclip, 2021","venue":null,"work_id":"d651a393-929d-46b1-b517-9e7e0de0f237","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.943126Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e85020d49c51386d5ea113844bca1473f2bce4021ae99fecd3f226381578e5fc","observation_id":"88d8d982-2371-488e-9f1d-7496f0ef343d","resolution":{"observed_at":"2026-08-08T05:54:16.855413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.842054Z","title":"Mantis: Interleaved multi-image instruction tuning, 2024","venue":null,"work_id":"7d111ebc-fbd6-4edf-9c1e-5dbb21dcea2f","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.946618Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:a759e62b8ceb9d285397a1a57f65caddf132acebc1fc8196e51a95820e67f880","observation_id":"aeb94a3a-7f2b-4238-a29d-50dc08a65f5f","resolution":{"observed_at":"2026-08-08T05:54:16.845876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-08T05:54:15.949814Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.949814Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:9a85851176b00b12c46870333de0fb51b30b793e4090747163f4342e8af9bf82","observation_id":"11b4e977-6a6e-4ec8-8e66-6549b62d0d4e","resolution":{"observed_at":"2026-08-08T05:54:15.949814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04906","last_updated":"2020-09-30T21:27:13Z","snapshot_observed_at":"2026-07-06T09:11:26.109763Z","submitted_at":"2020-04-10T04:53:17Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04906","snapshot_observed_at":"2026-08-08T05:54:15.953157Z","title":"Dense passage retrieval for open-domain question answering","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.953157Z"},"links":{"cited_paper":"/paper/2004.04906","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:8ea1a28cf1a897185d994c831967573ae05018458360843cd3ce5c690bbb7884","observation_id":"40be1038-6517-4deb-a45e-396b5470b8e5","resolution":{"observed_at":"2026-08-08T05:54:15.953157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09291","last_updated":"2024-02-26T18:59:49Z","snapshot_observed_at":"2026-08-08T20:12:12.510339Z","submitted_at":"2023-10-13T17:59:38Z","title":"Vision-by-Language for Training-Free Compositional Image Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09291","snapshot_observed_at":"2026-08-08T05:54:15.956672Z","title":"Vision-by-language for training- free compositional image retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.956672Z"},"links":{"cited_paper":"/paper/2310.09291","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:dc8280e5c866e3f86a68dc0d667ba8d36e215aef0be04e5b83151a6c0192fc2d","observation_id":"a2540e4b-15b0-4ffc-b70e-47acf8f5fe44","resolution":{"observed_at":"2026-08-08T05:54:15.956672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.831627Z","title":"Referitgame: Referring to objects in pho- tographs of natural scenes","venue":null,"work_id":"b543fd3f-d437-4a3b-be6b-be40ddc9d31b","year":2014},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.960045Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:241ae9521a11a7fa8f7840d67c08f6cd483200813a66ab7e1cae6daf7ae61d1d","observation_id":"2fefdf49-ab73-4198-b080-6f82ff96ad3f","resolution":{"observed_at":"2026-08-08T05:54:16.835520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.821434Z","title":"Grounding language models to images for multimodal in- puts and outputs","venue":null,"work_id":"14aeaa69-c537-4a53-9786-b85ebf841be2","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.963359Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:feeb9d3b9aaf4574fad16be8ce3cf9f0c383daeed6725004c32d0e09b235cf38","observation_id":"449e2b1a-41d0-4cf8-bf8d-2f5a379d0626","resolution":{"observed_at":"2026-08-08T05:54:16.824825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13430","last_updated":"2022-10-31T12:36:18Z","snapshot_observed_at":"2026-07-06T13:56:50.670071Z","submitted_at":"2022-09-27T14:36:16Z","title":"UniCLIP: Unified Framework for Contrastive Language-Image Pre-training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13430","snapshot_observed_at":"2026-08-08T05:54:15.966675Z","title":"Uni- clip: Unified framework for contrastive language-image pre- training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.966675Z"},"links":{"cited_paper":"/paper/2209.13430","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:dfb73ea43d5555e1bc63796476497c7a069b1c378e737f823b7b069a19353f50","observation_id":"a4e72049-9e5a-47b4-9670-8f0756296a55","resolution":{"observed_at":"2026-08-08T05:54:15.966675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00300","last_updated":"2019-06-27T21:06:12Z","snapshot_observed_at":"2026-08-03T13:18:49.452264Z","submitted_at":"2019-06-01T22:02:39Z","title":"Latent Retrieval for Weakly Supervised Open Domain Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00300","snapshot_observed_at":"2026-08-08T05:54:15.970255Z","title":"La- tent retrieval for weakly supervised open domain question answering","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.970255Z"},"links":{"cited_paper":"/paper/1906.00300","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:678df239d6889b93793f548a74c3086cfeb915fefe49400f2d430dc9874eb69c","observation_id":"24c7f62a-e6d4-4eb0-85a4-49e7e456ee08","resolution":{"observed_at":"2026-08-08T05:54:15.970255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.811511Z","title":"Chatting makes perfect: Chat-based image retrieval","venue":null,"work_id":"99911928-22fb-4d05-9879-e7af9311968c","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.974015Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5ac0777eeffe615503bb79c1ae6055d1b84b76bafbd877dac24e1d6cc74bd304","observation_id":"a26127f8-216b-4c52-99f4-09b99c72868e","resolution":{"observed_at":"2026-08-08T05:54:16.814878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.801967Z","title":"Retrieval-augmented generation for knowledge-intensive nlp tasks","venue":null,"work_id":"445a2822-1a1c-4c56-ba67-35c04c8dfdfe","year":2020},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.977277Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:3af4fb55eee1ff87bc5e33a4534b3f5e4f53d427e04b7840cb0e42401a7979f9","observation_id":"707197bd-11e0-4063-856c-5150dd2e5bbf","resolution":{"observed_at":"2026-08-08T05:54:16.805378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.792221Z","title":"Retrieval-augmented genera- tion for knowledge-intensive nlp tasks, 2021","venue":null,"work_id":"7f0127f2-bd35-4cb5-8b40-5b613ed74e08","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.980488Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:67d3207cc044e8d61aaefc32cea7ae2f3f15c7fa3fcdff43463fc6b21cd5877e","observation_id":"c1f5bef1-4759-4615-879e-d60368870870","resolution":{"observed_at":"2026-08-08T05:54:16.795786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.782018Z","title":"Textbind: Multi-turn interleaved multimodal instruction- following in the wild","venue":null,"work_id":"a3637302-9207-407f-8056-062dc35f2187","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.983696Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:cee6ed54c06a5b047cb506803bf8f5bdb4c77272d39cac155d3983f486a7141d","observation_id":"96d48774-0e2e-4239-a0e7-7e03dee3e2a1","resolution":{"observed_at":"2026-08-08T05:54:16.785517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.987047Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.987047Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:3e66c8eac38b71d415a6c5f87c774d42cb79a8ee4334e2359a19b3e87b77c32a","observation_id":"fd3196f1-a8bc-467e-954c-0fcacac5b9c5","resolution":{"observed_at":"2026-08-08T05:54:15.987047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:15.990318Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.990318Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:da6a5eecab85ec4e314f7156abece5807033413fc1154049bddcb88bf35f4372","observation_id":"2e4636fd-fcbc-470c-b437-31dd485575b2","resolution":{"observed_at":"2026-08-08T05:54:15.990318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-05T15:40:56.242909Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-08T05:54:15.993546Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.993546Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:27a1571958330ffcdf65f6bfd21321e989ab0e2e3e0389cf3b43f41d8057e4c8","observation_id":"591ce93e-7e28-434c-9f98-8987dc53e7b8","resolution":{"observed_at":"2026-08-08T05:54:15.993546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.759557Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"e24a1abb-3711-4971-99be-48be5a0f0988","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:15.997037Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:66c30ccc0ca6cb4f0602c216dc731dc1c91c198d79e288dd1b59f4ae86c54a2d","observation_id":"7ee84982-63be-4cba-a493-145152d42283","resolution":{"observed_at":"2026-08-08T05:54:16.762848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.748097Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":"327d3463-23d6-4e4d-828b-c26e8cf40f19","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.000680Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d6a37e50f6290e576de7637201f3c7001f3d827260a0a7408125c4d5482926ca","observation_id":"88b233ce-38d6-4a2a-9fd8-41b3558cbc82","resolution":{"observed_at":"2026-08-08T05:54:16.751844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.736271Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":"3aff7d4b-844d-46ac-a54a-abe7b96db769","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.003945Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:2b4b7320aa7d3ca3a77c68c4602ca06409d33c6956463d8b99b6cdb9ac8b73ce","observation_id":"5d36c078-a63d-47a0-9cb2-52bd215e595f","resolution":{"observed_at":"2026-08-08T05:54:16.739618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.007282Z","title":"Image retrieval on real-life images with pre- trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.007282Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:96928fd150a22119cc0a463485b23f3d82980d6506b2c5c5c2b85a90b40e9a4d","observation_id":"cc3c7b49-a857-4c7a-bcc2-088717bdaeae","resolution":{"observed_at":"2026-08-08T05:54:16.007282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.719959Z","title":"Bi-directional training for composed im- age retrieval via text prompt learning","venue":null,"work_id":"d459fd1b-7074-4c47-9242-5512c63364c0","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.010587Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:630ea23610d48a243c69c924eca64919e81adc8efa21949aebdda9d0172d3e77","observation_id":"4bb2271a-8d20-46fd-ae2b-601b1da7987c","resolution":{"observed_at":"2026-08-08T05:54:16.723592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.710013Z","title":"Three facets of visual and verbal learners: Cognitive ability, cognitive style, and learning preference","venue":null,"work_id":"e28993d7-544b-49e9-9085-3566e27f9163","year":2003},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.013721Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:bce9fc255fecc85c2efadc0ce2e03155818bed0c83211b2d15999efea8f5aea8","observation_id":"6d68932e-aee0-4a36-9613-52f3a90496fe","resolution":{"observed_at":"2026-08-08T05:54:16.713434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-08T05:54:16.017042Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.017042Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:8ce08477448393c4336a7884a4d5af4ad2f9808595dba048cbec929d678ee842","observation_id":"e1354ed6-e14f-4de9-8f5e-bbb089595898","resolution":{"observed_at":"2026-08-08T05:54:16.017042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.700108Z","title":"Encyclopedic vqa: Visual questions about detailed properties of fine-grained categories","venue":null,"work_id":"79cd07b2-5540-4745-9e08-5cdf6367ad6b","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.020707Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:72204dabaf2309e84ef4c611d2ad385a761639d3da437885ad0efef8531b40a1","observation_id":"f95c9202-b167-4158-9d88-f3e1a0bdc10d","resolution":{"observed_at":"2026-08-08T05:54:16.703498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.024210Z","title":"Gpt-4 technical report, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.024210Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5c6dcf44841f43106d535c510cdd57883aaf2c4a07fcbcdeacf9bbdced2e643f","observation_id":"4b4b17d4-a55e-4555-89c1-548ddd5e7829","resolution":{"observed_at":"2026-08-08T05:54:16.024210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.683832Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"618e307f-be3d-4b39-8e6a-2ff280f1e95a","year":2002},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.027601Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5375007695319faab9e3e77bd961b420563f683cdccb228830ea1bb2ca8eb172","observation_id":"342eb1c4-f58d-44fa-931b-f0ff86bb93fd","resolution":{"observed_at":"2026-08-08T05:54:16.687287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.674370Z","title":"Rora-vlm: Robust retrieval-augmented vision language models, 2024","venue":null,"work_id":"280c87d0-fa62-4f28-9024-8dfceafb8189","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.031009Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:3c8be2300e277737ad8c6ff7282ff12f5e57eb69cdf82268e83a62fbee06529b","observation_id":"a94d9f92-3caa-43da-9e5f-d4e191272feb","resolution":{"observed_at":"2026-08-08T05:54:16.677710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00555","last_updated":"2024-08-01T13:38:58Z","snapshot_observed_at":"2026-07-06T18:55:37.298696Z","submitted_at":"2024-08-01T13:38:58Z","title":"Alleviating Hallucination in Large Vision-Language Models with Active Retrieval Augmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00555","snapshot_observed_at":"2026-08-08T05:54:16.035119Z","title":"Alleviating hallucination in large vision-language models with active retrieval augmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.035119Z"},"links":{"cited_paper":"/paper/2408.00555","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:1bfd6179b1928ec89b781fc4772cae3c8c39f3edbd76ed202ff21c40576e38e6","observation_id":"19c69085-513f-47e0-9035-33bc8a69694c","resolution":{"observed_at":"2026-08-08T05:54:16.035119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-08T05:54:16.038739Z","title":"Learning transferable vi- sual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.038739Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:ecd67dd717bd9f4bab5a123f40c0aa4b600e4ca1c5640e6b30de3848679a1ce5","observation_id":"7b0afb44-c106-4e9a-8e51-81e36db8fc49","resolution":{"observed_at":"2026-08-08T05:54:16.038739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-08T05:54:16.042435Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.042435Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:71bcff92126d7e856b0a44cf07b6c687fce3f7aa5964815c5e3edc83e251f2bd","observation_id":"645a6847-16b2-456f-b901-afd2f19c4813","resolution":{"observed_at":"2026-08-08T05:54:16.042435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.664319Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":"555bc705-7108-4fde-9ff4-9984b22ef56e","year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.045951Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:5c16671d4292bdf44618ecae25616f87e424c286b5a58e45ee9f5eac893da33a","observation_id":"94e1b93c-2782-482f-8579-efdd03bdd4a6","resolution":{"observed_at":"2026-08-08T05:54:16.667678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.653855Z","title":"Kvqa: Knowledge-aware visual question answering","venue":null,"work_id":"af0a8887-106b-47ac-ab78-f97d76a6cc92","year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.049269Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:bf70f5aed09b311b7831408be2b6c8233ef6cbb8a153eea61757c2b5dfc21573","observation_id":"084a3a0d-94b5-4e4c-b964-2dc08e73e7bd","resolution":{"observed_at":"2026-08-08T05:54:16.657548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.643133Z","title":"Towards vqa models that can read","venue":null,"work_id":"30193382-e180-4e5f-a3f6-d248a3866776","year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.052474Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:aeb861f95f5a2feedb0bd335ae49221f617bd917e44ed1aa54bf910c23b11aff","observation_id":"5932d71f-7388-4f8e-885e-54ca21648e15","resolution":{"observed_at":"2026-08-08T05:54:16.646486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.632507Z","title":"Knowledge-enhanced dual-stream zero-shot composed im- age retrieval","venue":null,"work_id":"b97a26f3-80f0-49e3-872a-59b72e567c98","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.056213Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:2749d8b0677f6b2102377abd899c0a5f347a7f358944e2ef65ca5e4b24c94579","observation_id":"b0f5bc17-34e7-4571-bb41-9805ece0c23a","resolution":{"observed_at":"2026-08-08T05:54:16.635984Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-08T05:54:16.059617Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.059617Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:1ec3da7adad1a5834adce68ec681c0a76d6c9286654416e783209d6aa3c69d98","observation_id":"e5afdb99-5d1e-4271-a2e3-02333f732556","resolution":{"observed_at":"2026-08-08T05:54:16.059617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.622386Z","title":"Gemini 1.5: Unlocking multimodal under- standing across millions of tokens of context, 2024","venue":null,"work_id":"3ac8b7bd-94b2-4f46-90d5-5dd410f46861","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.063185Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:677da09737bd2bfaa5b5282cbf979101800119dc746fef3245d1024d72475605","observation_id":"17392f1e-64e6-4937-80c0-e3260e4c6c9f","resolution":{"observed_at":"2026-08-08T05:54:16.625967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-07-06T17:17:31.008185Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-08-08T05:54:16.066474Z","title":"Mm-interleaved: Interleaved image-text generative model- ing via multi-modal feature synchronizer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.066474Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:563289affe3ff76e4951c7df0d7cc30f18897974d5be7cc030c0543796fa5797","observation_id":"918b30d8-a3b9-4390-9cec-7a5a6d442a61","resolution":{"observed_at":"2026-08-08T05:54:16.066474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.611932Z","title":"Genecis: A benchmark for general conditional image similarity","venue":null,"work_id":"02fe3b97-3720-410e-a03f-01b17cf2bb08","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.069876Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6ef143581a2292d0231d51f6831042ac5bb4326277eca0e204e2d3097b33f5e9","observation_id":"faeba532-7ee5-473f-a4ec-791afc12438a","resolution":{"observed_at":"2026-08-08T05:54:16.615682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.601734Z","title":"Composing text and image for image retrieval - an empirical odyssey","venue":null,"work_id":"2dfe9a09-9d9c-4009-b99b-11e8f9b186bc","year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.073150Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:63fff1e83f5a9b6e7302f03939abef1532c771abdd2ee0d35d6f1766e263e2e3","observation_id":"c4307a2c-2981-4e25-ac03-72277d72af1e","resolution":{"observed_at":"2026-08-08T05:54:16.605302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.076600Z","title":"Composing text and image for image retrieval-an empirical odyssey","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.076600Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6da135eb545649099932077953e842083bbb54ef701ab6bb5e384c5e31692153","observation_id":"8a47854d-ddaf-4635-ba28-df7b6e540b35","resolution":{"observed_at":"2026-08-08T05:54:16.076600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.585369Z","title":"Cross-modal feature alignment and fusion for com- posed image retrieval","venue":null,"work_id":"e2139728-5190-41b6-9609-7d6fc294b759","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.079980Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:073288b8e282b3b7f8a856ae4af918ff1a8daca27dd02ca735b53ba52c920eae","observation_id":"d573bb81-416d-4a88-87cc-ffb22d910204","resolution":{"observed_at":"2026-08-08T05:54:16.589090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-08T05:54:16.083564Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.083564Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:b69a48acb47dad5fb14480323f44b9deb582e8230a63ce8896f80f75b80faa3e","observation_id":"891a069f-594a-423f-a1ca-f90029ac0587","resolution":{"observed_at":"2026-08-08T05:54:16.083564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.575572Z","title":"Image as a foreign language: Beit pretraining for vision and vision- language tasks","venue":null,"work_id":"54d1dcf5-03f2-47df-b74f-7319804cab9c","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.087345Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:17c099a71a6d9a37386ec53a06954234eb1de6ba535c94e86bc7a33f794f0023","observation_id":"182dbbdc-3271-4672-97ca-4db2bebad9f2","resolution":{"observed_at":"2026-08-08T05:54:16.578986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17136","last_updated":"2023-11-28T18:55:52Z","snapshot_observed_at":"2026-07-06T16:54:02.725142Z","submitted_at":"2023-11-28T18:55:52Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17136","snapshot_observed_at":"2026-08-08T05:54:16.090827Z","title":"Uniir: Training and benchmarking universal multimodal information retriev- ers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.090827Z"},"links":{"cited_paper":"/paper/2311.17136","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:d25768c74d002e002a5e6543a976221b9fe1ddfa3d4ff5e4358922eaf2e9962c","observation_id":"8462c595-82f9-4c73-9e8a-f598044ab3da","resolution":{"observed_at":"2026-08-08T05:54:16.090827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.565604Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback","venue":null,"work_id":"6f0b6832-953c-4309-a0c9-d5923fde954f","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.094338Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:944a5ade834c32b7278d5be4ead946efca78d07de83a06d22ac69920c5245989","observation_id":"7faf818e-0027-4616-b6a6-dba6c7623a02","resolution":{"observed_at":"2026-08-08T05:54:16.569127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.555426Z","title":"Fashion iq: A new dataset towards retrieving images by natural language feedback","venue":null,"work_id":"d1c861f6-4985-464d-8e3c-0658f0fbaac8","year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.097683Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:f3a40f4ec8ab270f9bddfa28c2373860cb9b760f7b2417f67e2c5a175b147354","observation_id":"f480dfe3-c184-478b-a138-44100814778a","resolution":{"observed_at":"2026-08-08T05:54:16.558907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.101159Z","title":"Visual question answer- ing: A survey of methods and datasets","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.101159Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:624f53bd401ee50358ee6821ef06880561a48d0ff315d67a7eeb63ee72c14c47","observation_id":"f981b359-073d-4059-9f45-42a1fba8df2e","resolution":{"observed_at":"2026-08-08T05:54:16.101159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05519","last_updated":"2024-06-25T05:01:09Z","snapshot_observed_at":"2026-08-04T16:34:07.714734Z","submitted_at":"2023-09-11T15:02:25Z","title":"NExT-GPT: Any-to-Any Multimodal LLM","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05519","snapshot_observed_at":"2026-08-08T05:54:16.104506Z","title":"Next-gpt: Any-to-any multimodal llm","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.104506Z"},"links":{"cited_paper":"/paper/2309.05519","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:841b68858e7360d465dee4909218f61db79f934e0bb5f317c119826098fd44ee","observation_id":"cb9d029c-c0d8-463e-80cb-d7253de4152e","resolution":{"observed_at":"2026-08-08T05:54:16.104506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.539157Z","title":"EchoSight: Advancing visual- language models with Wiki knowledge","venue":null,"work_id":"3a8ac2a9-a08f-4b63-aa2c-12e7daae4407","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.108201Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:136afbae57ddb290474fc6c853a7574bc7e2da95a3a68d27e71bf66679725fa4","observation_id":"22ec78be-1e28-48a4-af82-7030b566ab26","resolution":{"observed_at":"2026-08-08T05:54:16.542820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-08T05:54:16.111778Z","title":"Filip: fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.111778Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e703c1f7b6f14175b38c1422356fdb754234716d048701e5a8a9c1af8671623a","observation_id":"44e175a0-ec5e-4e91-9d78-8d43d48b7cc9","resolution":{"observed_at":"2026-08-08T05:54:16.111778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04840","last_updated":"2024-08-13T08:10:32Z","snapshot_observed_at":"2026-07-06T18:58:39.334273Z","submitted_at":"2024-08-09T03:25:42Z","title":"mPLUG-Owl3: Towards Long Image-Sequence Understanding in Multi-Modal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04840","snapshot_observed_at":"2026-08-08T05:54:16.115407Z","title":"mplug-owl3: Towards long image-sequence understanding in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.115407Z"},"links":{"cited_paper":"/paper/2408.04840","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:c44f170e268dff31616e475171446bb7c44a4c0103c856f828c16f3a2bb10d70","observation_id":"f3622b38-edbd-4faf-8681-7c8a7e89af82","resolution":{"observed_at":"2026-08-08T05:54:16.115407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-08T05:54:16.119075Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.119075Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:39cf2cbe2170e8b2d6a623ea605c4db73412ba429ffef56445cbbd1034af2aae","observation_id":"962fba5b-9b5b-4d40-b138-8a495af5dd8b","resolution":{"observed_at":"2026-08-08T05:54:16.119075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-08T05:54:16.122413Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.122413Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:b41093b0e6ac373bd39edc2b02ddf2474fc0b60c5dbce95ceec43cd1bd5659d6","observation_id":"43394a8b-a74f-4e12-ad5a-39f6911df660","resolution":{"observed_at":"2026-08-08T05:54:16.122413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-08T05:54:16.126629Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.126629Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:dad2283b4b594b36fc7c3f3cda3c5b7b4a03f673b017435556b1d32d86f757d2","observation_id":"00b79990-a65d-40ee-9b7d-cc78b3d733dc","resolution":{"observed_at":"2026-08-08T05:54:16.126629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-02T13:24:00.339129Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-08-08T05:54:16.130352Z","title":"Visrag: Vision-based retrieval-augmented generation on multi-modality documents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.130352Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:2235110ca5b3f710de6e1db59d7dcc00e7384cb2bb1301e339e9b53d5d30cf56","observation_id":"3382d6d5-1c24-40b4-a9db-3d32e9e0b111","resolution":{"observed_at":"2026-08-08T05:54:16.130352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04867","last_updated":"2020-02-21T13:36:15Z","snapshot_observed_at":"2026-08-09T06:48:42.729935Z","submitted_at":"2019-10-01T17:06:29Z","title":"A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04867","snapshot_observed_at":"2026-08-08T05:54:16.134206Z","title":"A large-scale study of representation learning with the visual task adaptation benchmark","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.134206Z"},"links":{"cited_paper":"/paper/1910.04867","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:6ac45bcec84fa0c46ee5807cb4765cd959bb06d5d313bb9e99dcb21c8ab20e6f","observation_id":"5ebec1ff-b09f-4a7e-ba09-4104836ad76b","resolution":{"observed_at":"2026-08-08T05:54:16.134206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.528968Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"6880512b-d89b-4b9d-acbd-566bc37716f1","year":2023},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.137913Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:e7a603007f883f4df3aa00bdbfdbfbc4837acc249ca4df88ceaf24143fbb8975","observation_id":"a892aaff-44e9-478b-91be-e937e72ad97f","resolution":{"observed_at":"2026-08-08T05:54:16.532426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-04T07:44:45.555675Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-08-08T05:54:16.141327Z","title":"Magi- clens: Self-supervised image retrieval with open-ended in- structions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.141327Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:7502816a21a7043a30cedfb75b91ffeb2043c37b1daf3f0139972f31bebc6de2","observation_id":"151d9cde-c624-4470-b210-bd4e414baa0f","resolution":{"observed_at":"2026-08-08T05:54:16.141327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09304","last_updated":"2022-10-17T17:57:46Z","snapshot_observed_at":"2026-07-06T14:06:48.707061Z","submitted_at":"2022-10-17T17:57:46Z","title":"Non-Contrastive Learning Meets Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":"2210.09304","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.09304","snapshot_observed_at":"2026-08-08T05:54:16.178366Z","title":"Non-Contrastive Learning Meets Language-Image Pre-Training","venue":"cs.CV","work_id":"206a6ef0-8fbf-4000-8b4d-b6975e92f551","year":2022},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.145165Z"},"links":{"cited_paper":"/paper/2210.09304","citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:29bfc3b32016c1e92f8d739b1e770d13bfc3144923939b22bd28158448df51f8","observation_id":"a4528704-16cb-4ea1-b256-d898499e5c46","resolution":{"observed_at":"2026-08-08T05:54:16.184255Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T05:54:16.518720Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":"670a0375-a6b5-41f6-8b8c-ce135483937f","year":2024},"citing_paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-08T05:54:16.148845Z"},"links":{"citing_paper":"/paper/2502.08254"},"observation_digest":"sha256:299be5c8281d3805cf2a04b51d37c260d1cbeb8a3f95be4941dba99abf0b09a9","observation_id":"e6957db2-f559-4b6d-bc2e-ba3a7e2a2f08","resolution":{"observed_at":"2026-08-08T05:54:16.522347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.08254","last_updated":"2025-02-12T09:49:43Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T06:09:08.320689Z","submitted_at":"2025-02-12T09:49:43Z","title":"UniCoRN: Unified Commented Retrieval Network with LMMs"},"reference_resolution":{"displayed":99,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":2,"verified_fuzzy":38},"total_outbound_references":99},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 99 of 99 outbound references and 0 inbound Pith citation observations for arXiv:2502.08254."}