{"as_of":"2026-08-23T14:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d7c9e74738b7cb6cc062d0c44df87d1b6bd9b43b7a7e331167a00ffdb262542f","coverage":[{"denominator":120,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:14:46.090733Z","state":"measured"},{"denominator":112,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":112,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T18:30:14.559722Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T05:49:36.602258Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-07T14:03:00.563577Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-18T20:35:04.425130Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:03:00.563577Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2505.20124"},"observation_digest":"sha256:6ef875f02a017efc67ad2b34ac25495f23dc63f425ab81dd03087a8d7881ab65","observation_id":"ee1ebd9e-a9c9-45ae-ae6a-38cd48861805","resolution":{"observed_at":"2026-08-07T14:03:00.563577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2509.18095","last_updated":"2026-04-06T19:57:27Z","snapshot_observed_at":"2026-08-15T12:53:10.712958Z","submitted_at":"2025-09-22T17:59:42Z","title":"MetaEmbed: Scaling Multimodal Retrieval at Test-Time with Flexible Late Interaction","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-18T14:09:22.942238Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2509.18095"},"observation_digest":"sha256:67b461d6148d554dc1cdb2a2efd74e22900f6cabcdd4fca753cbea95213c7413","observation_id":"edbdef5e-892a-46ba-bff0-03e3b5d5177a","resolution":{"observed_at":"2026-05-18T14:11:27.464856Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T13:00:31.952588Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:de862b8cd0c8961f9b46f31b8fee1d096dcc9559184085a26dcbb3746742c950","observation_id":"913342ff-b8a1-4a73-8d70-b9dd8edb213b","resolution":{"observed_at":"2026-05-18T13:01:23.532492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-04T13:51:45.017918Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval.arXiv preprint arXiv:2505.19650,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-08T21:41:13.842209Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:45.017918Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:3a90d99278063fe3aa85468a92311e866d6f07596d14329374d63945ef450a09","observation_id":"53c0bd72-bc9e-42d9-87d1-38ee6fc94016","resolution":{"observed_at":"2026-08-04T13:51:45.017918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-12T02:51:12.283101Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T12:46:30.827346Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:8679e645ecd7b5f39bb41bd440c7f17ea04ea788d2844dee1b8125ceb281f644","observation_id":"aa897247-7e0b-4148-9f23-44169316f1bc","resolution":{"observed_at":"2026-05-11T19:01:19.736570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-12T18:31:37.144968Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-12T02:51:12.283101Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-12T18:31:37.144968Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:727fd3fd26e9333cdc992f59cea827784014d7ba551b8b7196f83414e64453a1","observation_id":"8f2ce394-f8b1-45e9-893c-e0de3bc7989f","resolution":{"observed_at":"2026-07-12T18:31:37.144968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-02T15:40:29.161499Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.22280","last_updated":"2026-07-15T17:09:27Z","snapshot_observed_at":"2026-08-12T02:51:12.283101Z","submitted_at":"2026-04-24T06:50:11Z","title":"Beyond Chain-of-Thought: Rewrite as a Universal Interface for Generative Multimodal Embeddings","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T15:40:29.161499Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.22280"},"observation_digest":"sha256:d645e1fe52633c81e814416d8e119bf65a4c839c783b109991d86678088ab01d","observation_id":"1c769451-754c-4c00-a1c5-adf5685cc380","resolution":{"observed_at":"2026-08-02T15:40:29.161499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2604.25273","last_updated":"2026-04-28T06:29:27Z","snapshot_observed_at":"2026-08-11T05:46:16.728182Z","submitted_at":"2026-04-28T06:29:27Z","title":"Combating Visual Neglect and Semantic Drift in Large Multimodal Models for Enhanced Cross-Modal Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-07T16:56:52.714346Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2604.25273"},"observation_digest":"sha256:f7a79b5d6ad3cfba78e2c0f960fda215487649811fe3ed4cb3c9d41650f04fb6","observation_id":"8a9ccc3a-2e9a-4e11-9033-1cd3626b5ee9","resolution":{"observed_at":"2026-05-11T23:31:13.551343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-14T18:56:57.352952Z","title":"URL https: //doi.org/10.48550/arXiv.2505.19650","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.15868","last_updated":"2026-07-13T02:21:42Z","snapshot_observed_at":"2026-08-16T03:58:47.468411Z","submitted_at":"2026-05-15T11:36:01Z","title":"SOLAR: Self-supervised Joint Learning for Symmetric Multimodal Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T18:56:57.352952Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2605.15868"},"observation_digest":"sha256:4b62e32210b96b8defb3e7c4cd15fa4099924b6df6e7bae02356ab81e9e2f6a8","observation_id":"8a5273d6-52b2-4e9e-9818-5a94e51accd8","resolution":{"observed_at":"2026-07-14T18:56:57.352952Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":"2505.19650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-07-04T05:49:36.602258Z","title":"Modality curation: Building universal embeddings for advanced multimodal information retrieval","venue":null,"work_id":"76eebcfc-ced0-4bd6-bddf-cfc3b00db702","year":2025},"citing_paper":{"arxiv_id":"2606.20280","last_updated":"2026-07-04T09:32:50Z","snapshot_observed_at":"2026-07-12T13:16:44.503259Z","submitted_at":"2026-06-18T14:23:23Z","title":"ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T15:34:55.062016Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2606.20280"},"observation_digest":"sha256:ed59357d8c4285f55537cbb4560ec75c85ba23ba72c492d82cce7a87b322e0dd","observation_id":"19bd5014-640a-4ada-a4d1-8c375f21155c","resolution":{"observed_at":"2026-07-04T05:49:36.604036Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-04T20:43:16.106644Z","title":"Modality curation: Building uni- versal embeddings for advanced multimodal information re- trieval.arXiv preprint arXiv:2505.19650, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01794","last_updated":"2026-08-03T07:04:27Z","snapshot_observed_at":"2026-08-16T01:32:07.095599Z","submitted_at":"2026-08-03T07:04:27Z","title":"Illuminating Visual Identity in Universal Multimodal Embeddings","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:43:16.106644Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2608.01794"},"observation_digest":"sha256:362d8b061211afaf82240b450e671b85832fef1de3b30a8fed5a17f502448b62","observation_id":"68e4c1a0-4d0d-436a-b85c-8bffd421c7ac","resolution":{"observed_at":"2026-08-04T20:43:16.106644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19650","snapshot_observed_at":"2026-08-07T18:30:14.559722Z","title":"Glint Lab Fanheng Kong, Jingyuan Zhang, Yahui Liu, Hongzhi Zhang, Shi Feng, Xiaocui Yang, Daling Wang, Yu Tian, Fuzheng Zhang, Guorui Zhou, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06060","last_updated":"2026-08-06T14:04:56Z","snapshot_observed_at":"2026-08-15T21:32:39.744794Z","submitted_at":"2026-08-06T14:04:56Z","title":"Learning from Failures: Retrieval-Centric CoT via Hard Negatives for Unified Multimodal Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T18:30:14.559722Z"},"links":{"cited_paper":"/paper/2505.19650","citing_paper":"/paper/2608.06060"},"observation_digest":"sha256:3fc150e50f0a5a3ab1de0d3fe46a65af52b5ca390d03b9c2075d42e90c98e9b8","observation_id":"8ba9a618-5492-42cf-be31-7c0106c94e0c","resolution":{"observed_at":"2026-08-07T18:30:14.559722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19650/citation-record","integrity":"/paper/2505.19650/integrity","json":"/paper/2505.19650/citation-record.json","paper":"/paper/2505.19650"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.135801Z","title":"Multimodal automated fact-checking: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.135801Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:dfb75eafc41295253bcd24b9c55561606d96473ee55ea4f46e3951b34949b5a0","observation_id":"d25bdf05-a782-4319-83d6-0091c3fc8af7","resolution":{"observed_at":"2026-08-07T14:14:37.135801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.194753Z","title":"Localizing moments in video with natural language","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.194753Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:aafc21bb25b392204dbcb94216e91025164b84a96c3e1d681a3b618269e3ceb4","observation_id":"62a061c5-05f1-48aa-9003-4f4ff0a5f489","resolution":{"observed_at":"2026-08-07T14:14:37.194753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.236558Z","title":"Vqa: Visual question answering","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.236558Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:30bde44eebfac835823bd28a7610926eeb6ce53f46a31974f409f7db28bd9d45","observation_id":"1880f482-8f26-4197-a149-8fc3aa7ba92d","resolution":{"observed_at":"2026-08-07T14:14:37.236558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01916","last_updated":"2025-04-02T17:19:59Z","snapshot_observed_at":"2026-08-16T12:44:31.172614Z","submitted_at":"2025-04-02T17:19:59Z","title":"FineLIP: Extending CLIP's Reach via Fine-Grained Alignment with Longer Text Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01916","snapshot_observed_at":"2026-08-07T14:14:37.333584Z","title":"Finelip: Extending clip’s reach via fine- grained alignment with longer text inputs.arXiv preprint arXiv:2504.01916, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.333584Z"},"links":{"cited_paper":"/paper/2504.01916","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:f5c6e5119ddddc475c4b9e9174f23160a24091988589d02f4601d1c9f5dc0321","observation_id":"613f3f9a-f2c5-4326-be34-a86460cd5d22","resolution":{"observed_at":"2026-08-07T14:14:37.333584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:14:37.445117Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.445117Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:db97394e4d1684234acfb76b7c42e651f852b6952440b39175a1fec6d76adad9","observation_id":"47fa31f2-a075-4f07-b00d-96c42d4efb7c","resolution":{"observed_at":"2026-08-07T14:14:37.445117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09268","last_updated":"2018-10-31T14:46:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-11-28T18:14:11Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09268","snapshot_observed_at":"2026-08-07T14:14:37.507574Z","title":"Ms marco: A human generated machine reading comprehension dataset.arXiv preprint arXiv:1611.09268, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.507574Z"},"links":{"cited_paper":"/paper/1611.09268","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:0c8abfd4e781861b99b8b2987b1fb9b8266d12ceaa307ded6c896a60d53036f2","observation_id":"b81a194e-645b-4e3f-a99d-899caf53458c","resolution":{"observed_at":"2026-08-07T14:14:37.507574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.583688Z","title":"Wiki-llava: Hierarchical retrieval-augmented generation for multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.583688Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:bd2d21acc7f045c85be2dbc3c086deae29ee02388367e9d9f7d41e0de46ea51d","observation_id":"33c681ea-322c-4d07-9570-bf88a7f1e689","resolution":{"observed_at":"2026-08-07T14:14:37.583688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03051","last_updated":"2025-04-09T06:24:14Z","snapshot_observed_at":"2026-08-16T13:12:45.748381Z","submitted_at":"2024-10-04T00:13:54Z","title":"AuroraCap: Efficient, Performant Video Detailed Captioning and a New Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03051","snapshot_observed_at":"2026-08-07T14:14:37.686789Z","title":"Auroracap: Efficient, performant video detailed captioning and a new benchmark.arXiv preprint arXiv:2410.03051, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.686789Z"},"links":{"cited_paper":"/paper/2410.03051","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:610263d19dba0581f0f84d4940b0fb09005c097ef76072d57ee8b033f768de4a","observation_id":"caca77dd-0c7f-436f-a4a7-f8dbfe66e7db","resolution":{"observed_at":"2026-08-07T14:14:37.686789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.792978Z","title":"Webqa: Multihop and multimodal qa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.792978Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:d6588ec4d8afe041c9ea0a3d6b4a96c40edbac2ba338eff3fb1767a3a1a465a5","observation_id":"8e2aef62-91dd-4624-9d83-0869ab6c18e7","resolution":{"observed_at":"2026-08-07T14:14:37.792978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:37.877735Z","title":"Collecting highly parallel data for paraphrase evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.877735Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5813a45af34617ad6f4623b9caaa7e9376e56880bba8d6b67a92dca18a19fcdb","observation_id":"a17a1232-f62d-4dfb-8d2d-06f2228c2af9","resolution":{"observed_at":"2026-08-07T14:14:37.877735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08468","last_updated":"2025-02-12T15:03:33Z","snapshot_observed_at":"2026-08-19T02:58:55.434817Z","submitted_at":"2025-02-12T15:03:33Z","title":"mmE5: Improving Multimodal Multilingual Embeddings via High-quality Synthetic Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08468","snapshot_observed_at":"2026-08-07T14:14:37.978957Z","title":"mme5: Improving multimodal multilingual embeddings via high-quality synthetic data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:37.978957Z"},"links":{"cited_paper":"/paper/2502.08468","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:32778d8ee00156f56611b79094d84e1af34844c5131e6087faecd7db7f021c62","observation_id":"14038995-ac3d-40b0-9f9d-34599cad0315","resolution":{"observed_at":"2026-08-07T14:14:37.978957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.039664Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.039664Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:68f51851cac967153693be7b4516bdeb3933835427f3d8e6c6b94a39e4ed0a76","observation_id":"5ce443e8-645b-4c1c-864b-3fc15153c6aa","resolution":{"observed_at":"2026-08-07T14:14:38.039664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.135154Z","title":"Vast: A vision-audio-subtitle-text omni-modality foundation model and dataset","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.135154Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:f66406eceedf6f39e4f422a0e5f4c9115bb8384ea099b918abf714af2ac7dc90","observation_id":"cb626853-7142-459a-bb3f-07ee6af82e55","resolution":{"observed_at":"2026-08-07T14:14:38.135154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02928","last_updated":"2022-10-20T17:16:27Z","snapshot_observed_at":"2026-08-16T16:26:25.299447Z","submitted_at":"2022-10-06T13:58:03Z","title":"MuRAG: Multimodal Retrieval-Augmented Generator for Open Question Answering over Images and Text","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02928","snapshot_observed_at":"2026-08-07T14:14:38.241872Z","title":"Murag: Multimodal retrieval-augmented generator for open question answering over images and text.arXiv preprint arXiv:2210.02928, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.241872Z"},"links":{"cited_paper":"/paper/2210.02928","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:bd615434e05f11e9a7f5d71d24d8df3faea0a2f17e2f0ceb3a39cbf068c82b5c","observation_id":"3abfb845-1d29-48d6-909d-845825214698","resolution":{"observed_at":"2026-08-07T14:14:38.241872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T14:14:38.335797Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites.arXiv preprint arXiv:2404.16821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.335797Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:4a0cad8a3fc63b6dbe7af1c79035bfdec554ee184541ff473dbdec2ad64a547b","observation_id":"2ff154db-8bbf-46bf-91b2-fba69349d5dd","resolution":{"observed_at":"2026-08-07T14:14:38.335797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.353327Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.353327Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:09d2ca851ffc8345de1a3f38164b51667e95bcb530a2010d57a02d6365a60828","observation_id":"55ade486-db11-43f2-b8c3-e76b36b8c472","resolution":{"observed_at":"2026-08-07T14:14:38.353327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.487073Z","title":"Visual dialog","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.487073Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:190dce6bcd1d5e387396fabd4c67e812b504aadee059e10bdbfa887b2a9609e4","observation_id":"ce0df1fa-2f49-48a6-be40-6c7c99cc4813","resolution":{"observed_at":"2026-08-07T14:14:38.487073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.611355Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.611355Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:1732bfa3b738c0b335c3ee48a21a9ae61eef1c2ccffc71e0abc7d161548687bc","observation_id":"e03ce079-de1e-42e5-bb72-41a602d79443","resolution":{"observed_at":"2026-08-07T14:14:38.611355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.724894Z","title":"Mmdocir: Benchmarking multi-modal retrieval for long documents.arXiv preprint arXiv:2501.08828,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.724894Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7035fb8fe35e12acf1b4e38fd727ab809589d7ed97f1011b134d5fbe6af6ba96","observation_id":"20feab99-8379-442e-816a-dc2af501376d","resolution":{"observed_at":"2026-08-07T14:14:38.724894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:38.857313Z","title":"The pascal visual object classes challenge: A retrospective.International Journal of Computer Vision, 111:98–136, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.857313Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5282301c808b604dad14520b21ed631465f9ee2cd2b6319b5998267316d9c3d9","observation_id":"6b9a2408-e4ac-48f3-913d-a09e84c5684c","resolution":{"observed_at":"2026-08-07T14:14:38.857313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-17T00:52:15.316289Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-07T14:14:38.993221Z","title":"Dreamsim: Learning new dimensions of human visual similarity using synthetic data.arXiv preprint arXiv:2306.09344, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:38.993221Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9040f71a06b3267ee7ccd8d668d02d7254635a408ee03a10fe39593ef2dfb068","observation_id":"a452dfd7-f6d5-419d-b6bb-18c1ba7ec49e","resolution":{"observed_at":"2026-08-07T14:14:38.993221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.124769Z","title":"Simcse: Simple contrastive learning of sentence embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.124769Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:812a34d9c093c666ab7294430ad9da6d97b2b73d625a6acaf34b4c2c4720856a","observation_id":"56c6cc8f-ded3-4f71-a5b4-ad3cb8f4bb2b","resolution":{"observed_at":"2026-08-07T14:14:39.124769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.289062Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.289062Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:8c23d5c85bbfc2caf09eba0e730aade8d7db7c67f0ee84b97bdc2d4e4455e0b1","observation_id":"7f0689e4-5de1-42e4-b919-de06d58519da","resolution":{"observed_at":"2026-08-07T14:14:39.289062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.416668Z","title":"Breaking the modality barrier: Universal embedding learning with multimodal llms.arXiv preprint arXiv:2504.17432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.416668Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:ef6259a44bd8c84b596c57914f107a81842bee15f8feb73d1c39d35e23ffc448","observation_id":"9ada8643-244a-4f40-9648-261e9c3c503a","resolution":{"observed_at":"2026-08-07T14:14:39.416668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.525902Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.525902Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7a4cfe468a213e8b76821e98fbcba3c6e83172ecb3cacf7b211ce0e88ee3bb3b","observation_id":"e76bd2ca-1ea7-42db-a61f-afaabef2ee8c","resolution":{"observed_at":"2026-08-07T14:14:39.525902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.674376Z","title":"Egocvr: An egocentric benchmark for fine-grained composed video retrieval","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.674376Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:793fa5a89619412794028589d2e8ac07337091fecee83595c097ca60818ff8ac","observation_id":"d97d084b-ec3b-48e1-9ac2-4f3a6cb753ed","resolution":{"observed_at":"2026-08-07T14:14:39.674376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.787447Z","title":"Mate: Meet at the embedding-connecting images with long texts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.787447Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:eb8b4cc4d3411e2bfb730aef29b73e1f413f705a7dfe4e274e8bef7eff5480bf","observation_id":"adf2eed1-d342-476f-b3c2-12fcc2223410","resolution":{"observed_at":"2026-08-07T14:14:39.787447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:39.943808Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:39.943808Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:36644cde530cd2842dcd182d7ac8c3cf39197457ab549ee13ef0b7a5957291be","observation_id":"1932084e-9cc0-4812-8e24-96947c515a18","resolution":{"observed_at":"2026-08-07T14:14:39.943808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.007625Z","title":"Tencent text- video retrieval: hierarchical cross-modal interactions with multi-level representations.IEEE Access, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.007625Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:501121df423ba9633e36e6f253c1382c8694b97621e6375478105b58123a5020","observation_id":"d567483b-84af-428a-9f33-3baca666fa76","resolution":{"observed_at":"2026-08-07T14:14:40.007625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.062977Z","title":"Scaling sentence embeddings with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.062977Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:140d5d1831e51d42c4a5adce0aa0b94257518dd0973570ff44e142ce9d95a7b4","observation_id":"69ea240f-4921-45fd-bd9a-8d749f023325","resolution":{"observed_at":"2026-08-07T14:14:40.062977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-17T17:47:50.871594Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-08-07T14:14:40.135649Z","title":"E5-v: Universal embeddings with multimodal large language models.arXiv preprint arXiv:2407.12580, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.135649Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:ded000f5ebd81bfd7de0d7c1134ae27b1e210d55fcc4df3806afff3fcdb040ff","observation_id":"7c11c69d-5b64-4c24-bd72-49451fd8d076","resolution":{"observed_at":"2026-08-07T14:14:40.135649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-08-17T02:26:12.770175Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05160","snapshot_observed_at":"2026-08-07T14:14:40.233513Z","title":"Vlm2vec: Training vision-language models for massive multimodal embedding tasks.arXiv preprint arXiv:2410.05160, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.233513Z"},"links":{"cited_paper":"/paper/2410.05160","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:18c94c431285b115b0c1741b84015f4973e4155ba79d01b8b467d75f63aff1c8","observation_id":"ac76a1ed-3331-45f8-803f-635eead6ea98","resolution":{"observed_at":"2026-08-07T14:14:40.233513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.292912Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.292912Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:cae4239780a2d7dabeb9a922ca7cb16c2c9c37b4ed8b556281d86779341637c5","observation_id":"67ea4878-8040-4681-b778-07b3235699d1","resolution":{"observed_at":"2026-08-07T14:14:40.292912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.422494Z","title":"Visual question answering: Datasets, algorithms, and future challenges.Computer Vision and Image Understanding, 163:3–20, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.422494Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:785c19b312da36ed0b8049c02f90051cb5dd675ed79242a3f8908876191f3b91","observation_id":"92d103e5-e08d-4319-b296-89169c5ffde4","resolution":{"observed_at":"2026-08-07T14:14:40.422494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.496653Z","title":"Deep visual-semantic alignments for generating image descriptions","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.496653Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9f6e3109f64e914441247403456c2fe6dd36a681cc5765bc25eebcbb55105866","observation_id":"291c51a4-7d5c-46bf-b507-49027c432b08","resolution":{"observed_at":"2026-08-07T14:14:40.496653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.596642Z","title":"The hateful memes challenge: Detecting hate speech in multimodal memes","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.596642Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:3b990a5af143e1c0b232ff8b88ae1d0fffe1c64d5321aa7574d91b567a591c17","observation_id":"0811a0e4-3d0c-4eb8-be38-e8d78780461e","resolution":{"observed_at":"2026-08-07T14:14:40.596642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20124","last_updated":"2025-05-27T12:10:27Z","snapshot_observed_at":"2026-08-18T20:35:04.425130Z","submitted_at":"2025-05-26T15:24:06Z","title":"TUNA: Comprehensive Fine-grained Temporal Understanding Evaluation on Dense Dynamic Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20124","snapshot_observed_at":"2026-08-07T14:14:40.649758Z","title":"Tuna: Comprehensive fine-grained temporal understanding evaluation on dense dynamic videos.arXiv preprint arXiv:2505.20124, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.649758Z"},"links":{"cited_paper":"/paper/2505.20124","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9bf4b6e093d5135a5d494bfaa7f6628ffb4a286855805ef7358f9aadd5e80b7f","observation_id":"e0a6ae9e-06f8-4ccb-b4df-16bb641e9b7d","resolution":{"observed_at":"2026-08-07T14:14:40.649758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.710060Z","title":"Natural questions: a benchmark for question answering research.Transactions of the Association for Computational Linguistics, 7:453–466, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.710060Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:00cfafbdbb16a03a3e8d3f8770df5a85476cd7ab1c0887bb65b9ccf37ef9267e","observation_id":"6e1e8e44-c342-4aad-a0f8-f9dd659c04b4","resolution":{"observed_at":"2026-08-07T14:14:40.710060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:40.831458Z","title":"Llave: Large language and vision embedding models with hardness-weighted contrastive learning.arXiv preprint arXiv:2503.04812, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.831458Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a892017ccfc6eb773dcabb784fa4f379f7c54171df533385fbd4744f5d100757","observation_id":"28885696-1d45-4d01-9b13-455c7adb32cc","resolution":{"observed_at":"2026-08-07T14:14:40.831458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:14:40.926888Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:40.926888Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:3ab968774e11f1bc819615018d9bf5b14bfde06d02fb1fa20cee45ac7d19febf","observation_id":"655aff41-ce43-41c3-8937-eba3fd1e8898","resolution":{"observed_at":"2026-08-07T14:14:40.926888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.027258Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.027258Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:412dea9ff7c50aa83041d68b34e8eca4331310e7d035cd6901372e7dfb81b4e5","observation_id":"59753726-70b8-44bb-8bef-ba75c75e89e8","resolution":{"observed_at":"2026-08-07T14:14:41.027258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.096391Z","title":"Blip: Bootstrapping language- image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.096391Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:80774a45e2b42acd1c42d04df16087038cba7ab01a2a6f596e121d4ca7c5e7a3","observation_id":"5a365334-6104-47de-ad03-3b4afc2900d8","resolution":{"observed_at":"2026-08-07T14:14:41.096391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T14:14:41.208727Z","title":"Video- llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.208727Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:1d8823baa04e7572dcd12173a85ef7a721e780590a197b69cbe0b8b7ad6d3f4e","observation_id":"9f723ea6-4cd0-4cd6-a9d8-b15993af6316","resolution":{"observed_at":"2026-08-07T14:14:41.208727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-21T10:39:36.642494Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-08-07T14:14:41.299337Z","title":"Mm-embed: Universal multimodal retrieval with multimodal llms.arXiv preprint arXiv:2411.02571, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.299337Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:3b0af5ea22895183b04d20c6cffdba5491df1138a79b09e383e0f7657352b6b8","observation_id":"a6817cad-c2f1-499f-afc9-97037fc12468","resolution":{"observed_at":"2026-08-07T14:14:41.299337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.369793Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.369793Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:af48c03827a73b197b5374a8c185aa200f7dd93e6e3990546e997d646b74a971","observation_id":"67f62fc2-a81e-49fa-a515-6d3472ac5dd0","resolution":{"observed_at":"2026-08-07T14:14:41.369793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00954","last_updated":"2025-04-01T16:47:20Z","snapshot_observed_at":"2026-08-16T12:44:53.392310Z","submitted_at":"2025-04-01T16:47:20Z","title":"IDMR: Towards Instance-Driven Precise Visual Correspondence in Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00954","snapshot_observed_at":"2026-08-07T14:14:41.513558Z","title":"Idmr: Towards instance-driven precise visual correspondence in multimodal retrieval.arXiv preprint arXiv:2504.00954, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.513558Z"},"links":{"cited_paper":"/paper/2504.00954","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:6d1f5cdd56f6e6322d102ec5ec4708e2bf7ebe4304d61177cf21c6b119caeafc","observation_id":"551991ec-7975-4641-a0f8-c7238f90f6df","resolution":{"observed_at":"2026-08-07T14:14:41.513558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03743","last_updated":"2021-09-13T18:53:35Z","snapshot_observed_at":"2026-08-20T07:28:03.626531Z","submitted_at":"2020-10-08T03:07:00Z","title":"Visual News: Benchmark and Challenges in News Image Captioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03743","snapshot_observed_at":"2026-08-07T14:14:41.573083Z","title":"Visual news: Benchmark and challenges in news image captioning.arXiv preprint arXiv:2010.03743, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.573083Z"},"links":{"cited_paper":"/paper/2010.03743","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:70b829316d5025ecf9900fb3bfc148ab0b0f9830f0872abce7a8967f85fea904","observation_id":"e83cd7ee-0e9e-4b0d-a869-07c9dd7e76c4","resolution":{"observed_at":"2026-08-07T14:14:41.573083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.612473Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.612473Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e7ca47dbd0153d686a2a0fd6a3b60cf63aca7a31145f5d9714184034e9faff60","observation_id":"b3c57bc6-8e15-40d9-96aa-0c7f592a4b37","resolution":{"observed_at":"2026-08-07T14:14:41.612473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.651069Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, January 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.651069Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:1c9fe8fd759963aa4487b4cb4484fb2a9110a222b5da1c0d1dbc6f0519e4b6c5","observation_id":"659449bb-740b-47ae-9b37-96afcaccccd4","resolution":{"observed_at":"2026-08-07T14:14:41.651069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.752801Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.752801Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:eeee8d28edab3411d087a3fa94170ccc7f75e28a9f4c6185912b5f3b2aabd480","observation_id":"8f85b993-5da8-47b3-b77c-2a1152f5dbe7","resolution":{"observed_at":"2026-08-07T14:14:41.752801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.844748Z","title":"Llava-plus: Learning to use tools for creating multimodal agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.844748Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a5ab42efdec402583f13e506a8533c1cf064ab43546b0544cd72f53d5fab28e9","observation_id":"7908fffa-9e17-4bd0-af99-c05ba6b87985","resolution":{"observed_at":"2026-08-07T14:14:41.844748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01720","last_updated":"2024-12-02T17:10:16Z","snapshot_observed_at":"2026-08-20T06:53:55.631024Z","submitted_at":"2024-12-02T17:10:16Z","title":"LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01720","snapshot_observed_at":"2026-08-07T14:14:41.923753Z","title":"Lamra: Large multimodal model as your advanced retrieval assistant.arXiv preprint arXiv:2412.01720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.923753Z"},"links":{"cited_paper":"/paper/2412.01720","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:46e165a8a1490d4752b8502c884cc17f42956283f89d8ea86a57015b3149d8b6","observation_id":"923723cb-467f-45db-a2a1-8559ab4dc228","resolution":{"observed_at":"2026-08-07T14:14:41.923753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:41.986061Z","title":"Image retrieval on real-life images with pre-trained vision-and-language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:41.986061Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a673a0080bcfb074e4e7a6de8c3944f9244daeea20ef4ce9b9566043ae14865a","observation_id":"260b0014-20bc-4880-bd2e-ddd6d1537b45","resolution":{"observed_at":"2026-08-07T14:14:41.986061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.063940Z","title":"Generative multi-modal knowledge retrieval with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.063940Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:599932f450f6c80f4232849db3ad8fc1151643db59ac3faf37f5f0fa4aaf968f","observation_id":"a94f9504-f8e7-4bac-8e61-eff261c60a71","resolution":{"observed_at":"2026-08-07T14:14:42.063940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.139537Z","title":"End-to-end knowl- edge retrieval with multi-modal queries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.139537Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:811276cbd3972ac4928e642bb0bb9d13a8c67c352cd552f44db16c9446b52d2f","observation_id":"ee3f2b50-ba0a-43d5-a43c-54a563afc47a","resolution":{"observed_at":"2026-08-07T14:14:42.139537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.196435Z","title":"Video-rag: Visually-aligned retrieval-augmented long video comprehension.arXiv preprint arXiv:2411.13093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.196435Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:b1a36601c4da7e3d5cbec13b6d76c6db89e531680dee433e866809b14d0dc338","observation_id":"6eeb2464-83a1-42c9-a2e2-7903dc66dde8","resolution":{"observed_at":"2026-08-07T14:14:42.196435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.277212Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.277212Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:953f945c3d1b6c7a7d1fffbd8b9d7b4951b1cb26c2606b184a6bed6754901f04","observation_id":"6b2f095a-1e1e-4972-9c8b-953e279d9a02","resolution":{"observed_at":"2026-08-07T14:14:42.277212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09418","last_updated":"2024-06-13T17:59:59Z","snapshot_observed_at":"2026-08-19T08:26:06.209110Z","submitted_at":"2024-06-13T17:59:59Z","title":"VideoGPT+: Integrating Image and Video Encoders for Enhanced Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09418","snapshot_observed_at":"2026-08-07T14:14:42.381843Z","title":"Videogpt+: Integrating image and video encoders for enhanced video understanding.arXiv preprint arXiv:2406.09418,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.381843Z"},"links":{"cited_paper":"/paper/2406.09418","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:56865741779993df5eff1a1bd9ccea49fe1899d4f870dc52eb0624d75c1eed6e","observation_id":"d8e194b3-da69-47a2-a2ad-e01cec6593b6","resolution":{"observed_at":"2026-08-07T14:14:42.381843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.469662Z","title":"Ok-vqa: A visual question answering benchmark requiring external knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.469662Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e8e3b60593a1d31ae59f9f996ad0e1b2777a8968214fafd32cec1436bc8243df","observation_id":"4ab821c6-af25-475e-8c26-7541f1f79ee4","resolution":{"observed_at":"2026-08-07T14:14:42.469662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.534731Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.534731Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:bdb2c8d05067c58791f23f672ef5e18dbf4a8c0e3df62d3f53d25b8cc73be538","observation_id":"e2b4ea5b-3fde-419d-a747-7179956369f7","resolution":{"observed_at":"2026-08-07T14:14:42.534731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.612365Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.612365Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:e76f2ad8b1fcaa5775868e6a0b9e93f6ccb4a74966f62f8835695d589fcfecbd","observation_id":"023bd09b-026c-499f-8603-90db05775295","resolution":{"observed_at":"2026-08-07T14:14:42.612365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:42.664676Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.664676Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:ca515731b945f9f1ea7497c7715d6aed1a39e4ff1a87204e6967860c26b2f0d1","observation_id":"c140d83b-3342-4e5b-a369-99b7ede44866","resolution":{"observed_at":"2026-08-07T14:14:42.664676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:55.451662Z","title":"Mm1: methods, analysis and insights from multimodal llm pre-training","venue":null,"work_id":"a2addd76-a36b-489c-b6d2-c51f1c683b2b","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.732833Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:8980b4ab425ac6e9c3881bda6cd67c0ada5221dedd20a32a8d7c51d068d40beb","observation_id":"4d78713e-fe65-4b1c-b9c1-1e0f20828970","resolution":{"observed_at":"2026-08-07T14:14:55.493208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:55.301702Z","title":"Docci: Descriptions of connected and contrasting images","venue":null,"work_id":"403132c8-1a9b-47a8-9c45-0514a42a8a8b","year":null},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.803646Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a9610d586ade176bfe98b24ae1c376d241b0918796768e9a177e3394f7ed461b","observation_id":"ced10b56-ccc6-4d8e-a033-eb1cce907549","resolution":{"observed_at":"2026-08-07T14:14:55.391113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-08-14T18:53:38.574749Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T14:14:42.931680Z","title":"Representation learning with contrastive predictive coding.arXiv preprint arXiv:1807.03748, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.931680Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:a47f96a1e2d99526d3bbcb9a707c0dafdcff514285a7f3f6318762c6f1a5bf26","observation_id":"49df6ac7-3954-48eb-b100-f5fc6a1d8b9b","resolution":{"observed_at":"2026-08-07T14:14:42.931680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02992","last_updated":"2024-04-26T01:24:57Z","snapshot_observed_at":"2026-08-16T14:55:02.836558Z","submitted_at":"2023-10-04T17:28:44Z","title":"Kosmos-G: Generating Images in Context with Multimodal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02992","snapshot_observed_at":"2026-08-07T14:14:42.998277Z","title":"Kosmos- g: Generating images in context with multimodal large language models.arXiv preprint arXiv:2310.02992, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:42.998277Z"},"links":{"cited_paper":"/paper/2310.02992","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:abd551cffc61e72c16dcb19b5f8cb7552c1691151b7e8626c4263c3632ba7c79","observation_id":"0b9d012b-7ae5-462b-905a-907bb39c1e1c","resolution":{"observed_at":"2026-08-07T14:14:42.998277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:55.155801Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":"278e484f-23ab-42bb-8c0d-796f2cb06265","year":2015},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.085408Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:fb8c3f3b75116ee59e1b46131701f20fe05507249f4d4bb5aebebddc737b9e3d","observation_id":"d4c51ae5-fb47-48a0-91db-1ed9642c553b","resolution":{"observed_at":"2026-08-07T14:14:55.208547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.980937Z","title":"Filtering, distillation, and hard negatives for vision-language pre-training","venue":null,"work_id":"b9da9e9d-0b33-4dfc-b304-4ca32f134506","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.158713Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:cd40f87df1d438e787a5915c24ee515b01afde81b869c761fffba77cf24fb3d8","observation_id":"5496358f-8197-43d5-854a-cab5644921b9","resolution":{"observed_at":"2026-08-07T14:14:55.069133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.622831Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"5c389ac2-953c-41b5-909b-c6a5af7ba45d","year":2021},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.236786Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:1d3b4449325406a376c80df9d99712b39c96794273af5fc095a0386d8e378359","observation_id":"ca105a17-df5a-4e29-84df-50b64bd82dc9","resolution":{"observed_at":"2026-08-07T14:14:54.824769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.315704Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":"d55097f4-bb24-45c3-acfc-96cb5c74b697","year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.286893Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:97016924271d79ab2641959b621784d2ef22e417f3279a67600beb8795584a87","observation_id":"e597097e-88f1-46d8-b812-e0d643ff95d8","resolution":{"observed_at":"2026-08-07T14:14:54.517715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04592","last_updated":"2021-01-24T22:19:30Z","snapshot_observed_at":"2026-08-18T17:53:57.208912Z","submitted_at":"2020-10-09T14:18:53Z","title":"Contrastive Learning with Hard Negative Samples","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04592","snapshot_observed_at":"2026-08-07T14:14:43.344779Z","title":"Contrastive learning with hard negative samples.arXiv preprint arXiv:2010.04592, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.344779Z"},"links":{"cited_paper":"/paper/2010.04592","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5a585f53d3dd25e31ca3356daccbde5ff9518ab86157ae1dc7e05b16a41482ea","observation_id":"e021a51d-e594-4c22-9eb9-a07b0d2b105e","resolution":{"observed_at":"2026-08-07T14:14:43.344779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:54.065911Z","title":"Pic2word: Mapping pictures to words for zero-shot composed image retrieval","venue":null,"work_id":"90fa1632-f6d6-4553-bc8c-b8d95caf394d","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.400909Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:6db327592fd2720d3d615ac85088c00dcbe12e4046d08472a9ed3aae8ec2b69c","observation_id":"465889c8-cf34-48ac-9603-90480d251467","resolution":{"observed_at":"2026-08-07T14:14:54.171773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.790510Z","title":"Laion- 5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"92b2f4cd-040a-48d5-8ce7-be938f0b9215","year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.456451Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:9e67172022598cc1540c30ee97c9ca40435b7fa523f11507564b11dfec293566","observation_id":"9c0da33c-6771-4f97-be58-70b508e1a057","resolution":{"observed_at":"2026-08-07T14:14:53.924513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.600561Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":"464bea7e-e211-425d-8972-06cb7a289498","year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.506063Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:d3292659ad9c379f0c333ad53453de452680ca3baedcc090ed1af9a75262a528","observation_id":"410094f7-2180-4340-a721-0811d9523df3","resolution":{"observed_at":"2026-08-07T14:14:53.690728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T14:14:43.554578Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.554578Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:6c493f5fc6f247f8c8a094f5cd125a4c425333f962c436cbc747fc8edb1b2386","observation_id":"1393e73d-2486-4a8e-9db2-783e9b418355","resolution":{"observed_at":"2026-08-07T14:14:43.554578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.413619Z","title":"Composed video retrieval via enriched context and discriminative embeddings","venue":null,"work_id":"f2ac1da6-34ad-4458-bfc5-f9a95d0d3fa3","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.611833Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:15c207bc5079b2b4fe54eef1ce7b8ecb7e5c117f80c40af093fb6bc2ce287ede","observation_id":"4fc5fba1-6b55-444f-83ac-485e825a272f","resolution":{"observed_at":"2026-08-07T14:14:53.527330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:53.158097Z","title":"Fever: a large-scale dataset for fact extraction and verification","venue":null,"work_id":"31ab4e7f-1134-4afe-a0ad-5188ecd2455c","year":2018},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.665331Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:6409d82ec890ab0ad9c04c382e8da67496911bb5511b65841467d0822823b083","observation_id":"9ddbad45-f0bd-4905-afec-10a0b6c37f36","resolution":{"observed_at":"2026-08-07T14:14:53.281847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.913421Z","title":"Covr-2: Automatic data construction for composed video retrieval.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":"45ae2bf0-4dfc-444c-bfd2-3b4997a6de84","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.745704Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:30279caacdd921cdc42dbf79446da3c7d016bc5efbedabb8b013f8291715537a","observation_id":"7e49834f-8235-49d4-ab1a-589f9b41a9d2","resolution":{"observed_at":"2026-08-07T14:14:53.036132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.724076Z","title":"Covr: Learning composed video retrieval from web video captions","venue":null,"work_id":"878b7cb6-dc5c-4d16-a97b-a3364d861d77","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:43.885501Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:13baabb4d3485849b1bd0ded9a523674f193c8e4c1adf6c35ede87404c4fd34c","observation_id":"43ac363e-3f70-45b1-b50d-cb55d8b92e58","resolution":{"observed_at":"2026-08-07T14:14:52.799218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00634","last_updated":"2024-09-24T04:41:08Z","snapshot_observed_at":"2026-08-16T13:38:25.179414Z","submitted_at":"2024-06-30T09:21:01Z","title":"Tarsier: Recipes for Training and Evaluating Large Video Description Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00634","snapshot_observed_at":"2026-08-07T14:14:44.083171Z","title":"Tarsier: Recipes for training and evaluating large video description models.arXiv preprint arXiv:2407.00634, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.083171Z"},"links":{"cited_paper":"/paper/2407.00634","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:aaa026f6c375216410399a2917a9c0db4cf942edf2cdac4b5a8fd29b311095be","observation_id":"4165373e-c41e-4f73-bb44-aa18251c6109","resolution":{"observed_at":"2026-08-07T14:14:44.083171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06215","last_updated":"2016-07-21T07:20:44Z","snapshot_observed_at":"2026-08-19T21:26:38.596841Z","submitted_at":"2016-07-21T07:20:44Z","title":"A Comprehensive Survey on Cross-modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06215","snapshot_observed_at":"2026-08-07T14:14:44.181075Z","title":"A comprehensive survey on cross-modal retrieval.arXiv preprint arXiv:1607.06215, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.181075Z"},"links":{"cited_paper":"/paper/1607.06215","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:721771e53b2eaa7547bee03e8508d78caac5dbd6f7f53d3de68798261e39d802","observation_id":"fa90b388-4267-4933-acb7-be02d1deee11","resolution":{"observed_at":"2026-08-07T14:14:44.181075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T14:14:44.311504Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.311504Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:8e9f9ba834ffcc39c88aa381f8de65aeb3c6b1e58674692a38daa80c0656fb75","observation_id":"112d2fbc-dfce-415c-9cee-36e5875b4c65","resolution":{"observed_at":"2026-08-07T14:14:44.311504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.510602Z","title":"Fvqa: Fact-based visual question answering.IEEE Transactions on Pattern Analysis and Machine Intelligence, 40(10):2413–2427, 2017","venue":null,"work_id":"b508cb1e-de24-46f5-92af-e11253123de8","year":2017},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.452960Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:3de2cd35ff1a61150ede64db65ed7c1ad9238047b2b5461dc777703aef81048d","observation_id":"00e1ee86-7f82-4c3e-9637-2ac103fc5528","resolution":{"observed_at":"2026-08-07T14:14:52.620569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.331029Z","title":"Cross- modal retrieval: a systematic review of methods and future directions.Proceedings of the IEEE, 2025","venue":null,"work_id":"7315282b-7593-4a5f-a840-f86ff7301b94","year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.602734Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:4d8f43f94ed5e3ce16152236f16f3140c28650492404cb571f64686484275f63","observation_id":"f7e16bdf-8b49-4887-aea7-5fe6a581e0f8","resolution":{"observed_at":"2026-08-07T14:14:52.402528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:52.083149Z","title":"Internvid: A large-scale video-text dataset for multimodal understanding and generation","venue":null,"work_id":"75b8c8cc-1ba5-4476-a7c9-7d88d3879508","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.751774Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:24f5c1ad63a9aca8b1ba6dbe6511462bf19f14fd1db1497ca7fbf9ea02df968c","observation_id":"22241213-305e-4750-a912-386dc00fafc9","resolution":{"observed_at":"2026-08-07T14:14:52.210759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.885577Z","title":"Internvideo2: Scaling foundation models for multimodal video understanding","venue":null,"work_id":"aa44966f-922b-4983-8e10-72868f427548","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:44.896788Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:224be0b2366e6ecb29ca1970f6bd55da4be9cf160e517d1cf628719186805f13","observation_id":"1ccdfecc-be1c-4081-870d-5ebf432c8179","resolution":{"observed_at":"2026-08-07T14:14:51.966932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-08-19T18:30:11.337554Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03191","snapshot_observed_at":"2026-08-07T14:14:45.013607Z","title":"Internvideo: General video foundation models via generative and discriminative learning.arXiv preprint arXiv:2212.03191, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.013607Z"},"links":{"cited_paper":"/paper/2212.03191","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:105daddaff8f75502a644d8e97b417321e8c744f119c03b6a928d749f54c152e","observation_id":"c92fe79b-13d1-4bc5-a59a-c97df7637a2d","resolution":{"observed_at":"2026-08-07T14:14:45.013607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12386","last_updated":"2025-07-13T18:57:17Z","snapshot_observed_at":"2026-08-06T07:17:05.291678Z","submitted_at":"2025-01-21T18:59:00Z","title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12386","snapshot_observed_at":"2026-08-07T14:14:45.104101Z","title":"Internvideo2","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.104101Z"},"links":{"cited_paper":"/paper/2501.12386","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:2f5ef984249a4b023d81f86bf64b5c8c944a48707909efd09fabccbc09805274","observation_id":"f54c8e76-bdc0-480b-9fc8-a497a0ec08de","resolution":{"observed_at":"2026-08-07T14:14:45.104101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11895","last_updated":"2024-07-16T16:24:31Z","snapshot_observed_at":"2026-08-16T13:33:41.891783Z","submitted_at":"2024-07-16T16:24:31Z","title":"OmniBind: Large-scale Omni Multimodal Representation via Binding Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11895","snapshot_observed_at":"2026-08-07T14:14:45.187968Z","title":"Omnibind: Large-scale omni multimodal representation via binding spaces.arXiv preprint arXiv:2407.11895, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.187968Z"},"links":{"cited_paper":"/paper/2407.11895","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:da8354ff3229bdd5170a82c0f3e35598c08926711e197f6949dd42f8a6ebd1b2","observation_id":"e20025dc-ed00-4245-aed1-d7b7f54c7576","resolution":{"observed_at":"2026-08-07T14:14:45.187968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.685648Z","title":"N24news: A new dataset for multimodal news classification","venue":null,"work_id":"07f5fe1a-e9c8-4392-b267-abc4f0c15e07","year":2022},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.273016Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:7c5401143b0b97c86662145e09410efef4656b9c4a19196c7bd65c5c90180005","observation_id":"4dc596e4-9b13-4caa-9b6a-29a932e200f5","resolution":{"observed_at":"2026-08-07T14:14:51.794730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.514776Z","title":"Uniir: Training and benchmarking universal multimodal information retrievers","venue":null,"work_id":"34061f01-83d6-4edd-8eef-7bd9382106c7","year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.369387Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:81228f1cb5443e5205acee3699bf1d956b77245da2d00bc4e9a3345efc383369","observation_id":"2c6dc2a6-8756-4a3a-bc80-de2df8aaa6c1","resolution":{"observed_at":"2026-08-07T14:14:51.598369Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.339906Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"13b27ca3-8839-4c7e-85f4-2418c1f23054","year":2010},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.437690Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:05d6259f26a0a52bfc652efb6fa2c3a3c507a8483d147fe1831b69224c52eac0","observation_id":"0ccbf610-017b-47cf-a0cf-93ed9d61fcfd","resolution":{"observed_at":"2026-08-07T14:14:51.405208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00808","last_updated":"2020-10-20T22:17:19Z","snapshot_observed_at":"2026-08-13T17:48:59.734798Z","submitted_at":"2020-07-01T23:15:56Z","title":"Approximate Nearest Neighbor Negative Contrastive Learning for Dense Text Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00808","snapshot_observed_at":"2026-08-07T14:14:45.558531Z","title":"Approximate nearest neighbor negative contrastive learning for dense text retrieval.arXiv preprint arXiv:2007.00808, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.558531Z"},"links":{"cited_paper":"/paper/2007.00808","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:eafddeecc00770df6f0ea4e7e42b326dc94b3a0529946d315730da1c58046cc6","observation_id":"b10f7c85-ecde-490e-acd6-857b03f829f8","resolution":{"observed_at":"2026-08-07T14:14:45.558531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:51.165956Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"109b560f-413b-41d1-83a0-52b20e484cec","year":2016},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.631311Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:3eba74f53a91a967b9735ae8a989e13ea3059d9fe1ae45e823591235eeff5873","observation_id":"fafc94c8-f7eb-405c-bbee-bdbf296ecd29","resolution":{"observed_at":"2026-08-07T14:14:51.233064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-07T14:14:45.703524Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning.arXiv preprint arXiv:2404.16994, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.703524Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:416de0cfd1787b70de1bf521b27671b55053a6ad853a4b13f6f6552acd7e7e83","observation_id":"731ad417-6323-44dd-8cd0-da784f786d16","resolution":{"observed_at":"2026-08-07T14:14:45.703524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00513","last_updated":"2025-03-18T16:01:24Z","snapshot_observed_at":"2026-08-17T17:48:40.303977Z","submitted_at":"2024-12-31T15:53:50Z","title":"CaReBench: A Fine-Grained Benchmark for Video Captioning and Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00513","snapshot_observed_at":"2026-08-07T14:14:45.772749Z","title":"Fine-grained video-text retrieval: A new benchmark and method.arXiv preprint arXiv:2501.00513, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.772749Z"},"links":{"cited_paper":"/paper/2501.00513","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:5af52b8cb4163059bc131e7cf401cc04424f1814980b1d812049d4a91b73b2e8","observation_id":"ff5b82ca-a31b-43ae-aebe-5614bf80505d","resolution":{"observed_at":"2026-08-07T14:14:45.772749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-17T01:54:11.006899Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T14:14:45.839239Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering.arXiv preprint arXiv:1809.09600, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.839239Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:f9559e682656ed9ffb44f62ff2b23046c3cd72c534b5b0d165dba4b65a676e15","observation_id":"5f71f51c-5bf3-4289-8e15-5670d5225064","resolution":{"observed_at":"2026-08-07T14:14:45.839239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:14:50.887260Z","title":"End-to-end multimodal fact-checking and explanation generation: A challenging dataset and models","venue":null,"work_id":"e30979ee-7fee-4919-b040-28f8a8744539","year":2023},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:45.930404Z"},"links":{"citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c337caafdf9c037443ada16ee49d1d3edbe02cf26a02f55488b6f4a3ab66eb9b","observation_id":"0da0f99f-033f-4503-b951-6c6d25f52ded","resolution":{"observed_at":"2026-08-07T14:14:51.025254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-08-21T07:48:51.700518Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T14:14:46.015018Z","title":"Minicpm-v: A gpt-4v level mllm on your phone.arXiv preprint arXiv:2408.01800, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.015018Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:dd0569f93b93238b3a31c9d943a4d8140bd66fd0a75289cb5a28af943838ddbe","observation_id":"0b5c142e-69e9-4709-91ce-7bed037176bb","resolution":{"observed_at":"2026-08-07T14:14:46.015018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19900","last_updated":"2025-03-25T17:57:17Z","snapshot_observed_at":"2026-08-20T18:32:28.321496Z","submitted_at":"2025-03-25T17:57:17Z","title":"CAFe: Unifying Representation and Generation with Contrastive-Autoregressive Finetuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19900","snapshot_observed_at":"2026-08-07T14:14:46.090733Z","title":"Cafe: Unifying representation and generation with contrastive-autoregressive finetuning.arXiv preprint arXiv:2503.19900, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval","version":2},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T14:14:46.090733Z"},"links":{"cited_paper":"/paper/2503.19900","citing_paper":"/paper/2505.19650"},"observation_digest":"sha256:c5a271717b1e1929e6a6876e5d4cc0abb098142be1cff3bf85a17e842a60240d","observation_id":"25d936f7-e057-4d04-b373-1597cff5eec4","resolution":{"observed_at":"2026-08-07T14:14:46.090733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19650","last_updated":"2025-05-27T11:57:17Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T17:49:48.523840Z","submitted_at":"2025-05-26T08:09:44Z","title":"Modality Curation: Building Universal Embeddings for Advanced Multimodal Information Retrieval"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":78,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":120},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 120 outbound references and 12 inbound Pith citation observations for arXiv:2505.19650."}