{"as_of":"2026-08-09T11:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4acf4ccf923aa646a08a7d55ed5761bb99cd1b299b0c304384ab26d9b9e65799","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:25:12.449077Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T00:49:19.252122Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T22:52:20.935555Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2407.12580"},"observation_digest":"sha256:0345f21b6574f2248cf62b22f900a98144720f98dad24973c01b6570cf676c39","observation_id":"e78c84d3-b0fa-4346-abd8-c07bf685350a","resolution":{"observed_at":"2026-05-16T22:52:21.010148Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-08-08T12:25:12.449077Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07555","last_updated":"2025-02-12T03:33:06Z","snapshot_observed_at":"2026-08-08T12:18:01.094635Z","submitted_at":"2025-02-11T13:48:10Z","title":"O1 Embedder: Let Retrievers Think Before Action","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T12:25:12.449077Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2502.07555"},"observation_digest":"sha256:0f7b942ec0a4407146b66218ea56fdac829b4142b325f942b5ae9011fafa0fd4","observation_id":"5224de59-74ab-49fe-bb42-b9ca6e9f4159","resolution":{"observed_at":"2026-08-08T12:25:12.449077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2512.13511","last_updated":"2026-05-01T11:23:38Z","snapshot_observed_at":"2026-07-06T22:39:04.164003Z","submitted_at":"2025-12-15T16:38:59Z","title":"Adapting MLLMs for Nuanced Video Retrieval","version":3},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-05-16T22:20:09.051957Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2512.13511"},"observation_digest":"sha256:a78201fc26b7736dda7503ef9d1344e00c5ecaed85f8b480d521734ffce3c19d","observation_id":"527ce582-fe2c-4f10-88d6-e09feb5f7953","resolution":{"observed_at":"2026-05-16T22:21:18.859394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2601.21262","last_updated":"2026-04-16T06:59:30Z","snapshot_observed_at":"2026-07-29T16:09:50.031781Z","submitted_at":"2026-01-29T04:47:27Z","title":"CausalEmbed: Auto-Regressive Multi-Vector Generation in Latent Space for Visual Document Embedding","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T10:14:15.589472Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2601.21262"},"observation_digest":"sha256:96552dd1485b297ed49ed3487f6b65b82fa7644fbfc975135dbcc1c1a9e09b40","observation_id":"62fa00f9-d82b-4ced-a41e-43fc4c60dcbe","resolution":{"observed_at":"2026-05-16T10:17:44.622251Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-08-02T19:41:35.218371Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:35.218371Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:fc6170c85c98e38844845232d85c2a52e617de27a1aad3ecc50a46ca3fa32630","observation_id":"79da0965-9f65-40f9-9e30-40f02bcb645f","resolution":{"observed_at":"2026-08-02T19:41:35.218371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2604.27600","last_updated":"2026-04-30T08:50:03Z","snapshot_observed_at":"2026-07-06T23:13:02.921765Z","submitted_at":"2026-04-30T08:50:03Z","title":"Purifying Multimodal Retrieval: Fragment-Level Evidence Selection for RAG","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-07T07:19:44.125479Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2604.27600"},"observation_digest":"sha256:3d42abfbb672c5686c3a3e1050404d2f9a5d01f1003ac4bcc8c1b809ba44526e","observation_id":"06be4929-c3df-439c-8cd8-4a42f4069f70","resolution":{"observed_at":"2026-05-12T10:11:28.170740Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:c9b418a64a9da3cc33e1c64263d5533e855a8e3e8621a83fb507b35dc1ee4382","observation_id":"0ce5236c-ea7f-4cb5-88f4-1e587a8e86e5","resolution":{"observed_at":"2026-06-30T13:24:40.423530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:de5ad517802b4eb0325deb415f5b04aa9f313684b17f7970498f47dd865138a9","observation_id":"c764cc1d-0431-4631-ac7a-56970e5dd1b3","resolution":{"observed_at":"2026-07-04T00:49:19.255293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-08-06T00:31:17.822604Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-09T05:39:24.148874Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:31:17.822604Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:225de0cab1323858453065e40b1ba9a3b90521cf5e99b0fe7338432d098d6c37","observation_id":"39f0b923-903b-4568-9ae5-62839bfda0a8","resolution":{"observed_at":"2026-08-06T00:31:17.822604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-08-06T04:19:53.886239Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01147","last_updated":"2026-08-05T14:42:29Z","snapshot_observed_at":"2026-08-09T05:39:24.148874Z","submitted_at":"2026-08-02T10:57:53Z","title":"UniHEAR: Unified Heterogeneous-Source Attentive Retrieval for Knowledge-Based Visual Question Answering","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T04:19:53.886239Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2608.01147"},"observation_digest":"sha256:147572f204b30a1f95880dd4cefeac849137148080885abe8e4f1fdda19a0d70","observation_id":"cac9af94-b7cd-47cc-baff-5f9517ab36f1","resolution":{"observed_at":"2026-08-06T04:19:53.886239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.04292/citation-record","integrity":"/paper/2406.04292/integrity","json":"/paper/2406.04292/citation-record.json","paper":"/paper/2406.04292"},"outbound":[],"paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","latest_version":1,"primary_category":"cs.IR","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2406.04292."}