{"as_of":"2026-08-22T02:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a35360a65d87ab325672dbb4c470f1c498422c8f0ad9f2d62e7a6fcecc4ead82","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:06:09.196053Z","state":"measured"},{"denominator":81,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":81,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T22:42:53.631688Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-09T22:44:14.780765Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"cited_work":{"arxiv_id":"2509.08897","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08897","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InICML, pages 59403– 59420","venue":null,"work_id":"9a0e403d-8896-49f6-b3cc-78f6bcf966b6","year":2025},"citing_paper":{"arxiv_id":"2604.21806","last_updated":"2026-04-24T09:24:52Z","snapshot_observed_at":"2026-08-11T03:18:31.302295Z","submitted_at":"2026-04-23T16:03:12Z","title":"TEMA: Anchor the Image, Follow the Text for Multi-Modification Composed Image Retrieval","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-09T22:42:53.631688Z"},"links":{"cited_paper":"/paper/2509.08897","citing_paper":"/paper/2604.21806"},"observation_digest":"sha256:bc2b7cf1cc271efebc300afa93ebb6142e708d3d4cbfabfd8ef85c162fb8b21e","observation_id":"ac02a269-313c-4e29-8430-233915e576f7","resolution":{"observed_at":"2026-05-09T22:44:14.781939Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08897/citation-record","integrity":"/paper/2509.08897/integrity","json":"/paper/2509.08897/citation-record.json","paper":"/paper/2509.08897"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:08.992069Z","title":"UniIR: Training and Benchmarking Universal Multimodal Information Retrievers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:08.992069Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:60480872354a37e0f902eae59f8592b6322ad5cb861d4c7a13f3fd6b99576c46","observation_id":"a8ca069a-18d3-4f2d-bdde-f7af3d8a7937","resolution":{"observed_at":"2026-08-04T20:06:08.992069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:08.995641Z","title":"Recurrence-Enhanced Vision-and-Language Transformers for Robust Multimodal Document Retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:08.995641Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:4e376d5e8e86dd8beb79bac1a2b921b80018701bd0e737ace795e7332776fed6","observation_id":"1792502f-5eb9-4515-87fa-835e6cbb704f","resolution":{"observed_at":"2026-08-04T20:06:08.995641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.09118","last_updated":"2022-08-29T12:17:32Z","snapshot_observed_at":"2026-08-14T13:19:21.742321Z","submitted_at":"2021-12-16T18:57:37Z","title":"Unsupervised Dense Information Retrieval with Contrastive Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.09118","snapshot_observed_at":"2026-08-04T20:06:08.998658Z","title":"Unsupervised Dense Information Retrieval with Con- trastive Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:08.998658Z"},"links":{"cited_paper":"/paper/2112.09118","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:92f0dc85421300a3242df797a2cb8415c043abdb39d810b0290e0b5cfbaee6ef","observation_id":"d988b9ac-49cb-4cab-ad37-be7dba9ddbf7","resolution":{"observed_at":"2026-08-04T20:06:08.998658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.001940Z","title":"SIFT meets CNN: A decade survey of instance retrieval,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.001940Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:7e9767559dc80a3a54316a7ea343d1357ab1f697c6489a6762d4a1c5299b3bde","observation_id":"9f52a211-5a86-464f-9de6-8bae366df22a","resolution":{"observed_at":"2026-08-04T20:06:09.001940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.004839Z","title":"Large-scale image retrieval with attentive deep local features,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.004839Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:299897ec16eff7e0e3f4a992517f4e62aeb990de89ef7c602d6439a7c113cc31","observation_id":"4027c289-8b90-4620-8c5e-e6a302f4a09a","resolution":{"observed_at":"2026-08-04T20:06:09.004839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.007711Z","title":"Microsoft COCO: Common Objects in Context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.007711Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:ca5a24331c499b5588f2b82ae5936c1ca9b9a496f66b3435f5c9a3e10a4fb197","observation_id":"3bcd3642-679d-4a9c-a57a-3db334b70d0e","resolution":{"observed_at":"2026-08-04T20:06:09.007711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.010579Z","title":"Conceptual Captions: A Cleaned, Hypernymed, Image Alt-text Dataset For Automatic Image Captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.010579Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:f81beb357c3b3da1204a780f542b11e51f05e5378cfa7d7bdfa01f07dcfc4c5b","observation_id":"c6229284-f665-4841-a8de-c53b52abc0bc","resolution":{"observed_at":"2026-08-04T20:06:09.010579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.013128Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.013128Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:0d6cc326c0a793ad78cca8ac294bd27d0ea5f7d7b606cc14a5ca39b6e9475053","observation_id":"9c6b7e85-f9ea-489c-b3d6-381ce3ebfb15","resolution":{"observed_at":"2026-08-04T20:06:09.013128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.015687Z","title":"Learning Transferable Visual Models From Natural Language Super- vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.015687Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:024f04e28772ade4a351c1bd7ed60286bfa16592ce786e6df254c0ca57f7c302","observation_id":"52034a3c-ed93-4ad3-b8ff-0d46d790feb4","resolution":{"observed_at":"2026-08-04T20:06:09.015687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.018250Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.018250Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8e6f4e2b14ef564d90a8bddac50f1bd4a7bc5b086746396b7a22b641f386b7bf","observation_id":"bcc40c18-7530-4917-a83a-428a3dd8e3aa","resolution":{"observed_at":"2026-08-04T20:06:09.018250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.020900Z","title":"Reproducible scaling laws for contrastive language-image Learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.020900Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:3f8cc95d98097178e10194b49daae3d35a5458cf87c42b63c628a257b6f56cd2","observation_id":"582e9aad-f2a4-4d20-b248-f15f3818faf2","resolution":{"observed_at":"2026-08-04T20:06:09.020900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.023616Z","title":"Sigmoid Loss for Language Image Pre-Training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.023616Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8e95557b2ca43b7a3ce3862a5640668ae62dbaaf92d5f13109bcc08e7f134aae","observation_id":"b68572ae-dfbe-441f-b4fa-60882edb52e3","resolution":{"observed_at":"2026-08-04T20:06:09.023616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-04T20:06:09.026112Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Se- mantic Understanding, Localization, and Dense Features,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.026112Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:81afc93c47d8ff4e361dc9f08b8802a5b5dc3b8becafbf544de6eabe9fa6e334","observation_id":"20c5bc2a-2a8d-4ee2-b109-de938fac207d","resolution":{"observed_at":"2026-08-04T20:06:09.026112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.029205Z","title":"The Revolution of Multimodal Large Language Models: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.029205Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8b32bdcb2165dc4321d533b486e0c95cc27259966afaf24a1572ef75ef9a6981","observation_id":"73f81a17-c6d3-4a28-91d2-658463a6484e","resolution":{"observed_at":"2026-08-04T20:06:09.029205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.031635Z","title":"Improved Baselines with Visual Instruction Tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.031635Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:6530705f74fb124e3b54370843b4401e2065e8e0aee33d06422d2baec208974f","observation_id":"a126f73a-3fb9-487d-9bb9-5a99c99a4093","resolution":{"observed_at":"2026-08-04T20:06:09.031635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.034075Z","title":"LLaV A-MORE: A Comparative Study of LLMs and Visual Backbones for Enhanced Visual Instruction Tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.034075Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:eb8bc9ef55cbcd1b970ab1df922ca4f73edad063f72eb961e4a7f20b7b052d06","observation_id":"8e9a095f-918e-449f-a442-2f29cfd86a5e","resolution":{"observed_at":"2026-08-04T20:06:09.034075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T20:06:09.036465Z","title":"Qwen2.5-VL Technical Report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.036465Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:3e1257a6823b96c0c5e77c6f2691b28e085f595be51cb36f43445c3fa85897c0","observation_id":"5bdd6a16-d827-4f17-80e0-f86f9a32aa82","resolution":{"observed_at":"2026-08-04T20:06:09.036465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.039420Z","title":"PreFLMR: Scaling Up Fine- Grained Late-Interaction Multi-modal Retrievers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.039420Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:f0b7441f4c30124e96b9b960d69b3f505861d3fd8d2bacf58ea1f12ebb6a9912","observation_id":"b322d1b4-7979-4ddc-a319-2655e934f2be","resolution":{"observed_at":"2026-08-04T20:06:09.039420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.041750Z","title":"Can Pre-trained Vision and Language Models Answer Visual Information-Seeking Questions?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.041750Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:837cc5ff4199593261c97dcb0fa923b7506f92d1ac46bd3f20cd415b660acc5f","observation_id":"b593bbeb-fd40-4846-a029-dc65e6e78011","resolution":{"observed_at":"2026-08-04T20:06:09.041750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.044289Z","title":"Encyclopedic VQA: Visual questions about detailed properties of fine-grained categories,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.044289Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:730fe8df35b1fc1263271292f3b074ead93d6797e22b5597f52db5d913763134","observation_id":"331810db-6cb3-4ab9-9e6f-28a98cdfe718","resolution":{"observed_at":"2026-08-04T20:06:09.044289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.046723Z","title":"Long Short-Term Memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.046723Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:98c7d1798a227749e9071d1f08d82a437ddd53c4860eace8760b511b15009d91","observation_id":"d1f78b14-bd6b-433d-a01e-279da814e1f9","resolution":{"observed_at":"2026-08-04T20:06:09.046723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.049120Z","title":"Open-domain Visual Entity Recog- nition: Towards Recognizing Millions of Wikipedia Entities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.049120Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:4ceab5b2054f1501acd9724e224642ae1498c06dc3003341c8854f501c40470a","observation_id":"7d6f6d1d-d359-4f7c-a9b7-b837ce3adae3","resolution":{"observed_at":"2026-08-04T20:06:09.049120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.051455Z","title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.051455Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:3b31bff07407cd74ee9861e411f5ad5984106e7de71cec65a06722f05515ca08","observation_id":"1a048ac7-65df-49ee-948d-709bc298ce4d","resolution":{"observed_at":"2026-08-04T20:06:09.051455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T20:06:09.054038Z","title":"EV A-CLIP: Improved Training Techniques for CLIP at Scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.054038Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:78c824d60e0bf063aa2edd21eb9c822d5bb4ed85990f998dff06ab487e6d104d","observation_id":"91419f0c-a081-47d8-a75b-c9473fdbcc9b","resolution":{"observed_at":"2026-08-04T20:06:09.054038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.056915Z","title":"Flickr30k Entities: Collecting Region-to-Phrase Correspondences for Richer Image-to-Sentence Models,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.056915Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:4d22a4eb63d709f7145740332df8e61ad0fdfd10940e98817185386c7f1d075a","observation_id":"950f727c-63a1-4901-9867-b64af77b98f7","resolution":{"observed_at":"2026-08-04T20:06:09.056915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.059565Z","title":"Image Retrieval on Real-Life Images With Pre-Trained Vision-and-Language Models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.059565Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:274bb5f07aff8bdf6896ca4f3a36cfeef96232da209ac32a5410db752dd5040a","observation_id":"ed794539-b2af-427d-8e46-55940d9d77e1","resolution":{"observed_at":"2026-08-04T20:06:09.059565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.062053Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.062053Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8edce43ba5bebd04cf257973059e26f0efa35f651c6910a77879a256494be656","observation_id":"5d1b67ac-a3ea-4d46-8727-c550582c3394","resolution":{"observed_at":"2026-08-04T20:06:09.062053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.064447Z","title":"Thinking Fast and Slow: Efficient Text-to-Visual Retrieval With Transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.064447Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:2c3934ab9a515b4a0ad0807ec27bee01312183d94500bbd9209c08c7338aa610","observation_id":"b273f406-2d24-4385-a4b2-1b714b2a8435","resolution":{"observed_at":"2026-08-04T20:06:09.064447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.066886Z","title":"Smooth-AP: Smoothing the Path Towards Large-Scale Image Retrieval,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.066886Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:54bdb85c333b5b5e750efaa11cf4cdc96be1ef2f135d7803d4c356e7a18324b1","observation_id":"4e0da6de-bfea-4d8a-9317-224bae26ae74","resolution":{"observed_at":"2026-08-04T20:06:09.066886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.069339Z","title":"Conditioned and Composed Image Retrieval Combining and Partially Fine-Tuning CLIP-Based Features,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.069339Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:d1b7aa2f05d4b487ce5e914a91b8916e0c0800dc65cd7500026f7a7a6aef409b","observation_id":"2861b53c-a93a-469a-8a3b-8398139d3926","resolution":{"observed_at":"2026-08-04T20:06:09.069339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.071872Z","title":"BLIP: Bootstrapping Language- Image Pre-training for Unified Vision-Language Understanding and Generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.071872Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:1274fcd03adca908145cfc144e4d958b1eab7e1e3c0b6656300362c6e28f8c0b","observation_id":"c586d371-e594-4e4a-8495-2341acf003ff","resolution":{"observed_at":"2026-08-04T20:06:09.071872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.074201Z","title":"GENIUS: A Generative Framework for Universal Multimodal Search,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.074201Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:65b1eb7796e830fdb78273827c7b88fb9003bc4176baaa940d264aade2f088ec","observation_id":"67842716-390b-4f85-8040-c282f7d21289","resolution":{"observed_at":"2026-08-04T20:06:09.074201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.076615Z","title":"Fine-grained Late- interaction Multi-modal Retrieval for Retrieval Augmented Visual Ques- tion Answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.076615Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:323b535d4614d50ddaeb6a2f299ade9a037d6a326f599a57748ce6c8a9372d39","observation_id":"d76ecf55-2ab5-4a1b-a724-74536f0cabbb","resolution":{"observed_at":"2026-08-04T20:06:09.076615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.078945Z","title":"ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.078945Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:a6ce703fa2565376ba16db195edfc1bdc4e91f7333aa96108a04ef079e6743df","observation_id":"854b0c7c-1671-4879-9d49-2ddb5b578578","resolution":{"observed_at":"2026-08-04T20:06:09.078945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.081218Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.081218Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:a100666abff18ec7bd23289281d39d8bc026383237f1626f8f45056442f549ff","observation_id":"ca31e2cc-583e-4813-b8c2-6bd7e9ec1f37","resolution":{"observed_at":"2026-08-04T20:06:09.081218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-04T20:06:09.083759Z","title":"The Llama 3 Herd of Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.083759Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:7746b0d874ba4a3f7ab75fd4d326ba3eac49f5bf23f4e53aa89bad0337034f06","observation_id":"54201e63-26b7-488c-a608-6e3c4b8df992","resolution":{"observed_at":"2026-08-04T20:06:09.083759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.086532Z","title":"LamRA: Large Multimodal Model as Your Advanced Retrieval Assistant,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.086532Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:3644582e4e7bb6b5d50d44db0ced253d979c05b1fe5f417f7bcb44e5510551e7","observation_id":"dee484a4-50ec-4804-97e7-5fab419e8214","resolution":{"observed_at":"2026-08-04T20:06:09.086532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.089128Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.089128Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:3e3a0c315426d4b6ef801b29bc0effba9b0bb4ecb4de5bfa62c82b51b15b25f1","observation_id":"98ef7cc0-2c0e-421c-82d9-a709493efacd","resolution":{"observed_at":"2026-08-04T20:06:09.089128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.091490Z","title":"PUMA: Layer- Pruned Language Model for Efficient Unified Multimodal Retrieval with Modality-Adaptive Learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.091490Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:ab9048a7d156a8732626654b625adc02206bf65316b47760ea4dd9d71e1b75e4","observation_id":"c6fa9f74-f7c8-46f9-ac62-20150874a583","resolution":{"observed_at":"2026-08-04T20:06:09.091490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20008","last_updated":"2025-02-27T11:41:55Z","snapshot_observed_at":"2026-08-17T18:20:48.081631Z","submitted_at":"2025-02-27T11:41:55Z","title":"Joint Fusion and Encoding: Advancing Multimodal Retrieval from the Ground Up","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20008","snapshot_observed_at":"2026-08-04T20:06:09.094045Z","title":"Joint Fusion and Encoding: Advancing Multimodal Retrieval from the Ground Up,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.094045Z"},"links":{"cited_paper":"/paper/2502.20008","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8c64ddf7095520b126d4ba1d831ff63be10dc2bfe344332d87e08a76139af3e4","observation_id":"a0c256f8-118b-46ad-8321-8af2be4a9b0c","resolution":{"observed_at":"2026-08-04T20:06:09.094045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.096789Z","title":"Attention Is All You Need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.096789Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:def889c6d4340fe6e07630dcd907be8299010f6f4d3de20ad1797a4ce0daeee0","observation_id":"8045a789-af75-4125-af60-5087d9a00c38","resolution":{"observed_at":"2026-08-04T20:06:09.096789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.099531Z","title":"Transformers: State- of-the-Art Natural Language Processing,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.099531Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:12bc03825b21782ae3bfcce3e20b56536eec8998358975eb81ecb194410abaf9","observation_id":"6b72423c-abb8-47e8-8258-f3dd2b7b2bb0","resolution":{"observed_at":"2026-08-04T20:06:09.099531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T20:06:09.101907Z","title":"LLaMA: Open and Efficient Foundation Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.101907Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8bed6e266343be14e86c4b7be154d23b7318400f81d49261a7d4ca69221d23ff","observation_id":"7dde63b2-f6c1-4adf-a628-cf4eacd7ff5f","resolution":{"observed_at":"2026-08-04T20:06:09.101907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.105110Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.105110Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:2f20031ae5131cdb146e04435795b4dc618c99797499c9c1c7712e9faa8c02d1","observation_id":"2ffab2c6-b60d-462a-b859-9b3d819acbe1","resolution":{"observed_at":"2026-08-04T20:06:09.105110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.107756Z","title":"Training data-efficient image transformers & distillation through attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.107756Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:e52445e31fd63a313caf6b8383f61a5415e95d3d55d0d2fe4a708710cdb628e5","observation_id":"1aac34ea-134c-4dbe-9b3d-69b3ab4308ba","resolution":{"observed_at":"2026-08-04T20:06:09.107756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.110276Z","title":"Scaling Vision Transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.110276Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:39c95dc1d1de9787375794f077e9a2207ec4f15ed7a8aeb41da3a142862e2221","observation_id":"c43b9f68-3914-4ed1-9cd5-9115b16912ea","resolution":{"observed_at":"2026-08-04T20:06:09.110276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.112765Z","title":"Transformers in Vision: A Survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.112765Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:aa16056911119a0f1ee3c2b3cbc393e168ec57fc515751441867fdf0fe66eda0","observation_id":"f26dd060-5577-4bd0-ae7b-64ca67bee48f","resolution":{"observed_at":"2026-08-04T20:06:09.112765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.115088Z","title":"When attention meets fast recurrence: Training language models with reduced compute,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.115088Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:94dfcbf891487125ae6be64bbae3644fb7861c7a069428f82b650dbf0d03615a","observation_id":"58536b43-ec6f-4ba1-8eba-aa751a0e78ba","resolution":{"observed_at":"2026-08-04T20:06:09.115088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.117483Z","title":"Simple recurrent units for highly parallelizable recurrence,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.117483Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:49999e626f15e7e0cc9f2b18b031c9c5af218aa9e1d393ae06a16f7af08b25c0","observation_id":"856e754f-dd00-483e-baa9-45b11ab4d7d7","resolution":{"observed_at":"2026-08-04T20:06:09.117483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.119939Z","title":"The Best of Both Worlds: Combining Recent Advances in Neural Machine Translation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.119939Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:5e05b5fcc3d99cccad0368a50ef9046a219de4f21810aa92aae76269f2565a7d","observation_id":"ef0b1f1f-69ff-4c99-bd98-0b5456574a66","resolution":{"observed_at":"2026-08-04T20:06:09.119939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.05572","last_updated":"2019-07-12T04:01:57Z","snapshot_observed_at":"2026-08-18T11:54:47.129509Z","submitted_at":"2019-07-12T04:01:57Z","title":"R-Transformer: Recurrent Neural Network Enhanced Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.05572","snapshot_observed_at":"2026-08-04T20:06:09.122432Z","title":"R-Transformer: Recurrent Neu- ral Network Enhanced Transformer,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.122432Z"},"links":{"cited_paper":"/paper/1907.05572","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:e39ec1953732d172346aaf5db718f14aa8c22865f670254cf198c0381bb9b0e7","observation_id":"ee4debea-d943-4f43-afac-92874c33d6ba","resolution":{"observed_at":"2026-08-04T20:06:09.122432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.125375Z","title":"Block- Recurrent Transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.125375Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:c7fa33d5e7f072cfbfa6e53208a692890a6beccdba6d87e88b59656c9d5581fa","observation_id":"ace8f110-196c-44a2-bd84-36548fc19836","resolution":{"observed_at":"2026-08-04T20:06:09.125375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.127859Z","title":"ColBERTv2: Effective and Efficient Retrieval via Lightweight Late Interaction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.127859Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:ff786d6c0f14f7be022299898799a95528b935458f8683a05d0b7137f25b3b71","observation_id":"c4ba4dda-e624-4987-b6e9-451b7b691555","resolution":{"observed_at":"2026-08-04T20:06:09.127859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.130438Z","title":"Lambda-Skip Connections: the Architectural Component that Prevents Rank Collapse,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.130438Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:9d84f6568934ec2629631d663e3eaf6d483c92f77cb94611a42877156c0ea745","observation_id":"2eaf6806-7ed9-43a5-bf4d-23dbb1ae284b","resolution":{"observed_at":"2026-08-04T20:06:09.130438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T20:06:09.132854Z","title":"Layer Normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.132854Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:55f44815bbdbbf7527224fe202c190f6a12ad19275549ecec90aa67546565cc9","observation_id":"eec145b5-2140-498b-8557-18373cbf9f90","resolution":{"observed_at":"2026-08-04T20:06:09.132854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.135440Z","title":"WIT: Wikipedia-based Image Text Dataset for Multimodal Multilingual Machine Learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.135440Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:415bf610efb91660067086bb203b70234e783d18bcea318fc1825b9ac82844f7","observation_id":"4a6ee3a3-927f-4a83-8e17-90a6c7aa00ea","resolution":{"observed_at":"2026-08-04T20:06:09.135440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.137956Z","title":"IGLUE: A Benchmark for Transfer Learning Across Modalities, Tasks, and Languages,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.137956Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:36e17d224361b989dd173a40aa2c54aff85cad8f21d7b0cb1b6b453b8a716b97","observation_id":"1c34b95a-4a30-4a74-a8c3-80eba7e986e5","resolution":{"observed_at":"2026-08-04T20:06:09.137956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.140358Z","title":"KVQA: Knowledge- Aware Visual Question Answering,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.140358Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:5415564585d3037e3ffc46b56a261dda2235cd58d1c654c9e2e606073bfc7d38","observation_id":"65d7283c-b9be-4510-b79e-69cdabb5db47","resolution":{"observed_at":"2026-08-04T20:06:09.140358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.142678Z","title":"MS MARCO: A Human Generated MAchine Reading COmprehension Dataset,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.142678Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:665bf8bb32860a74a722bde4455d5883bc9c00754ca5bff29e32f96f6b5787d1","observation_id":"5d43dffc-4a4a-4ba7-8a8e-57c57a64f08c","resolution":{"observed_at":"2026-08-04T20:06:09.142678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.145450Z","title":"Visual Instruction Tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.145450Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:2db46f22a52bb926d970f8c07f2285bb5d0652f3157c31d580e99ef8fe80221b","observation_id":"c8383d7b-6ff1-4845-9e57-568168d14655","resolution":{"observed_at":"2026-08-04T20:06:09.145450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.147996Z","title":"EDIS: Entity- Driven Image Search over Multimodal Web Content,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.147996Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:228f055025c2be2b7e3700cc7965e3a202b9d5822e3a4434273e6830f0b2e131","observation_id":"635b5415-afb3-4dce-9e2b-8540313b3e6a","resolution":{"observed_at":"2026-08-04T20:06:09.147996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.150370Z","title":"Fashion IQ: A New Dataset Towards Retrieving Images by Natural Language Feedback,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.150370Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:78970c7831ede28cfc74f7d89d2aa5a8ff4fc5fe54761001b83f6c8a014f57d3","observation_id":"71e30fde-2f50-40c1-ac9e-1ccd0e201500","resolution":{"observed_at":"2026-08-04T20:06:09.150370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.152908Z","title":"Automatic Spatially-Aware Fashion Concept Discovery,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.152908Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:f8bef23d99daea062076f2085aa3bd93ac9734396280b4d3823b55858a0f535f","observation_id":"7b94b925-1f30-4816-9ccd-b347f679f5a6","resolution":{"observed_at":"2026-08-04T20:06:09.152908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.155312Z","title":"Visual News: Benchmark and Challenges in News Image Captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.155312Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:9d22811f26aafda556632c2668b94bd111d6705402861b8d185e12b2765c16f7","observation_id":"b1318d12-c2cf-44ba-861b-07f92d83509b","resolution":{"observed_at":"2026-08-04T20:06:09.155312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.157984Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.157984Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:73b6baddd126e923e3eabdda07a397cb14371d95bf5389da90632578d53f8469","observation_id":"65ec9ad0-dfc7-4bcf-ae02-3a1eb54ba887","resolution":{"observed_at":"2026-08-04T20:06:09.157984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.160539Z","title":"ADAM: a Method for Stochastic Optimiza- tion,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.160539Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:08063fa51f7556d7d7fdd04363f8e33e3d3da68ecc69c070e08cdba60ab4535f","observation_id":"b6ad4bbe-f9a0-4346-a4ee-8ea6a3abf05f","resolution":{"observed_at":"2026-08-04T20:06:09.160539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.162988Z","title":"Billion-Scale Similarity Search with GPUs,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.162988Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:fa181f020c46835a39c183357666307b9ef7f56a0b05478d9b56d6f208fc2b92","observation_id":"55204586-01e9-45d9-a426-4000ae0ad663","resolution":{"observed_at":"2026-08-04T20:06:09.162988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.165771Z","title":"Multi- Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best Practices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.165771Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:9a4c52d0adb82f9599524c40576227d148f70fc784cd9e9a8fc0df3887d6e0a1","observation_id":"abf2788a-b98e-49be-9b54-5802401b71c7","resolution":{"observed_at":"2026-08-04T20:06:09.165771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.168123Z","title":"Wiki-LLaV A: Hierarchical Retrieval-Augmented Generation for Multimodal LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.168123Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8dc4bd7e67f4c33618e0c4afac100a60c7b94f09a7ef4f97778a33076ced95e9","observation_id":"e120b265-e3e4-4676-a724-883245c14fe4","resolution":{"observed_at":"2026-08-04T20:06:09.168123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.170486Z","title":"Tomayto, Tomahto. Beyond Token-level Answer Equivalence for Ques- tion Answering Evaluation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.170486Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:7ffd482d02ac03aa8bde3fd61379e61d0e757b3d939963268304468ffb3ce91a","observation_id":"5e67fdea-71c0-43f0-96f4-cdbef572032b","resolution":{"observed_at":"2026-08-04T20:06:09.170486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.172726Z","title":"Aug- menting Multimodal LLMs with Self-Reflective Tokens for Knowledge- based Visual Question Answering,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.172726Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:e68e81308c10c7ae5894eb7c1b31fcda28e5818f48f0a4dad3970dd8f2da63fd","observation_id":"19c4cf41-1285-4542-967d-ddbd300ddf19","resolution":{"observed_at":"2026-08-04T20:06:09.172726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08876","last_updated":"2024-10-14T20:31:13Z","snapshot_observed_at":"2026-08-18T18:39:38.744680Z","submitted_at":"2024-10-11T14:51:00Z","title":"RoRA-VLM: Robust Retrieval-Augmented Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08876","snapshot_observed_at":"2026-08-04T20:06:09.175173Z","title":"RoRA-VLM: Robust Retrieval-Augmented Vision Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.175173Z"},"links":{"cited_paper":"/paper/2410.08876","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:09a8be4d42b9e77ae0d4ca2e9b15c1285360f8aff6058d0030fe90da18fb0a8a","observation_id":"ada187f9-6ea1-4a7e-8091-d71603d7fb3d","resolution":{"observed_at":"2026-08-04T20:06:09.175173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.177829Z","title":"EchoSight: Advancing Visual-Language Models with Wiki Knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.177829Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:68b41db4833e4a42d47642d43ea9f26adc3798da56a89fd1b233707ee32f6e27","observation_id":"ccaa28e4-9ba2-4657-b4da-72f4b444d3bd","resolution":{"observed_at":"2026-08-04T20:06:09.177829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17670","last_updated":"2025-07-07T20:01:47Z","snapshot_observed_at":"2026-08-13T16:17:34.753862Z","submitted_at":"2025-05-23T09:36:53Z","title":"Towards General Continuous Memory for Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17670","snapshot_observed_at":"2026-08-04T20:06:09.180245Z","title":"Towards Gen- eral Continuous Memory for Vision-Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.180245Z"},"links":{"cited_paper":"/paper/2505.17670","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:c7c2f5f5c90c8450594304b0d4babf0227db98ae6cfae14d21cb3eb79136f9ae","observation_id":"d2222c44-7745-4fec-99f5-5a4fc3d02b47","resolution":{"observed_at":"2026-08-04T20:06:09.180245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15041","last_updated":"2026-08-17T08:53:39Z","snapshot_observed_at":"2026-08-20T23:15:22.000321Z","submitted_at":"2024-11-22T16:15:50Z","title":"mR$^2$AG: Multimodal Retrieval-Reflection-Augmented Generation for Knowledge-Based VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15041","snapshot_observed_at":"2026-08-04T20:06:09.182830Z","title":"mR 2AG: Multimodal Retrieval-Reflection- Augmented Generation for Knowledge-Based VQA,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.182830Z"},"links":{"cited_paper":"/paper/2411.15041","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:4f2c333a0b9a74a96c3664b5a7fba05de0e5ae00e044f140d5260c29142008dc","observation_id":"c3f50af2-666a-4c96-9b4f-03dc62a0dc58","resolution":{"observed_at":"2026-08-04T20:06:09.182830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.185613Z","title":"BLIP-2: Bootstrapping Language- Image Pre-training with Frozen Image Encoders and Large Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.185613Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:02684e00318c3ad58807abeac8cdf5e877518fb2fabd11122ab63f27731cb715","observation_id":"d15fa04c-1442-4229-8cb8-15a2dbf51316","resolution":{"observed_at":"2026-08-04T20:06:09.185613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.188123Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.188123Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8e86cd5829de5cdf9089e2ac6774cf861f917f2547c2979c3a53f2e552b4de0a","observation_id":"8becf586-4688-4168-bb6c-96adbf4464fb","resolution":{"observed_at":"2026-08-04T20:06:09.188123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.190546Z","title":"WebQA: Multihop and Multimodal QA,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.190546Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8cdd0cd92514992cceb82413cdb85252ffe6c234d5c24f652ccd1e27fb44ce26","observation_id":"0e253ce2-8f5e-42ec-a572-d779bd89a12c","resolution":{"observed_at":"2026-08-04T20:06:09.190546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.193095Z","title":"The Eleven","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":1992,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.193095Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:449655644efea8178679d89869aab347fc217e7275a4605bfff11f67ee24f64a","observation_id":"ff4ca8b7-b9c0-4d9c-a4d1-7e79e43f8e12","resolution":{"observed_at":"2026-08-04T20:06:09.193095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:06:09.196053Z","title":"Eu- phorbia pulcherrima","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.196053Z"},"links":{"citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:5a50bd7556105806ca4bf06d41453a62e411937d716accb5b865e1b55415f6b6","observation_id":"92eb5617-04a8-47f6-ab27-745cf85812f7","resolution":{"observed_at":"2026-08-04T20:06:09.196053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:47:27.749061Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":80,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 1 inbound Pith citation observation for arXiv:2509.08897."}