{"as_of":"2026-08-10T08:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b166d99fbd69b357cb4786f5277d55756875973244682f1359fd94277631726","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:17:04.441743Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24530/citation-record","integrity":"/paper/2605.24530/integrity","json":"/paper/2605.24530/citation-record.json","paper":"/paper/2605.24530"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.400392Z","title":null,"venue":null,"work_id":"4735de2d-fb95-4ef8-810d-5b712746851b","year":2013},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:c4eb9e892bdc49234cad63be93fc5595ccaf1812f959a6774bbe266765e3de76","observation_id":"f228981d-552f-43db-be47-256f40c5c6f1","resolution":{"observed_at":"2026-07-09T02:45:54.401458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06176","last_updated":"2024-11-09T13:30:38Z","snapshot_observed_at":"2026-07-06T19:47:51.117687Z","submitted_at":"2024-11-09T13:30:38Z","title":"M-Longdoc: A Benchmark For Multimodal Super-Long Document Understanding And A Retrieval-Aware Tuning Framework","version":1},"cited_work":{"arxiv_id":"2411.06176","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.06176","snapshot_observed_at":"2026-06-30T20:55:04.595521Z","title":"Jacob Cohen","venue":null,"work_id":"17ea30ae-ef9f-446c-83c0-fb5af024e4aa","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2411.06176","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:9b0e8a412ec07fcef6535c5e67c13964b74049cb5707904227ea67ccf655f275","observation_id":"0421510b-a2e7-4512-aae5-f860ae6eb48e","resolution":{"observed_at":"2026-06-30T13:24:40.427435Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04952","last_updated":"2024-11-07T18:29:38Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:29:38Z","title":"M3DocRAG: Multi-modal Retrieval is What You Need for Multi-page Multi-document Understanding","version":1},"cited_work":{"arxiv_id":"2411.04952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.04952","snapshot_observed_at":"2026-07-04T12:09:48.864251Z","title":"M3docrag: Multi-modal retrieval is what you need for multi-page multi-document understanding","venue":null,"work_id":"776da489-7ed1-484b-a0a8-4c975ba75e98","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2411.04952","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:cfb48e48a1bafff4f15b3cd50d6cbe89efe85f9e1c5a08c331e9f682b1a0ce1e","observation_id":"d8dc2758-9de4-4ab9-8eea-c2ddd260589f","resolution":{"observed_at":"2026-06-30T13:24:40.430081Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.09941","last_updated":"2020-10-15T14:21:53Z","snapshot_observed_at":"2026-07-06T09:57:27.039262Z","submitted_at":"2020-09-21T14:57:18Z","title":"PP-OCR: A Practical Ultra Lightweight OCR System","version":3},"cited_work":{"arxiv_id":"2009.09941","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2009.09941","snapshot_observed_at":"2026-07-04T16:39:57.607479Z","title":"Pp-ocr: A practical ultra lightweight ocr system","venue":null,"work_id":"555e4547-6e8f-49f5-acf4-0adae9b359e3","year":2009},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2009.09941","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:f650a59ac9f8ac86c44130444abeb749b7b8f127bcd2bbb4eae2836e13341f01","observation_id":"1c60580d-06ad-4b1c-b5e1-fd1105fb5a10","resolution":{"observed_at":"2026-06-30T13:24:40.422205Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01449","last_updated":"2025-02-28T08:51:57Z","snapshot_observed_at":"2026-07-06T18:39:43.472708Z","submitted_at":"2024-06-27T15:45:29Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","version":6},"cited_work":{"arxiv_id":"2407.01449","doi":"10.48550/arxiv.2407.01449","metadata_source":"pith","pith_arxiv_id":"2407.01449","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ColPali: Efficient Document Retrieval with Vision Language Models","venue":"cs.IR","work_id":"d2468d08-90dc-4690-887a-9b10a6d3574e","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2407.01449","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:79d188bad04d2502f453cf69ad90c0422c2ad6050177a6f68c377529583a77e6","observation_id":"745db614-9bf2-4b9c-b993-e4c4dc602a88","resolution":{"observed_at":"2026-06-30T13:24:40.419835Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.379726Z","title":null,"venue":null,"work_id":"382d4cfa-821a-4d78-8588-d61f7ab7cdc9","year":2020},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:bc04032ba3230b9b150a4ff012d92ac85148147aee8bae9a469c7c478cadb842","observation_id":"8a13a4df-e971-423a-8dc4-2d575a493686","resolution":{"observed_at":"2026-07-09T02:45:54.380811Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-10T00:01:53.009712Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":"2409.03420","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-06-30T13:24:40.403192Z","title":"mplug- docowl2: High-resolution compressing for ocr-free multi-page document understanding","venue":null,"work_id":"cbccb6f4-58a1-47da-92a9-fe746db74363","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:a21081644a99455b4c9c98a5f50503edccee05030ef2f4153c3367bc2eba4dc4","observation_id":"b3fde4fd-881b-4d17-bee6-89b7105f20b6","resolution":{"observed_at":"2026-06-30T13:24:40.404764Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.374719Z","title":null,"venue":null,"work_id":"f73f2aad-643b-4eb7-a6d6-f2f2fc4cd1fc","year":2017},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:06772d91b04bc0ca83eb182f3999ab28671f85b242e573079aa10c3d963eca94","observation_id":"c6670ae7-d4e4-4c64-b090-3e117de1aa0a","resolution":{"observed_at":"2026-07-09T02:45:54.375850Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04906","last_updated":"2020-09-30T21:27:13Z","snapshot_observed_at":"2026-07-06T09:11:26.109763Z","submitted_at":"2020-04-10T04:53:17Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","version":3},"cited_work":{"arxiv_id":"2004.04906","doi":"10.48550/arxiv.2004.04906","metadata_source":"pith","pith_arxiv_id":"2004.04906","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Dense Passage Retrieval for Open-Domain Question Answering","venue":"cs.CL","work_id":"3d6f2008-b001-4542-ba3f-192f6880c74b","year":2020},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2004.04906","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:82df7d8262de6cb9beff1482c5e21edd9271233d79a0e019b097f8bcc933d67f","observation_id":"b48d440e-caf0-49a9-b8a1-c271b1113a69","resolution":{"observed_at":"2026-06-30T13:24:40.401287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.388144Z","title":null,"venue":null,"work_id":"2797ad24-4e78-45ab-84e3-6228ef1d5d82","year":2019},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:57dd03e72482ea177a20bb8c9058fb7778286b772c8489c5b8db15029db2e395","observation_id":"33f6e1aa-e498-46c6-aab8-2f9e68b86ca5","resolution":{"observed_at":"2026-07-09T02:45:54.389189Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.413596Z","title":null,"venue":null,"work_id":"3e873b77-4e10-4fec-97aa-79ec51a35e26","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:5685edb4bebecf1acdb99c809d27551b75d2d64752daf905e2646a09e357dee3","observation_id":"d17761c4-e4f8-4898-a841-6a340139e82d","resolution":{"observed_at":"2026-07-09T02:45:54.414637Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.02729","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:24:40.405444Z","title":"arXiv preprint arXiv:2410.02729 , year=","venue":null,"work_id":"983937bd-9818-4522-8378-7ad8394c35d4","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:967621b707c16538a2f9e075efa1da1466e9b44fd2b37deee7a98f7ea47f976e","observation_id":"82630bb3-6c79-4a51-8f6c-701e07c834b5","resolution":{"observed_at":"2026-06-30T13:24:40.406932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.376417Z","title":null,"venue":null,"work_id":"96e59739-e3b9-4d5e-8c91-e419d82a82ba","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:64204e3b55f11fffab1310d9fce58b518bed56a9958f00296fed2d766032dfe5","observation_id":"7df60d71-5278-4143-9eee-0b56558ef79a","resolution":{"observed_at":"2026-07-09T02:45:54.377514Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02571","last_updated":"2025-02-22T05:33:26Z","snapshot_observed_at":"2026-08-09T15:41:06.775086Z","submitted_at":"2024-11-04T20:06:34Z","title":"MM-Embed: Universal Multimodal Retrieval with Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2411.02571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.02571","snapshot_observed_at":"2026-07-04T15:49:57.631122Z","title":"arXiv preprint arXiv:2411.02571 , year=","venue":null,"work_id":"da61907d-fb9d-4f7b-a9bc-4750420fb05e","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2411.02571","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:f21be2b283718e7a755e5bb417dd55b927fdb40dfb1476b7c03d1cb03726b001","observation_id":"68e3f404-c0df-4047-b61b-98556488ebec","resolution":{"observed_at":"2026-06-30T13:24:40.415138Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11251","last_updated":"2024-12-02T13:26:14Z","snapshot_observed_at":"2026-08-05T00:28:25.127698Z","submitted_at":"2024-06-17T06:27:35Z","title":"Unifying Multimodal Retrieval via Document Screenshot Embedding","version":2},"cited_work":{"arxiv_id":"2406.11251","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.11251","snapshot_observed_at":"2026-07-08T20:35:34.389743Z","title":"Unifying multimodal retrieval via document screenshot embedding","venue":"cs.IR","work_id":"a13eaa8f-8e0a-4a34-a585-753e891f64b5","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2406.11251","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:e7077d67af64b873c1a86ad020c235ea81e19ec61ba4ab6f6791a41a080e73f3","observation_id":"61a2e927-ece4-4e15-b5d4-550b9650d052","resolution":{"observed_at":"2026-06-30T13:24:40.417608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.416714Z","title":null,"venue":null,"work_id":"4aca20f6-3ca1-4859-9999-42fc94933ed0","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:01d4fbffd5763c227a8599d3a07c877bd6af9142dad02a2903394311a4b48c58","observation_id":"10c81f66-d17d-453c-b2c9-76faf1f7a57a","resolution":{"observed_at":"2026-07-09T02:45:54.417764Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.391371Z","title":"Joty, and Enamul Hoque","venue":null,"work_id":"1a3d1811-995d-40a6-92d5-341c79ae6118","year":2022},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:9c078dc7cf8ee08979eefc71ebda5ebf4334361aa3e99f5ff0bd7b3dddde9f4d","observation_id":"d85ca3cc-a82c-4f6a-8255-69940a832060","resolution":{"observed_at":"2026-07-09T02:45:54.392383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.392873Z","title":null,"venue":null,"work_id":"6d86c239-8a9b-4da3-bb5c-3cc50e068ec4","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:26ce6c1f94444835d4a6e2da50cf43e13fae519864457859680804d1a216eccd","observation_id":"25788001-6456-41b7-aebb-488162488ca7","resolution":{"observed_at":"2026-07-09T02:45:54.393913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.383165Z","title":"InIEEE/CVF Winter Confer- ence on Applications of Computer Vision (WACV), pages 2582–2591","venue":null,"work_id":"0dacf0ef-22ca-45bb-acd2-df394cf0d71a","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:b02bc84c225593254e74e44301d40c2f60596202a86d5e6de5b56990d7e549f1","observation_id":"3af315b7-e945-48bf-b023-50d7ce390d65","resolution":{"observed_at":"2026-07-09T02:45:54.384413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.378079Z","title":"Khapra, and Pratyush Kumar","venue":null,"work_id":"6498e30e-9776-47a2-8598-05d2c7832ede","year":2020},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:e4be32cef0fb00952f6be20f373556882c16e36463762005f4ac7b21ef02e3d8","observation_id":"5a4b87a6-5054-464c-92d2-0269986eac7d","resolution":{"observed_at":"2026-07-09T02:45:54.379172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.403839Z","title":null,"venue":null,"work_id":"bc8e89c1-127d-40a1-b553-9f6e3ffdedac","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:5e9edec517916d3ecb44a9d8227f696169d92edaa263495223ddcb9f135cc57f","observation_id":"99746474-7af8-45c8-9030-a55ef4bdd982","resolution":{"observed_at":"2026-07-09T02:45:54.404911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.07899","last_updated":"2021-12-15T05:33:27Z","snapshot_observed_at":"2026-07-06T12:18:53.315820Z","submitted_at":"2021-12-15T05:33:27Z","title":"Large Dual Encoders Are Generalizable Retrievers","version":1},"cited_work":{"arxiv_id":"2112.07899","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.07899","snapshot_observed_at":"2026-07-04T10:19:47.681833Z","title":"arXiv preprint arXiv:2112.07899 (2021)","venue":null,"work_id":"b37eec54-1bc5-434b-bad4-aa468c3dd463","year":2021},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2112.07899","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:8e69338816b81788d70ccb667166bbaa75376dc80eb93944d0dbc3f0b033d9b7","observation_id":"83b255a5-9e5b-4f92-8604-13d724d73d89","resolution":{"observed_at":"2026-06-30T13:24:40.428706Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.407023Z","title":null,"venue":null,"work_id":"dfa7059b-a44a-484f-9d4c-c807237241cc","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:01966f79ae9300df5efd14e3c4776ba83520a2f275e1536005544dc776084731","observation_id":"ef306ca8-0c0d-4a12-9753-6cb1830603d4","resolution":{"observed_at":"2026-07-09T02:45:54.408135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":"1807.03748","doi":"10.1609/aaai.v36i10.21390","metadata_source":"pith","pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Representation Learning with Contrastive Predictive Coding","venue":"cs.LG","work_id":"7b08a1d4-d565-424e-9c86-6ef244b7b90a","year":2018},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:84bffceacc0ea8af6d63a1daaf42fb71230446fd799556a91c95fe6dcaff1854","observation_id":"3c39645e-889c-4f90-8f3e-12257e8cfdd6","resolution":{"observed_at":"2026-06-30T13:24:40.421028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.384965Z","title":null,"venue":null,"work_id":"5abda5e2-6401-4d53-a9bf-fd5965147b13","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:f6222158c48a66a5b5b60c4e98c2eb8f38b23a87d1e4b8a71891a89b3470cc1d","observation_id":"51a286e1-3e60-43c8-87d6-18c9b43bc634","resolution":{"observed_at":"2026-07-09T02:45:54.386013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.398702Z","title":null,"venue":null,"work_id":"528e280f-6941-4f4a-8f15-ad56dbc4fe5b","year":2009},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:74948736042f149a9f5bf2ee7a1cc386ad96c2e13f6c7f9db2aeba408c3e877a","observation_id":"39907396-c232-4d0a-b203-3447fc22584d","resolution":{"observed_at":"2026-07-09T02:45:54.399820Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.394507Z","title":null,"venue":null,"work_id":"d7efd3d5-e368-4946-8729-d709ccce8848","year":2022},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:26a654459475c79e922d0049324268dbff4007b54e01f77a0d7337d583769cfd","observation_id":"a0e98b3e-d9ba-491d-baed-06b4c7e08260","resolution":{"observed_at":"2026-07-09T02:45:54.395634Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:26:21.198691Z","title":null,"venue":null,"work_id":"c69dcc4d-85af-4249-accc-cbae1a0e230c","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:b4061dc0ea2e8c1a666f818e7b8738dba6d9fe42e7e07c403b944232cd481a17","observation_id":"552810d6-1436-4c86-be18-738b3f1cc662","resolution":{"observed_at":"2026-07-09T02:45:54.398080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.410593Z","title":null,"venue":null,"work_id":"0184f45e-ed59-4dbc-b89d-9027f4e610ac","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:c1205d82f127831129fa20aa281d4898a0d1d4328d995d38b358e9af7621b796","observation_id":"1dea2f51-09c6-4355-9786-fe3284da9a3c","resolution":{"observed_at":"2026-07-09T02:45:54.411555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.389748Z","title":null,"venue":null,"work_id":"9fa09794-f13e-4a09-8cfe-a301890dcd1e","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:d7b65fa2862326b289c9a2f4380266db16f3d42bd6ea1f3f008ac125f0d42656","observation_id":"a0f87eb0-b489-4d12-87d4-44462c7651ab","resolution":{"observed_at":"2026-07-09T02:45:54.390848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.412029Z","title":null,"venue":null,"work_id":"29df1b4c-db72-4e87-a5c8-66e1b016c648","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:c025df54855fd4fa073ca7c67cfe68697d76940140de6c23c97f7dfbc1164277","observation_id":"bf0090f8-53a9-4a4a-8421-4ab1a6c14fef","resolution":{"observed_at":"2026-07-09T02:45:54.413072Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":"1809.09600","doi":"10.48550/arxiv.1809.09600","metadata_source":"pith","pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","venue":"cs.CL","work_id":"c87d7e5f-b81a-41c8-beca-f0b9d598aae4","year":2018},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:8e2bc8d02e743d2b572f46849a6fcb24420ca9aa1a18a3d373f37fe3f70354d9","observation_id":"9727d19d-a926-498e-a04d-794fdac67262","resolution":{"observed_at":"2026-06-30T13:24:40.426165Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.386509Z","title":null,"venue":null,"work_id":"4ac01260-e03f-4975-9f97-d04f0916058c","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:9d32d26d91208725c9a5ac099f2d34735e1961286140f9bf7efbd719f0fb6f65","observation_id":"7d3385b0-e45d-4ea6-9fbb-68313de9170c","resolution":{"observed_at":"2026-07-09T02:45:54.387597Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":"2408.01800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-07-10T11:37:03.161139Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","venue":"cs.CV","work_id":"0f06e436-0c76-4e3c-be5e-6168f6bc4336","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:a3a2de60d82d1b6c77f04068e78016480e44848e8fad184642f18702a56d169c","observation_id":"b4e1f398-2588-4c40-831e-c044ad26a43f","resolution":{"observed_at":"2026-06-30T13:24:40.407370Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-01T15:24:02.956161Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":"2307.02499","doi":"10.48550/arxiv.2307.02499","metadata_source":"arxiv_reference","pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":"arXiv (Cornell University)","work_id":"990d95b3-f658-488d-b1a6-169e9e6aa7fb","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:ee31533c3c6c88560dd669c28cd5783840e6e5f7260f46b9d5d07f9d10631896","observation_id":"e9aa1bb3-8649-49e7-a2b6-482da0b6da85","resolution":{"observed_at":"2026-06-30T13:24:40.416164Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10594","last_updated":"2025-03-02T01:19:51Z","snapshot_observed_at":"2026-08-10T05:52:50.722724Z","submitted_at":"2024-10-14T15:04:18Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","version":2},"cited_work":{"arxiv_id":"2410.10594","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.10594","snapshot_observed_at":"2026-07-03T05:57:41.459329Z","title":"VisRAG: Vision-based Retrieval-augmented Generation on Multi-modality Documents","venue":"cs.IR","work_id":"91acd90a-d182-4502-a92c-390a77f29b81","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2410.10594","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:ff86bc681d3f2790d10193bab73938518c2180a6c3455335b18f201f22bd4c3e","observation_id":"c4d40835-a550-4a93-8a3c-f1b6da9bf5dc","resolution":{"observed_at":"2026-06-30T13:24:40.409288Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.381363Z","title":null,"venue":null,"work_id":"ae90b087-d92f-4779-bf00-e8a5e597bb5f","year":2023},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:c458b9572003a2e550fc493ec57dfb2c3f258665ebbff5a7e6ebd292d8901339","observation_id":"9e160308-3cb8-4215-926b-558979229cec","resolution":{"observed_at":"2026-07-09T02:45:54.382608Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"cited_work":{"arxiv_id":"2410.21169","doi":"10.48550/arxiv.2410.21169","metadata_source":"pith","pith_arxiv_id":"2410.21169","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","venue":"cs.MM","work_id":"1237b74e-e94a-4846-a4ae-3960929fd6aa","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2410.21169","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:c6fd6ded0b299e271f002660eb6bf179c80cc2f3ce282bd7bf232c720ef8b868","observation_id":"ae15918d-4136-40d1-899a-85fb31c1fb6b","resolution":{"observed_at":"2026-06-30T13:24:40.418711Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-08-08T20:42:47.396503Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:94d945d8ae1889ed3d662087e7e2e0f77b6bf3841c4a9af5f9ed8c44d7a06d89","observation_id":"0ce5236c-ea7f-4cb5-88f4-1e587a8e86e5","resolution":{"observed_at":"2026-06-30T13:24:40.423530Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.408704Z","title":"Settings ArXivQA ChartQA MP-DocVQA InfoVQA PlotQA SlideVQA","venue":null,"work_id":"225bdc99-01dd-4d07-a06b-129444035930","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:d70202d90ed673e90f5e85168fad2920f745dc3590378cb07d2054e619dec420","observation_id":"863643e8-1659-4e99-aeb8-278392045eed","resolution":{"observed_at":"2026-07-09T02:45:54.410068Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.372764Z","title":"B Training Details Training DataIn web page retrieval, we utilize 49,095 training pairs of query and positive documents","venue":null,"work_id":"12dc45b8-7bc9-46c7-9fed-a7e1b86b64d1","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:4ca9ee18d8aa4b5e036eb38f98641cf63b02028ee1c3e37aaf28a256df44dad6","observation_id":"5f2e8822-3a18-411e-a5f8-2fadf501a7a0","resolution":{"observed_at":"2026-07-09T02:45:54.374132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.415144Z","title":null,"venue":null,"work_id":"19c8f24a-032c-48a3-be26-c59c80422371","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:d47ca2e40fbc014b668809e58d202879eccbfb35fabcc722fb7a59849a98c049","observation_id":"21699fde-8414-4aee-a02e-58ab230b7f31","resolution":{"observed_at":"2026-07-09T02:45:54.416162Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.405436Z","title":null,"venue":null,"work_id":"da115657-2dce-4c63-ada0-0e4d882511ac","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:d739d758df4002bc8a9a43dea1d75693331bd03e97c0e588b94bc864628e21ec","observation_id":"a510f0fa-23ad-4ab7-b5e9-21adeedc5888","resolution":{"observed_at":"2026-07-09T02:45:54.406488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:45:54.402011Z","title":"Only results with confidence scores above 0.6 are retained, and the bounding box coordinates, along with the recognized text, are stored for further processing","venue":null,"work_id":"b87d1da3-1aff-4e99-a1a9-19c0843fa66a","year":null},"citing_paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T13:17:04.441743Z"},"links":{"citing_paper":"/paper/2605.24530"},"observation_digest":"sha256:2c11792142c2b1238685acc53a02f77684ed216b5f54b478ec8d97ffe5755b10","observation_id":"b6e09a7f-7a79-487a-8acf-8361e63e6c41","resolution":{"observed_at":"2026-07-09T02:45:54.403296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24530","last_updated":"2026-05-23T11:48:28Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T01:21:42.748527Z","submitted_at":"2026-05-23T11:48:28Z","title":"Unveil: Unified Visual-Textual Integration and Distillation for Multi-modal Document Retrieval"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":17,"verified_fuzzy":6},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2605.24530."}