{"as_of":"2026-08-14T12:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1d5b177a296127c5f7a3537e2bf160525595c5e4246f3e9fb1ae377bcd8d7f1f","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T17:42:14.915935Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T21:55:02.656863Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T21:59:06.400938Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"cited_work":{"arxiv_id":"2412.08746","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.08746","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DocVLM: Make your VLM an efficient reader.arXiv preprint arXiv:2412.08746","venue":null,"work_id":"4c82febf-153d-4d8f-9778-a5e759736f65","year":null},"citing_paper":{"arxiv_id":"2605.18818","last_updated":"2026-05-12T13:07:34Z","snapshot_observed_at":"2026-08-12T04:06:08.744040Z","submitted_at":"2026-05-12T13:07:34Z","title":"Operationalizing Document AI: A Microservice Architecture for OCR and LLM Pipelines in Production","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T21:55:02.656863Z"},"links":{"cited_paper":"/paper/2412.08746","citing_paper":"/paper/2605.18818"},"observation_digest":"sha256:3afa49ea78df63025bb43fcb3dca00a0c3bfdb45a53f4a7a4d8fa3f79e2c7a80","observation_id":"83f55883-6cbf-4800-a317-78e8c3ccad98","resolution":{"observed_at":"2026-05-20T21:59:06.404665Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08746/citation-record","integrity":"/paper/2412.08746/integrity","json":"/paper/2412.08746/citation-record.json","paper":"/paper/2412.08746"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.841910Z","title":"Sequence-to-sequence contrastive learning for text recogni- tion","venue":null,"work_id":"cd9a5679-92f8-4628-8789-06089b0788cd","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.660000Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:564e62125fc5fd561d887e3a4e8131e06da2787e1b0490ea1f153a3f5695ae71","observation_id":"0d95e635-eb90-46bc-8478-43366a9a697e","resolution":{"observed_at":"2026-08-11T17:42:15.847032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03873","last_updated":"2022-05-08T13:55:30Z","snapshot_observed_at":"2026-08-13T15:48:11.933897Z","submitted_at":"2022-05-08T13:55:30Z","title":"Multimodal Semi-Supervised Learning for Text Recognition","version":1},"cited_work":{"arxiv_id":"2205.03873","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.03873","snapshot_observed_at":"2026-08-11T17:42:15.282856Z","title":"Multimodal Semi-Supervised Learning for Text Recognition","venue":"cs.CV","work_id":"94ee0079-8be8-4c41-afb7-873b5b40b3f0","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.664037Z"},"links":{"cited_paper":"/paper/2205.03873","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:1f564da116b480eaa9ddef0e582fe65bd4c929321fe8bdab2536fbcb1b9bd4e5","observation_id":"ce335f3e-c1c6-4b33-a514-a18942a47dd9","resolution":{"observed_at":"2026-08-11T17:42:15.286747Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.827790Z","title":"Clipter: Looking at the bigger picture in scene text recogni- tion","venue":null,"work_id":"262ad2d2-548e-4d3d-b95d-b88315205a04","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.667866Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:6643c46e8fceb8e8028232ff9ed04e6e57ae876e767c21b6b78f025848843876","observation_id":"a83da128-c292-4c5a-82f0-a0123d3c23a5","resolution":{"observed_at":"2026-08-11T17:42:15.832160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.816075Z","title":"Visfocus: Prompt- guided vision encoders for ocr-free dense document under- standing","venue":null,"work_id":"a082a959-5f39-4f89-b2a2-9f1af4bf0c0b","year":2025},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.671218Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:d921d509e4e54225e03cff3bb77b0cd6d61d5d0977092b774e16abd76187552c","observation_id":"97adfa2a-0880-4d59-84bf-f52aa06e0634","resolution":{"observed_at":"2026-08-11T17:42:15.819896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.674632Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.674632Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:cf3538101fdb1b7754b873df0853ec1edd1047c8b3d91073a4a696c79678592a","observation_id":"0dbb5cf3-6f5c-4557-bb3e-4aa26e03ea85","resolution":{"observed_at":"2026-08-11T17:42:14.674632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.794366Z","title":"Docformer: End-to-end transformer for document understanding","venue":null,"work_id":"88fd7943-ca7b-4957-b61b-52774cd3a5e3","year":2021},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.678011Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:7dc6fa3a6ca138e7d845124c7d246264cbb59f204e417d029985af335853905c","observation_id":"abc368ed-db23-432e-b4c8-6a799a689b42","resolution":{"observed_at":"2026-08-11T17:42:15.801855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.771650Z","title":"Docformerv2: Local features for document understanding","venue":null,"work_id":"2db5dadf-8f8c-4e76-a076-dd610004f3db","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.681409Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:61c1e5c02a76ec44e7238006a14a4a282c099c1715ed453abae783fc613bb171","observation_id":"33997b18-557c-491d-bfe4-53f9caf214f8","resolution":{"observed_at":"2026-08-11T17:42:15.777421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04615","last_updated":"2024-07-04T07:08:15Z","snapshot_observed_at":"2026-08-13T04:24:33.133428Z","submitted_at":"2024-02-07T06:42:33Z","title":"ScreenAI: A Vision-Language Model for UI and Infographics Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04615","snapshot_observed_at":"2026-08-11T17:42:14.684571Z","title":"Screenai: A vision-language model for ui and infographics understand- ing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.684571Z"},"links":{"cited_paper":"/paper/2402.04615","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:71d06618c031f343579e8b0d9665d8c32b95051bbe34b57b08589675c46f16f7","observation_id":"603ac7e8-1290-4fd2-acee-b26cfdd395dd","resolution":{"observed_at":"2026-08-11T17:42:14.684571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T17:42:14.688335Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.688335Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:93d6bc5132221281b0e3e59a0352f215cecab5d39c4ce108895c635b54f0ea9f","observation_id":"86291faa-31e1-4997-9aed-7da95e13ebe8","resolution":{"observed_at":"2026-08-11T17:42:14.688335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-11T17:42:14.691914Z","title":"Paligemma: A versatile 3b vlm for trans- fer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.691914Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:351b517002039ec0ada3167cfcfc2a196a5606454de8fc538c234cc88a42c23c","observation_id":"b4053255-729c-4b5c-9baa-ecd98b1ba15f","resolution":{"observed_at":"2026-08-11T17:42:14.691914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.758142Z","title":"Scene text visual question answering","venue":null,"work_id":"2ea2d146-2314-434d-b5ef-fb614e3618f6","year":2019},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.695774Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:0cdfc44a6ac7df107f06d5b342765dbba734a1febf94f8c2d3bb8c9a0d0858c6","observation_id":"6e5bfb32-75f0-4d42-90f3-71b82931c738","resolution":{"observed_at":"2026-08-11T17:42:15.761696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.734430Z","title":"Latr: Layout-aware transformer for scene-text vqa","venue":null,"work_id":"a0dd2592-333e-4d40-86c8-85d75b534098","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.699038Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:ac9ea7fd8e627db9632463cb097f0cb25f53c63d105bd4bf96f9db1ded02b3ca","observation_id":"680bee12-b608-4c91-9c1a-8a1c292b6423","resolution":{"observed_at":"2026-08-11T17:42:15.739553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.12985","last_updated":"2022-02-25T21:30:48Z","snapshot_observed_at":"2026-08-13T16:33:55.739399Z","submitted_at":"2022-02-25T21:30:48Z","title":"OCR-IDL: OCR Annotations for Industry Document Library Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.12985","snapshot_observed_at":"2026-08-11T17:42:14.702449Z","title":"Ocr-idl: Ocr annota- tions for industry document library dataset","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.702449Z"},"links":{"cited_paper":"/paper/2202.12985","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b2b7c564a4e89fbf7ab2fde46713850e9ed85d818c0126bb9db729cff2c07b8a","observation_id":"a19bad3c-e51f-4dd0-8e1b-9e85c7880300","resolution":{"observed_at":"2026-08-11T17:42:14.702449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.706094Z","title":"Gram: Global reasoning for multi-page vqa","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.706094Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b6cab2b49780b6165cfd0665b4aefececfb08b6310bebd14b15a904fd949bf77","observation_id":"4b3582b1-5aba-429e-9051-a6e8b13c226c","resolution":{"observed_at":"2026-08-11T17:42:14.706094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-11T17:42:14.709581Z","title":"Microsoft coco captions: Data collection and evaluation server","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.709581Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:9e1aa42489063bf8ade77d65b9f7ab1faf5c80d8512abd768daea1900955ac2d","observation_id":"263231ec-21af-428e-bcf0-b8591b249bcc","resolution":{"observed_at":"2026-08-11T17:42:14.709581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-08-07T07:27:51.369423Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-11T17:42:14.713185Z","title":"Pali-x: On scaling up a multilingual vision and language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.713185Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:fcf1166e6d5fc66e42555b2566fbe46e364b0f4e5f826b4eb5a663a93e359fcc","observation_id":"70b2f9db-b7f6-457e-9d1f-2638aeb6eebb","resolution":{"observed_at":"2026-08-11T17:42:14.713185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09199","last_updated":"2023-10-17T22:38:51Z","snapshot_observed_at":"2026-08-13T05:49:44.454749Z","submitted_at":"2023-10-13T15:45:19Z","title":"PaLI-3 Vision Language Models: Smaller, Faster, Stronger","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09199","snapshot_observed_at":"2026-08-11T17:42:14.716518Z","title":"Pali-3 vision language models: Smaller, faster, stronger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.716518Z"},"links":{"cited_paper":"/paper/2310.09199","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:96c27f8d36f29d5a01dcbf58be493aeff9ac8f074ef7a3c6662acf012773c264","observation_id":"0db02ade-4d5c-4fc9-80c0-dd8a8cc24eb9","resolution":{"observed_at":"2026-08-11T17:42:14.716518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.720325Z","title":"Internvl2: Better than the best—expanding performance boundaries of open-source multimodal models with the progressive scaling strategy,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.720325Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:3e1b2f267c383c1173c417025d40be81df9a795780ea5a7efc0f95fbba84c168","observation_id":"3809b3e9-1c73-4ba8-b5c8-1daba241f17c","resolution":{"observed_at":"2026-08-11T17:42:14.720325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-11T17:42:14.723706Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.723706Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:aa3f2e295c12fe8c7da7f379d60245dfffa8a6afb09532c06811db3862823c8a","observation_id":"e34e2c5d-740a-430a-bb97-3b315914d230","resolution":{"observed_at":"2026-08-11T17:42:14.723706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06512","last_updated":"2024-04-09T17:59:32Z","snapshot_observed_at":"2026-08-13T17:48:34.710025Z","submitted_at":"2024-04-09T17:59:32Z","title":"InternLM-XComposer2-4KHD: A Pioneering Large Vision-Language Model Handling Resolutions from 336 Pixels to 4K HD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06512","snapshot_observed_at":"2026-08-11T17:42:14.727112Z","title":"Internlm-xcomposer2- 4khd: A pioneering large vision-language model handling resolutions from 336 pixels to 4k hd","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.727112Z"},"links":{"cited_paper":"/paper/2404.06512","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b7e21123ddbcbf31ce3bf90cc28655fb6c8e9acadd3d87aacd2c5fb65b5f8623","observation_id":"a8a84652-7a5b-4304-b070-6d2d8702753e","resolution":{"observed_at":"2026-08-11T17:42:14.727112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.696286Z","title":"Dtrocr: Decoder-only transformer for op- tical character recognition","venue":null,"work_id":"af75c58f-f892-4285-a138-502827500fda","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.730476Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:5b73f317c4014aa1476167c1c1cccee2bfbd2f4a6fda6bc245eec8c4897976cd","observation_id":"5d08ab50-a9f8-47a5-a6ea-1497d6abc638","resolution":{"observed_at":"2026-08-11T17:42:15.700195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.673192Z","title":"Towards models that can see and read","venue":null,"work_id":"6bbae7c4-0937-41d7-817d-22c47fd0efe0","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.733829Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:50da2d137a1bbf56baec66c28268cddc135092dd85fd0e61b4f646af24e86f64","observation_id":"8e22a9ff-be1b-49c4-b305-6c5d0c8262c3","resolution":{"observed_at":"2026-08-11T17:42:15.676824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.657756Z","title":"Question aware vision transformer for multimodal reasoning","venue":null,"work_id":"c456aa41-01bc-4e6b-9290-ccb95b8dff77","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.737048Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:f25cb05f601b452dd0f0346c8d4bbd1e86ccaac2894aa3d917839d2c75addbe2","observation_id":"bb305f88-a348-4121-8b18-6bdf6dbe89d1","resolution":{"observed_at":"2026-08-11T17:42:15.661519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.644957Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"15c178ed-df67-4b21-9eed-0274dd39ac4b","year":2017},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.740285Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:3e00bb3b8e3b800e100ebe9d99a4d91c665e7077416f5005cd974ea304e4465c","observation_id":"420b070a-ff4b-4341-bc40-f9ab7456889e","resolution":{"observed_at":"2026-08-11T17:42:15.649027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.632629Z","title":"Funsd: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"c310a761-22c0-40a4-8d5d-422955811c88","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.743453Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:962a32a1f585e15d9add614dcf5f6acfa6e5aecf4fa305bc424006b2c854b182","observation_id":"74329bad-5407-48c5-8423-7176f78b40f2","resolution":{"observed_at":"2026-08-11T17:42:15.637499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08255","last_updated":"2024-06-12T14:28:25Z","snapshot_observed_at":"2026-08-14T08:09:10.963424Z","submitted_at":"2024-06-12T14:28:25Z","title":"M3T: A New Benchmark Dataset for Multi-Modal Document-Level Machine Translation","version":1},"cited_work":{"arxiv_id":"2406.08255","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08255","snapshot_observed_at":"2026-08-11T17:42:15.154684Z","title":"M3T: A New Benchmark Dataset for Multi-Modal Document-Level Machine Translation","venue":"cs.CL","work_id":"4c7d8196-da1c-4c3b-8388-0735809348f2","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.748106Z"},"links":{"cited_paper":"/paper/2406.08255","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:e79ebfe4a622c39eaec5cd992f2f2238ca6418a3a1c0ea17e92655f90f82b5d9","observation_id":"c256a160-35cd-4c4f-85dc-b43b8871cd0f","resolution":{"observed_at":"2026-08-11T17:42:15.161999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-12T22:50:50.231608Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-11T17:42:14.751688Z","title":"mplug-docowl2: High-resolution compressing for ocr- free multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.751688Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:1c04b2df4af2d0ccec047d384f43c23f654f44ffa897f40a8df5fd39b6f4643a","observation_id":"06682577-5388-4b29-b7fa-a806ecdc8dc3","resolution":{"observed_at":"2026-08-11T17:42:14.751688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.622143Z","title":"Towards unified scene text spotting based on sequence generation","venue":null,"work_id":"2a0480e9-a96b-40ee-8f7d-ba54fc19ec21","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.755209Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:f9f7d4b41b7f339696473f13ebcddec164e5a63dbfa05d251c548c38c7d14ae7","observation_id":"33ef0390-6e67-4dfa-9864-6e3c4f3dac4d","resolution":{"observed_at":"2026-08-11T17:42:15.625573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.15664","last_updated":"2022-10-06T06:50:39Z","snapshot_observed_at":"2026-08-13T17:24:28.063798Z","submitted_at":"2021-11-30T18:55:19Z","title":"OCR-free Document Understanding Transformer","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.15664","snapshot_observed_at":"2026-08-11T17:42:14.758608Z","title":"Donut: Docu- ment understanding transformer without ocr","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.758608Z"},"links":{"cited_paper":"/paper/2111.15664","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:1137d8a083e1fa8390f42af9aa9b64ea1127ccff592980b9ba567aca881ff675","observation_id":"e2e9d1b4-b0b2-40de-981a-93cbddac54b1","resolution":{"observed_at":"2026-08-11T17:42:14.758608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02246","last_updated":"2024-05-03T17:00:00Z","snapshot_observed_at":"2026-08-14T05:56:43.101287Z","submitted_at":"2024-05-03T17:00:00Z","title":"What matters when building vision-language models?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02246","snapshot_observed_at":"2026-08-11T17:42:14.762029Z","title":"What matters when building vision-language models? arXiv preprint arXiv:2405.02246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.762029Z"},"links":{"cited_paper":"/paper/2405.02246","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:d2bab85bb655e8e11ed1f2471e13df095c0b4deac1e3dd32672865418290753d","observation_id":"7185aa3e-4c12-40d5-a219-ce5e089d5ed4","resolution":{"observed_at":"2026-08-11T17:42:14.762029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-11T17:42:14.765303Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.765303Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:2bf55248a8d8ca82c5cf0c5d09942598d5519cb90348bc415469f0daaa5d3b5d","observation_id":"cccefa27-388d-4548-a17e-43f726d64b16","resolution":{"observed_at":"2026-08-11T17:42:14.765303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.768805Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.768805Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:cc2c3637db0ed195a18ce071998a5a59abd07e01e0676811f3cb7f429a93a563","observation_id":"808b0bc4-6e05-4254-bdce-04d498a0186a","resolution":{"observed_at":"2026-08-11T17:42:14.768805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-11T17:42:14.772001Z","title":"Tokenpacker: Effi- cient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.772001Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b9f5e8dcea86f66c2e03dc046ba4a4b02da3d6bdc38154013a8ca806cbd5ecb5","observation_id":"a0873528-fedb-49f4-88f7-8c9689af5dca","resolution":{"observed_at":"2026-08-11T17:42:14.772001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.595823Z","title":"Scatter: selective con- text attentional scene text recognizer","venue":null,"work_id":"5df2aef0-1478-4b6b-b5c8-f10857e8f49c","year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.778183Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:d536c13abeaae3bba4006e1fe4f262ca5fec057848a5fcd06af4068c9949d3c6","observation_id":"a1cb8b79-8268-4011-8271-c5f017051d93","resolution":{"observed_at":"2026-08-11T17:42:15.601849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.781530Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.781530Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:47c5f43d5c5f5faf84219460172f1f3b3c81f7b0badf6a205a6217ef9552a650","observation_id":"9fdad15d-55ce-4431-9fe5-4d0bf66f134d","resolution":{"observed_at":"2026-08-11T17:42:14.781530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.784614Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.784614Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:9357e0c0a9aba9716d3dad0ca3a6bdb942404fbb8a432405ea6d0c643f0dfb2c","observation_id":"b9272f10-53a6-48da-b75c-b78946a74760","resolution":{"observed_at":"2026-08-11T17:42:14.784614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.562442Z","title":"Ocrbench: On the hidden mystery of ocr in large multimodal models, 2024","venue":null,"work_id":"e5b1f8cd-d931-4209-b50a-e37ecf24ae85","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.789406Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:7abf039396eebe8ae3e8c15bb3df0b522a14adcc66c322729369dbc10b72aa7f","observation_id":"dd5f3872-6ef9-4f77-8e34-ccbb466a6e86","resolution":{"observed_at":"2026-08-11T17:42:15.569569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-11T17:42:14.792528Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning.arXiv preprint arXiv:2203.10244, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.792528Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:0c3268712b7228362b27a31b4e3d5240a91060ea79091fd5fd5acd14ba1455d5","observation_id":"4be20eb9-54f9-4a2e-8cb7-53b5e0f58641","resolution":{"observed_at":"2026-08-11T17:42:14.792528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.547307Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"26d3ebb9-7d39-4d96-980e-431278eef71d","year":2021},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.796956Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:8b12d9efd1f9896bb7735088cb8a51f56d99e0b57359e2cab73aaa97705bc372","observation_id":"83b1b8fb-4943-4c57-931b-5ba6817448e9","resolution":{"observed_at":"2026-08-11T17:42:15.553179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.513293Z","title":"Infographicvqa","venue":null,"work_id":"15d8c7a8-c421-4348-a157-8c663f4d69fc","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.801218Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:aa5200b44fe17741b19f5dba0d2eadc5f914ca312f174478113b0d36b161b0cb","observation_id":"49244a03-65ff-401b-8ff1-1f842a332346","resolution":{"observed_at":"2026-08-11T17:42:15.534751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.804446Z","title":"Ocr-vqa: Visual question answering by reading text in images","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.804446Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:41ecbacc7912651bff23fa09d267788271ddc1c64374c9f386f98c097bdb8b5c","observation_id":"19674d70-1e3f-49a8-88e9-4b1ee35b7cd7","resolution":{"observed_at":"2026-08-11T17:42:14.804446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.483131Z","title":"Textadain: Paying attention to shortcut learning in text recognizers","venue":null,"work_id":"157f8307-d8f3-47c5-abdf-16fa635a814f","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.807710Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:2e0db180c667e69f62f2d0ea67eabf0ed284404116f036a93f4cdd15bc2c4ffa","observation_id":"aec45507-a783-4669-86b1-4295e6e6e4fd","resolution":{"observed_at":"2026-08-11T17:42:15.493123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-11T17:42:14.810883Z","title":"Kosmos-2: Ground- ing multimodal large language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.810883Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:4ee7277c3912ea44ccc8de3446e1d5313d3f42c885afb82ebd173c301547dae2","observation_id":"eca49a30-8850-46bd-a733-9f620a43f6f5","resolution":{"observed_at":"2026-08-11T17:42:14.810883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.814493Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.814493Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:3539d80e2d6f66608299b45df006e3f0251f00c951785d212a9314f47310f903","observation_id":"a1acf826-880f-4844-87cb-0403900ba6dd","resolution":{"observed_at":"2026-08-11T17:42:14.814493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03364","last_updated":"2022-08-05T19:14:43Z","snapshot_observed_at":"2026-08-14T06:46:23.756667Z","submitted_at":"2022-08-05T19:14:43Z","title":"GLASS: Global to Local Attention for Scene-Text Spotting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03364","snapshot_observed_at":"2026-08-11T17:42:14.818997Z","title":"Glass: Global to local attention for scene-text spotting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.818997Z"},"links":{"cited_paper":"/paper/2208.03364","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:f1a9afb433a6bb526b3e3348a0a24ad3d7e6d0b34d2fcc450a7bc47e86b2b2c2","observation_id":"b4c32e6e-f4a5-4dfa-b566-d7031b1c6888","resolution":{"observed_at":"2026-08-11T17:42:14.818997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:14.822578Z","title":"Textcaps: a dataset for image caption- ing with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.822578Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:1522bcccc5cc2ad478d29239700655db7337d72c4cdae17f39c8d76c66f05292","observation_id":"22912a0c-9d61-4879-b8fe-13698debcdd3","resolution":{"observed_at":"2026-08-11T17:42:14.822578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.434746Z","title":"Towards vqa models that can read","venue":null,"work_id":"06d4de09-f582-484a-b92b-61b40a979fb0","year":2019},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.826725Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:11eb0c8023563f9ba2cb819289054f38b6dee0c222afb8c7ccf9239650991ef0","observation_id":"3d30a0a9-8f37-44cb-99c9-20d469c48152","resolution":{"observed_at":"2026-08-11T17:42:15.438395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.398104Z","title":"Instructdoc: A dataset for zero-shot gener- alization of visual document understanding with instructions","venue":null,"work_id":"feb8c649-7959-40e8-b742-b18dc5009971","year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.832432Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:b4652f213a149bde7b194408c45c96a5dd8ae289ca821a3c198d772133a669f9","observation_id":"e2a6e898-08b5-4869-b4ea-79fc57b94d29","resolution":{"observed_at":"2026-08-11T17:42:15.421608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.383729Z","title":"Hi- erarchical multimodal transformers for multipage docvqa","venue":null,"work_id":"8d13bea6-6817-400e-8e41-9dc956ba3f4a","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.836449Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:3a0ec927f744d029d8357e9b2a7463e1e34cb4f9e23005116e4bbc8c52429d57","observation_id":"4fc6056f-ba81-4d87-9163-bd3fbb4aa3c4","resolution":{"observed_at":"2026-08-11T17:42:15.391807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.365738Z","title":"Document understanding dataset and evaluation (dude)","venue":null,"work_id":"59514c77-f982-4e7e-95d2-5f58ab4836d5","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.850835Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:9c5c2245947422e7aff74f37572efe78085f903d46103b356e36e98a25496938","observation_id":"f2f38ca2-8ee0-429e-a95b-d9d29bfbb79a","resolution":{"observed_at":"2026-08-11T17:42:15.370799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00908","last_updated":"2023-12-31T22:37:52Z","snapshot_observed_at":"2026-08-13T04:50:40.422288Z","submitted_at":"2023-12-31T22:37:52Z","title":"DocLLM: A layout-aware generative language model for multimodal document understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00908","snapshot_observed_at":"2026-08-11T17:42:14.858346Z","title":"Docllm: A layout-aware genera- tive language model for multimodal document understand- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.858346Z"},"links":{"cited_paper":"/paper/2401.00908","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:abdf6ef242ab30984cf71ead84e8df5103652c6a0cc3ba4e1c087f5ad6328c83","observation_id":"8a1ab35e-680a-4395-8b0d-539f5af5fb83","resolution":{"observed_at":"2026-08-11T17:42:14.858346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T17:42:14.862395Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.862395Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:2de3eccad52fc0c3f4c318d8423e56a67919fe260ae475b4f29b361ef66ca35b","observation_id":"c6e054a9-6d96-4299-8b1f-da5b50f2d127","resolution":{"observed_at":"2026-08-11T17:42:14.862395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00526","last_updated":"2023-09-07T08:40:16Z","snapshot_observed_at":"2026-08-14T10:29:39.653210Z","submitted_at":"2023-06-01T10:28:12Z","title":"Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00526","snapshot_observed_at":"2026-08-11T17:42:14.867758Z","title":"Layout and task aware instruction prompt for zero-shot document image question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.867758Z"},"links":{"cited_paper":"/paper/2306.00526","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:7517948894b8c6b7395de11f336fb7e144a915b567f3d68a877e8b8748fcbaee","observation_id":"c96d11ff-42d2-4c2a-9ca8-414d0cfd81f1","resolution":{"observed_at":"2026-08-11T17:42:14.867758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.355338Z","title":"Layoutlm: Pre-training of text and layout for document image understanding","venue":null,"work_id":"355e71a1-90c4-42f4-9974-92291916589a","year":2020},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.873685Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:5cdf76583da5af8bb8a911915ce1c8208cedb1ef8d962543e0cbc392ccbc8296","observation_id":"b02716ba-9456-4415-9e20-88f23408f67f","resolution":{"observed_at":"2026-08-11T17:42:15.359252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-13T05:54:33.801989Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-11T17:42:14.877803Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.877803Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:bdf99045d73e7c6ec9684ad282ad36fbe00233dff046c67e28fe0f0d3837f77d","observation_id":"9f687888-e6cb-4ea7-8640-113138fd9b41","resolution":{"observed_at":"2026-08-11T17:42:14.877803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.343470Z","title":"Dptext-detr: Towards better scene text detection with dynamic points in transformer","venue":null,"work_id":"f9b3b1cb-f683-4c0b-b405-a8e272c5b3c4","year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.881568Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:462ffc009147205e6456e2d9a6263ca353e79762b349a107dd139e460d6e7917","observation_id":"c9cca9cb-c68d-4cc0-8bb8-54592e6afc9e","resolution":{"observed_at":"2026-08-11T17:42:15.347097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.326171Z","title":"Deepsolo: Let transformer decoder with explicit points solo for text spot- ting","venue":null,"work_id":"f5f76914-c4a5-4e46-aba3-4643a2aebdec","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.888590Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:001b74082231c2057f12239fba99e63826501bef20be2a4b2780b08c1882d62e","observation_id":"a6f9ff17-c632-449a-b020-fb0fb9f84129","resolution":{"observed_at":"2026-08-11T17:42:15.331773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T17:42:14.892017Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.892017Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:c806a460a6dcd0c8eb303a3e0a3ff78ae8a945a5e582585abca0719febda1b1b","observation_id":"4d194bfd-b861-4324-b4ef-628cc0342fc5","resolution":{"observed_at":"2026-08-11T17:42:14.892017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-13T05:45:31.410659Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-11T17:42:14.897792Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.897792Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:5271a0b590822d0e6e1fd9b6dfcffa9c1b8a06962aa2b6961152cbfa0614f19e","observation_id":"381c7c14-7bc2-468b-adad-b45847ef488a","resolution":{"observed_at":"2026-08-11T17:42:14.897792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-11T17:42:14.901281Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.901281Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:7fbf6cf1cda6477a5aa6af4536b481fd9812c56784d55aa4cfec81ab448872d2","observation_id":"f3afa750-7b12-474b-ae8e-56f25805e8af","resolution":{"observed_at":"2026-08-11T17:42:14.901281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.315169Z","title":"Towards complex doc- ument understanding by discrete reasoning","venue":null,"work_id":"066cb9f2-e82f-4406-8baa-e37c33ef7aca","year":2022},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.905475Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:216789edab8895cda63b68e562b660f90cab4a6c806f20b209e32c1c0c9fe907","observation_id":"23c2e6cd-2f15-4de5-b2ee-35443e785d9d","resolution":{"observed_at":"2026-08-11T17:42:15.318670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T17:42:15.293850Z","title":"The encoder is initial- ized with pretrained weights from DocFormerV2, which was pretrained on the Industry Document Library (IDL) dataset [13]","venue":null,"work_id":"e3f7cf2a-c1fb-4677-850a-4247153de413","year":null},"citing_paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T17:42:14.915935Z"},"links":{"citing_paper":"/paper/2412.08746"},"observation_digest":"sha256:2807a0c85e95a4d57316f91163995f72366248885d621d67bd8d55141977f659","observation_id":"c79542d8-7131-404a-813b-9090a688b5c9","resolution":{"observed_at":"2026-08-11T17:42:15.302121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.08746","last_updated":"2024-12-11T19:35:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T02:34:42.612932Z","submitted_at":"2024-12-11T19:35:06Z","title":"DocVLM: Make Your VLM an Efficient Reader"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2412.08746."}