{"as_of":"2026-08-13T16:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2540960dd0232ad36ecb14346fc2bb61fb0cc2dee356f29847a942bbe26e2929","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:13:29.887857Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:07:53.544005Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T04:44:02.457882Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00151","snapshot_observed_at":"2026-08-06T17:07:53.544005Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.12490","last_updated":"2025-07-15T20:05:25Z","snapshot_observed_at":"2026-08-08T01:49:25.936637Z","submitted_at":"2025-07-15T20:05:25Z","title":"Spatially Grounded Explanations in Vision Language Models for Document Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:07:53.544005Z"},"links":{"cited_paper":"/paper/2412.00151","citing_paper":"/paper/2507.12490"},"observation_digest":"sha256:92ad9582578ca319b4c1faf93bc633ac8d8498d798144f45d56b6f6f091cc37f","observation_id":"b8fcff72-8148-4bbc-8735-301968efb62e","resolution":{"observed_at":"2026-08-06T17:07:53.544005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"cited_work":{"arxiv_id":"2412.00151","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00151","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dlava: Document lan- guage and vision assistant for answer localization with en- hanced interpretability and trustworthiness","venue":null,"work_id":"75d54572-8376-42bc-8315-e5683b10d06a","year":2024},"citing_paper":{"arxiv_id":"2511.22521","last_updated":"2026-04-16T14:40:49Z","snapshot_observed_at":"2026-08-13T15:31:05.771750Z","submitted_at":"2025-11-27T15:00:58Z","title":"DocVAL: Validated Chain-of-Thought Distillation for Grounded Document VQA","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T04:41:55.030673Z"},"links":{"cited_paper":"/paper/2412.00151","citing_paper":"/paper/2511.22521"},"observation_digest":"sha256:91b7cb6ba280d0a4afc4f066a45967535b46b5b7c991df7b59709ce5454329c7","observation_id":"8e5826c9-dd94-46cc-8d8c-4fe1a8678444","resolution":{"observed_at":"2026-05-17T04:44:02.459977Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00151","snapshot_observed_at":"2026-08-02T01:25:28.323502Z","title":"arXiv preprint arXiv:2412.00151 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14682","last_updated":"2026-07-16T07:43:39Z","snapshot_observed_at":"2026-08-11T19:52:36.168592Z","submitted_at":"2026-07-16T07:43:39Z","title":"Stop Thinking, Start Looking: Efficient Post-Training for Multimodal Document Question Answering via Reasoning-Free Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-02T01:25:28.323502Z"},"links":{"cited_paper":"/paper/2412.00151","citing_paper":"/paper/2607.14682"},"observation_digest":"sha256:16aa5ef4285c33a95b96ab09ee70909f8e980f927793b36d474df672bfcc2ab7","observation_id":"13c8431a-09e6-43fe-bf40-f1ecb82f34a6","resolution":{"observed_at":"2026-08-02T01:25:28.323502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.00151/citation-record","integrity":"/paper/2412.00151/integrity","json":"/paper/2412.00151/citation-record.json","paper":"/paper/2412.00151"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:28.686393Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.686393Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:c5b54435806afdec39dab76eb737ce0d07449a822bf2931003cd44a7f271d37a","observation_id":"e0d80dc3-aaf1-4e20-a0dd-f274cd6183cb","resolution":{"observed_at":"2026-08-12T10:13:28.686393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-12T10:13:28.764154Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.764154Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:6a02cb6f5fd9147035a54beb3ba8169d7f17a2fa712e02f1487abfd6068b1853","observation_id":"9bcb9371-e82c-4bc1-8af1-7e0b7714cf15","resolution":{"observed_at":"2026-08-12T10:13:28.764154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.503325Z","title":"Vision transformer for fast and efficient scene text recognition","venue":null,"work_id":"2b580880-6b0b-4692-addd-dc1cd8d207c7","year":2021},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.779678Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:2fcc4be4ea6cf48441d3baf61c8a51a87ea27f32503fe3bb804e97d43e0e1b5d","observation_id":"0f71ecc7-3cfa-419d-b13c-962ce18621af","resolution":{"observed_at":"2026-08-12T10:13:31.546888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.484432Z","title":"Scene text recognition with permuted autoregressive sequence models","venue":null,"work_id":"b8c958c6-c542-4b46-a335-d0982468701f","year":2022},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.791634Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:6d34a6459374e8d4cdb746c4119ff8a4cc1969a681fd455d409769d2a7291e79","observation_id":"233e36ff-921b-4862-861c-7d5b6cd666e7","resolution":{"observed_at":"2026-08-12T10:13:31.489758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02394","last_updated":"2023-01-11T14:04:01Z","snapshot_observed_at":"2026-07-06T12:05:07.980255Z","submitted_at":"2021-11-03T17:58:47Z","title":"FAST: Faster Arbitrarily-Shaped Text Detector with Minimalist Kernel Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02394","snapshot_observed_at":"2026-08-12T10:13:28.799767Z","title":"Fast: Faster arbitrarily-shaped text detector with minimalist kernel representation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.799767Z"},"links":{"cited_paper":"/paper/2111.02394","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:1b4cbfaab953f7af90e78159576cd5bf9b64b502b681927a016214b3c5dd76b1","observation_id":"fdf3778b-c7ff-4cc8-9bd0-9c1251f9c726","resolution":{"observed_at":"2026-08-12T10:13:28.799767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-12T10:13:28.811476Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.811476Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:548344ebf1955a9cf04cf3d59077dc27d71e9a557f86aca4fa567b7b2548e284","observation_id":"8e4be6ac-9f30-4f9f-be78-d302dcc71de1","resolution":{"observed_at":"2026-08-12T10:13:28.811476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T10:13:28.841407Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.841407Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:57b3ec511c39263f0ed54a5b889bc352c378b67f2be4f671ea2b43e984a02dc7","observation_id":"4444bbda-73bc-4e82-872f-3be4203913e7","resolution":{"observed_at":"2026-08-12T10:13:28.841407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:28.859207Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.859207Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:9d80b45e577ba3296b1298b058f91efd3408fe3c1937de2625d04bc671a081d4","observation_id":"83f3f23e-022b-4587-8287-c376b7ab17cd","resolution":{"observed_at":"2026-08-12T10:13:28.859207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:28.868037Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.868037Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:51f561b23c628f70ed9ee07e4d36c421b8c880d3bcb6bb7fb6ab0f6bddd26606","observation_id":"709d6934-67e5-454f-b908-494e30aa8bd3","resolution":{"observed_at":"2026-08-12T10:13:28.868037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T10:13:28.873924Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.873924Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:3ac82e4ff7dbb8d6f0a0304b2739d04c5403362de436862f97e6b1c7ea3a9c95","observation_id":"ece1e68a-f183-4f67-af7a-b307804581c2","resolution":{"observed_at":"2026-08-12T10:13:28.873924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.339750Z","title":"Dtrocr: Decoder-only transformer for optical character recognition","venue":null,"work_id":"fd41c979-19d5-49ae-a4b4-0d2a722bf8a6","year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.879841Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:5b374449f552eeec3b820c74d7e333eeaf56cd168f843b0cb00cd94c785a8287","observation_id":"a6ff43f4-b7f9-4c69-8ed1-f37a2a170e15","resolution":{"observed_at":"2026-08-12T10:13:31.400336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.10997","last_updated":"2024-03-27T09:16:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-18T07:47:33Z","title":"Retrieval-Augmented Generation for Large Language Models: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.10997","snapshot_observed_at":"2026-08-12T10:13:28.886064Z","title":"Retrieval-augmented generation for large language models: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.886064Z"},"links":{"cited_paper":"/paper/2312.10997","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:f5c4682b51e4f41d6d429dffc05004f72800c5f2c7053175a10637dcce969b52","observation_id":"f1f9abc0-e275-4b8e-a3e3-aae723b5c98d","resolution":{"observed_at":"2026-08-12T10:13:28.886064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12354","last_updated":"2024-07-04T18:33:00Z","snapshot_observed_at":"2026-08-13T12:08:10.452240Z","submitted_at":"2024-02-19T18:33:49Z","title":"LoRA+: Efficient Low Rank Adaptation of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12354","snapshot_observed_at":"2026-08-12T10:13:28.891759Z","title":"Lora+: Efficient low rank adaptation of large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.891759Z"},"links":{"cited_paper":"/paper/2402.12354","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:3fdf1be9a2e71edf38638362254a705ee9aaf6d2630200ba23672afd24832bae","observation_id":"e7da7fed-e7a0-485d-b614-a55109a7b570","resolution":{"observed_at":"2026-08-12T10:13:28.891759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.276753Z","title":"Icl-d3ie: In-context learning with diverse demonstrations updating for document information extraction","venue":null,"work_id":"69c1aed2-485b-48b8-9270-a66b16971964","year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.896935Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:4cb24c2ead78144ab8347f8a35e0f942e4245651ad5887ef5b1e994940071c9d","observation_id":"3cea5e5f-0040-4241-a0cd-613349378ddc","resolution":{"observed_at":"2026-08-12T10:13:31.282162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T10:13:28.921379Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:28.921379Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:c447f9c3461f950ea0a25c9f276de87515084067bab1e73069e996794f0b6b7b","observation_id":"46c45ae0-8534-46bd-8d5c-3983522dec5a","resolution":{"observed_at":"2026-08-12T10:13:28.921379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.253865Z","title":"Layoutlmv3: Pre-training for document ai with unified text and image masking","venue":null,"work_id":"972c33a4-e967-4f96-9f12-9a6fac6c85cd","year":2022},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.037690Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:c81cb900f761865e995cc3cf194056c3c15bc0bc80b6393e6f086ab1486b1f6b","observation_id":"fd3eeaa5-026f-4530-98cc-0a5118ec88b8","resolution":{"observed_at":"2026-08-12T10:13:31.264667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.05561","last_updated":"2024-09-30T10:17:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-10T22:07:21Z","title":"TrustLLM: Trustworthiness in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.05561","snapshot_observed_at":"2026-08-12T10:13:29.102929Z","title":"Trustllm: Trustworthiness in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.102929Z"},"links":{"cited_paper":"/paper/2401.05561","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:c6e6f8d873e0cb6d80d364a65864a4ae9265c84a99d70f9c1b83c9226904a4c0","observation_id":"464c226c-995c-479a-94e3-24e3fd79c8cc","resolution":{"observed_at":"2026-08-12T10:13:29.102929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.107738Z","title":"Icdar2019 competition on scanned receipt ocr and information extraction","venue":null,"work_id":"38ad1093-06bd-4e2c-9496-ff098e1da258","year":2019},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.195342Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:ddd33de6222cbc7b22bbe5775a9bb6b96126b3c28d41c0a8426b5b4677a4bdca","observation_id":"4fc0f8b1-a59b-4dff-91f2-a8596553d501","resolution":{"observed_at":"2026-08-12T10:13:31.156302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.089558Z","title":"From image to language: A critical analysis of visual question answering (vqa) approaches, challenges, and opportunities","venue":null,"work_id":"8ab0d243-c6ae-41c6-948f-9672ce7c91db","year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.220974Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:8f95c47fef0dd07479e6785c97e8daa55d957a0a4f4caca371e04c47c5347ef6","observation_id":"33ce8a36-0753-4860-9bcc-56f1e33e89bd","resolution":{"observed_at":"2026-08-12T10:13:31.094217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.073270Z","title":"Funsd: A dataset for form understanding in noisy scanned documents","venue":null,"work_id":"d523b722-1e21-4924-bc7a-172e4a11108e","year":2019},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.240067Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:2b8e43062eaff2ab8f66d369a14bacc8b270b4304722e319a729fce5f60e5f36","observation_id":"c289804d-c757-4bc5-8362-939f304538a0","resolution":{"observed_at":"2026-08-12T10:13:31.077837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:31.004009Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"c522f215-0dae-4de6-97ee-6750f1120701","year":2022},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.260382Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:883e1d7094bafcffb20c3d11f7924627307a32e3b2a5374504e72dc70b699b31","observation_id":"c902eb2d-3712-4613-b96b-5fc156ac7031","resolution":{"observed_at":"2026-08-12T10:13:31.061211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15080","last_updated":"2023-10-26T12:51:07Z","snapshot_observed_at":"2026-08-13T11:34:32.068352Z","submitted_at":"2023-05-24T11:59:13Z","title":"Visually-Situated Natural Language Understanding with Contrastive Reading Model and Frozen Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15080","snapshot_observed_at":"2026-08-12T10:13:29.276604Z","title":"Visually-situated natural language understanding with contrastive reading model and frozen large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.276604Z"},"links":{"cited_paper":"/paper/2305.15080","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:eff5059adbe5c5f553310a76e89b39ae71e2ccb71470ebeccf5716dd7f3fc181","observation_id":"095cf3f5-8ab4-44e6-9364-1bffa057965d","resolution":{"observed_at":"2026-08-12T10:13:29.276604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T10:13:29.281806Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.281806Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:f1736792e7acd0918b7d93e93c007b6608b041f7252a9c9c3dcc076a070b66a6","observation_id":"91cd93d8-0d02-44e7-96ff-8281be9747c7","resolution":{"observed_at":"2026-08-12T10:13:29.281806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.880863Z","title":"Show, attend and read: A simple and strong baseline for irregular text recognition","venue":null,"work_id":"0e62cef8-0a78-4019-a4d0-54a9bf096d89","year":2019},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.287419Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:d67b453987fe708598a16666adcc9e1a72f411c932e358e43f7d7a2876417850","observation_id":"6bcf163b-ccfa-429d-840b-cf3c19746ea1","resolution":{"observed_at":"2026-08-12T10:13:30.906380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.864476Z","title":"Trocr: Transformer-based optical character recognition with pre-trained models","venue":null,"work_id":"12afbaf6-d2db-4291-84d3-9b76ed2544f0","year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.292071Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:e1e476bda563c17da29bb36694753d86f528fec4f916f20d1259367d281930c4","observation_id":"14374c31-e293-4bdf-9370-5253ac943455","resolution":{"observed_at":"2026-08-12T10:13:30.869327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.849920Z","title":"Real-time scene text detection with differentiable binarization","venue":null,"work_id":"176a2b5e-b6a8-4804-b41f-5b40b2048a39","year":2020},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.297851Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:ddb363210ceea033bcd43f72dc2968a3328082a500bb3f4c8888921ff3a407d3","observation_id":"0a23538a-cf0a-4bb4-8c83-487443b8c7a2","resolution":{"observed_at":"2026-08-12T10:13:30.854445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15045","last_updated":"2025-03-19T10:05:04Z","snapshot_observed_at":"2026-08-12T22:56:38.408867Z","submitted_at":"2024-08-27T13:13:38Z","title":"DocLayLLM: An Efficient Multi-modal Extension of Large Language Models for Text-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15045","snapshot_observed_at":"2026-08-12T10:13:29.303009Z","title":"Doclayllm: An efficient and effective multi-modal extension of large language models for text-rich document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.303009Z"},"links":{"cited_paper":"/paper/2408.15045","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:cf3a82b46be3d2d3e9724097a1d556fab100cba9d809e8d1c013200dfdb160cb","observation_id":"cea610ae-b9d6-4768-9db0-8826fbc32897","resolution":{"observed_at":"2026-08-12T10:13:29.303009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09353","last_updated":"2024-07-09T05:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-14T17:59:34Z","title":"DoRA: Weight-Decomposed Low-Rank Adaptation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09353","snapshot_observed_at":"2026-08-12T10:13:29.308712Z","title":"Dora: Weight-decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.308712Z"},"links":{"cited_paper":"/paper/2402.09353","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:fd16ae96539295ba6ddcbba6ef94aa65308edd4bd3f6f273361014cde07667ef","observation_id":"04012c68-cb70-46e2-bc58-f28a534908ac","resolution":{"observed_at":"2026-08-12T10:13:29.308712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01976","last_updated":"2025-05-19T11:31:04Z","snapshot_observed_at":"2026-08-13T01:48:26.759959Z","submitted_at":"2024-07-02T06:29:05Z","title":"A Bounding Box is Worth One Token: Interleaving Layout and Text in a Large Language Model for Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01976","snapshot_observed_at":"2026-08-12T10:13:29.314172Z","title":"A bounding box is worth one token: Interleaving layout and text in a large language model for document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.314172Z"},"links":{"cited_paper":"/paper/2407.01976","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:31a5a7e7b42f371ad05b138ab1828569411c2af490cd4c6be9100bb3cce874f8","observation_id":"24918f95-f5ac-4e13-a9b6-509d24b8efd8","resolution":{"observed_at":"2026-08-12T10:13:29.314172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.721304Z","title":"Master: Multi-aspect non-local network for scene text recognition","venue":null,"work_id":"360e036d-b0da-4016-b3b3-76c24963635f","year":2021},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.319771Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:cd0af5e81389b32e6173e32c381eb3c49dcac9d4a9f8df2320cbbe7752a95cbe","observation_id":"41adb064-175b-4bf1-9bd7-8b884ddd6f79","resolution":{"observed_at":"2026-08-12T10:13:30.832727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.616122Z","title":"Layoutllm: Layout instruction tuning with large language models for document understanding","venue":null,"work_id":"d7730ea2-6c85-4005-9ff0-5cdb86622568","year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.324860Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:8e3f0e2060531b1430a0f9133fe3a43981142971517967e4469557875ef96856","observation_id":"3c7031a7-8f4a-41f9-9247-c52d6a116b24","resolution":{"observed_at":"2026-08-12T10:13:30.666353Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00311","last_updated":"2023-10-10T03:06:45Z","snapshot_observed_at":"2026-08-13T15:32:34.840752Z","submitted_at":"2022-06-01T08:27:19Z","title":"MaskOCR: Text Recognition with Masked Encoder-Decoder Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.00311","snapshot_observed_at":"2026-08-12T10:13:29.397549Z","title":"Maskocr: Text recognition with masked encoder-decoder pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.397549Z"},"links":{"cited_paper":"/paper/2206.00311","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:a594ce20278005a41afbf449ca5bde69daf588593b8730f93d9604e44eafc3fc","observation_id":"c55309fc-07ea-4dcf-ae19-6aef6a5878c7","resolution":{"observed_at":"2026-08-12T10:13:29.397549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:29.484467Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.484467Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:6ebcfe1c74dc16cfff0fb80732cca6fe1b29b2f5f54e5a3268fd092c9aca6816","observation_id":"e8a5b922-66ea-488d-a05f-58ba5331d102","resolution":{"observed_at":"2026-08-12T10:13:29.484467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:29.620032Z","title":"Cord: a consolidated receipt dataset for post-ocr parsing","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.620032Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:b4f0e9ac404e079673b1b14f54c7f66d9e1178b1e5bd0f2eaf3e44a101fbb8d5","observation_id":"db6c78e2-d984-4198-a42c-2a2ef5d21ec1","resolution":{"observed_at":"2026-08-12T10:13:29.620032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.480290Z","title":"Generalized intersection over union: A metric and a loss for bounding box regression","venue":null,"work_id":"9a9ec7ac-771a-4a70-901f-613f398fc674","year":2019},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.711859Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:3bbaaf3a4b50630cb0997cbee1937a40623f02dd9bf23fb30268c785d5143c99","observation_id":"046668fb-9f94-48ed-900a-fea9b353c07c","resolution":{"observed_at":"2026-08-12T10:13:30.486734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.454745Z","title":"An end-to-end trainable neural network for image-based sequence recognition and its application to scene text recognition","venue":null,"work_id":"0e761cb8-9886-4e60-b220-99b293ba99d2","year":2016},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.764976Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:fa03a194dc8a4902b1cb0dd0f446b27727607635d106983979dcd7f48443fd9c","observation_id":"0dff8af7-c726-4a5c-b031-9daa5ef25106","resolution":{"observed_at":"2026-08-12T10:13:30.461824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.432584Z","title":"Instructdoc: A dataset for zero-shot generalization of visual document understanding with instructions","venue":null,"work_id":"40f2ded2-fc6d-4007-9803-324b167302fb","year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.792352Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:a91220fdec4f84ea047efbd50e3251ff54dbbf67dc138430fc2451a538cec5fd","observation_id":"09931be9-998f-4adf-8e53-60553123597a","resolution":{"observed_at":"2026-08-12T10:13:30.437769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.365065Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"3c75f0ba-91f9-48e5-83d4-713940f61f37","year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.825256Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:b18b205046eb882393f0d07f2efb6cf912ac8ed16d239cee213e0d65efbb2c7f","observation_id":"67b0da32-b059-4f5f-a8f7-adba54f3ba71","resolution":{"observed_at":"2026-08-12T10:13:30.390476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T10:13:29.848452Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.848452Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:3302a5d19e5364f84392afb79ac8e6d840440c64bd8ad62c16827210667a2b2f","observation_id":"0138eb19-e9a8-4353-8477-4af778f08be8","resolution":{"observed_at":"2026-08-12T10:13:29.848452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:30.280653Z","title":"Omniparser: A unified framework for text spotting key information extraction and table recognition","venue":null,"work_id":"4788e0c0-2e0f-4208-9d6c-4c027b8df6a1","year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.858078Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:bf9213a381dfe9427cca587d72040f4fe8e8a70d8e396c1867e7c3453efc736d","observation_id":"ec38c8da-6808-4311-8cf9-b1aed03653b8","resolution":{"observed_at":"2026-08-12T10:13:30.348538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T10:13:29.869788Z","title":"Qwen2-vl: Enhancing vision-language model's perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.869788Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:f6ade1c53cb99563e0bbac97f4fb2f8126290294edfaca36b1edcc23c3ea6212","observation_id":"56d10951-a55a-4939-ab07-6aa3e32019f4","resolution":{"observed_at":"2026-08-12T10:13:29.869788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00526","last_updated":"2023-09-07T08:40:16Z","snapshot_observed_at":"2026-08-13T11:27:29.740387Z","submitted_at":"2023-06-01T10:28:12Z","title":"Layout and Task Aware Instruction Prompt for Zero-shot Document Image Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00526","snapshot_observed_at":"2026-08-12T10:13:29.874227Z","title":"Layout and task aware instruction prompt for zero-shot document image question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.874227Z"},"links":{"cited_paper":"/paper/2306.00526","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:3cf8143124444405a41d2f7d5a4b4425438edaa8d748fb1b45c59a2915035ec4","observation_id":"ba2aeb0b-fcf8-4247-bb6e-ffd64ea540cf","resolution":{"observed_at":"2026-08-12T10:13:29.874227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:29.878827Z","title":"A normalized levenshtein distance metric","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.878827Z"},"links":{"citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:b811ff8c75087c15617bf138af709b3e950900dd0d7b66fb1c419e61cf1e5666","observation_id":"938f48a7-1a9f-4219-b363-e08acc3aa3d5","resolution":{"observed_at":"2026-08-12T10:13:29.878827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12817","last_updated":"2023-08-28T01:45:09Z","snapshot_observed_at":"2026-08-13T10:29:16.836874Z","submitted_at":"2023-08-23T05:13:00Z","title":"MixNet: Toward Accurate Detection of Challenging Scene Text in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12817","snapshot_observed_at":"2026-08-12T10:13:29.882984Z","title":"Mixnet: toward accurate detection of challenging scene text in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.882984Z"},"links":{"cited_paper":"/paper/2308.12817","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:a6076a0dbec77f796390f077039d6306fa0eba9e5b6e848ebdc7d1a75edc71d2","observation_id":"d140bdda-db4f-4397-b489-6a1a58f4cafe","resolution":{"observed_at":"2026-08-12T10:13:29.882984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-12T10:13:29.887857Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T10:13:29.887857Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.00151"},"observation_digest":"sha256:34ae4aba969e34af8571fb84bf2722ca22f3b6895d0b2ad0b3948d3c72048ae9","observation_id":"7edc6aaf-2860-41f6-8347-58a8f0931ca9","resolution":{"observed_at":"2026-08-12T10:13:29.887857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.00151","last_updated":"2025-07-10T02:48:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T02:05:10.723589Z","submitted_at":"2024-11-29T06:17:11Z","title":"DLaVA: Document Language and Vision Assistant for Answer Localization with Enhanced Interpretability and Trustworthiness"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 3 inbound Pith citation observations for arXiv:2412.00151."}