{"as_of":"2026-08-09T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:88fb8567998058fdddd01d312a5835859d4cfd759c25196e3327d68358ad63c4","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:31.079587Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T07:13:06.644583Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":286,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:6eef51fa588ecd4d3afbf297ff1e925da8a8f36267c8a275905559871e99232f","observation_id":"a6719a44-8107-49c8-ba88-5c2df4e4c016","resolution":{"observed_at":"2026-05-10T13:23:58.272883Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-05-11T10:09:21.542356Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2412.10302"},"observation_digest":"sha256:5e426b7a95efd073e1b5b4d9cc62c58380ae00daa37994781037ae4566ee00ac","observation_id":"51d4c1cb-6033-4345-a32b-c74ed19ae48d","resolution":{"observed_at":"2026-05-11T10:09:26.325640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":141,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:71bb3961e23a9f55a7d468a8fa2eb43fe48154181305b1bb337422b136e910c0","observation_id":"8e87d110-f4fe-44ac-9097-1b8a3435c0db","resolution":{"observed_at":"2026-05-10T13:41:08.163440Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-07T15:42:31.079587Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14059","last_updated":"2025-05-20T08:03:59Z","snapshot_observed_at":"2026-08-08T07:54:09.757528Z","submitted_at":"2025-05-20T08:03:59Z","title":"Dolphin: Document Image Parsing via Heterogeneous Anchor Prompting","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:31.079587Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2505.14059"},"observation_digest":"sha256:5ac7e5197857d11844d409b0fbf08d043d705c0f49a789f5695757edc1a8593a","observation_id":"d579bcc5-90ce-4206-a9d1-ca44152c45a2","resolution":{"observed_at":"2026-08-07T15:42:31.079587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-07T14:57:21.429164Z","title":"Texthawk2: A large vision- language model excels in bilingual ocr and grounding with 16x fewer tokens.arXiv preprint arXiv:2410.05261, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17163","last_updated":"2026-05-26T01:50:12Z","snapshot_observed_at":"2026-08-07T14:52:59.748689Z","submitted_at":"2025-05-22T15:25:14Z","title":"OCR-Reasoning Benchmark: Unveiling the True Capabilities of MLLMs in Complex Text-Rich Image Reasoning","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:57:21.429164Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2505.17163"},"observation_digest":"sha256:2429307bda4792f3f788b4add24c370f6c0adab76384e42f8d852743a6c08b4a","observation_id":"73163043-530e-41f2-8ede-891deaf0a7d3","resolution":{"observed_at":"2026-08-07T14:57:21.429164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2507.09861","last_updated":"2026-04-21T13:31:05Z","snapshot_observed_at":"2026-07-06T21:56:35.665677Z","submitted_at":"2025-07-14T02:10:31Z","title":"A Survey on MLLM-based Visually Rich Document Understanding: Methods, Challenges, and Emerging Trends","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-19T04:38:49.512293Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2507.09861"},"observation_digest":"sha256:ace09e042da676bd2ab639409e671a99cebe4906529a46b068c9ac7502aadb58","observation_id":"1b75d618-2b7d-4489-bec3-61f553f0e1ad","resolution":{"observed_at":"2026-05-19T04:42:04.361196Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-08-06T13:45:18.536837Z","title":"Tex- thawk2: A large vision-language model excels in bilin- gual ocr and grounding with 16x fewer tokens,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20145","last_updated":"2025-07-27T06:44:53Z","snapshot_observed_at":"2026-08-08T10:07:05.353800Z","submitted_at":"2025-07-27T06:44:53Z","title":"Multi-Agent Interactive Question Generation Framework for Long Document Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:45:18.536837Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2507.20145"},"observation_digest":"sha256:470aa2ff90021713a8feb17e3d8c9de6645a93aca37a2c45accde0e748ed5e7e","observation_id":"2ddefe12-f8f7-430b-932b-7aec5aeb1566","resolution":{"observed_at":"2026-08-06T13:45:18.536837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:839ffe0b7cea121d58ef72fdf3b851d9f70c088c86267e321a9172beb21d39ea","observation_id":"04693b41-5900-4236-b76b-41a5c210de4b","resolution":{"observed_at":"2026-05-10T11:58:58.933332Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2604.00161","last_updated":"2026-04-21T01:45:08Z","snapshot_observed_at":"2026-07-06T22:51:22.254518Z","submitted_at":"2026-03-31T19:09:55Z","title":"Q-Mask: Query-driven Causal Masks for Text Anchoring in OCR-Oriented Vision-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:53.449935Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2604.00161"},"observation_digest":"sha256:886f73f0a92c58f7f57b1dc902d22fc11098807ca4ed9901af8e75e675f2ba23","observation_id":"81fefa0e-6857-40a4-adf0-e7f5603a0335","resolution":{"observed_at":"2026-05-13T23:33:26.644288Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2604.09442","last_updated":"2026-04-10T15:58:31Z","snapshot_observed_at":"2026-07-06T22:58:17.167367Z","submitted_at":"2026-04-10T15:58:31Z","title":"UIPress: Bringing Optical Token Compression to UI-to-Code Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-10T17:21:32.024105Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2604.09442"},"observation_digest":"sha256:df29a6ea76b57bc635669ce8894bd40579dd825cf15bb8024023769f458b968d","observation_id":"19b594b1-1a15-4592-a419-388cb0803ad0","resolution":{"observed_at":"2026-05-11T07:00:59.204276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2604.13029","last_updated":"2026-04-14T17:58:22Z","snapshot_observed_at":"2026-07-06T23:01:05.634599Z","submitted_at":"2026-04-14T17:58:22Z","title":"Visual Preference Optimization with Rubric Rewards","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T15:45:52.980881Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2604.13029"},"observation_digest":"sha256:c82e65c45130578b62915028c471822a93d1b3d4fdaccfe087131ca60830775d","observation_id":"793c502c-88b8-4fad-ab15-0882408abbc4","resolution":{"observed_at":"2026-05-11T09:56:00.866790Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens","version":1},"cited_work":{"arxiv_id":"2410.05261","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.05261","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TextHawk2: A large vision- language model excels in bilingual OCR and grounding with 16 × fewer tokens","venue":null,"work_id":"424307f9-b0f3-4ee8-aefb-23b4485205d5","year":2024},"citing_paper":{"arxiv_id":"2605.19307","last_updated":"2026-05-19T03:37:54Z","snapshot_observed_at":"2026-07-06T23:30:02.207108Z","submitted_at":"2026-05-19T03:37:54Z","title":"MetaRA: Metamorphic Robustness Assessment for Multimodal Large Language Model-based Visual Question Answering Systems","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T07:08:27.096029Z"},"links":{"cited_paper":"/paper/2410.05261","citing_paper":"/paper/2605.19307"},"observation_digest":"sha256:ac197faaec91c9be404bbdef0a44f28e03a117ee885d886cc6a6df9095f80b49","observation_id":"daf5c038-6a87-4bd2-ad6e-2659742359a8","resolution":{"observed_at":"2026-05-20T07:13:06.646603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.05261/citation-record","integrity":"/paper/2410.05261/integrity","json":"/paper/2410.05261/citation-record.json","paper":"/paper/2410.05261"},"outbound":[],"paper":{"arxiv_id":"2410.05261","last_updated":"2024-10-07T17:58:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:58:35Z","title":"TextHawk2: A Large Vision-Language Model Excels in Bilingual OCR and Grounding with 16x Fewer Tokens"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2410.05261."}