{"as_of":"2026-08-18T17:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e16c1a896fb825ca46d3329ea802d8878c084c8e142ec1a6e651dd54233195eb","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:34:38.340134Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.21316/citation-record","integrity":"/paper/2506.21316/integrity","json":"/paper/2506.21316/citation-record.json","paper":"/paper/2506.21316"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.702680Z","title":"Manmatha","venue":null,"work_id":"059cb74f-62c1-4e4e-b017-29951643c481","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.769699Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:f0cbb1965368dd35a79d575e85f0b8e32e72a7b8030d8e477a6c575a026832e4","observation_id":"08222e7e-2dc9-4fb1-a287-4bf071b47021","resolution":{"observed_at":"2026-08-06T22:34:41.825117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.444333Z","title":"Paddleocr, awesome multilingual ocr toolkits based on paddlepaddle","venue":null,"work_id":"9be5d9e5-5bd1-4b57-8706-15eced82b686","year":2020},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.835297Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:a7358c4d0aba703628b1b824aee6a51b9910120e80fb7ef85e77977593990d8d","observation_id":"818156ef-effa-486f-b649-57812d72f569","resolution":{"observed_at":"2026-08-06T22:34:41.576762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.230229Z","title":"Bharatgen unveils patram: India’s pioneer- ing vision-language foundation model for document intelli- gence, 2025","venue":null,"work_id":"552766bf-a9db-4e0b-9a49-1e765819d599","year":2025},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.925134Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:3c461e49c2d6e3a334e627f0348dc2edda89bbee501898c48151ae040a4241a5","observation_id":"734429a8-cdfb-4d64-a25d-c84fc13fdbfa","resolution":{"observed_at":"2026-08-06T22:34:41.327537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:41.076165Z","title":"Molmo and pixmo: Open weights and open data for state- of-the-art vision-language models, 2024","venue":null,"work_id":"2fe74ae3-fb57-43f0-a83c-41328ad76871","year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:36.989772Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:437ac86e69d0bf891387f5c5ce17c7b23b451086c6507c38c08a84d22b35a814","observation_id":"41ddf928-70c8-4b8e-a667-2cb316beb88d","resolution":{"observed_at":"2026-08-06T22:34:41.148905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:34:37.070851Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.070851Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:2b98a014a553ab026590dee1b4460e9287e6b211b4348ba3cfab3580768f0202","observation_id":"b842fa82-5fc4-4a65-8a4d-9ea92d83c69f","resolution":{"observed_at":"2026-08-06T22:34:37.070851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-16T13:21:07.303548Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-06T22:34:37.142434Z","title":"mplug- docowl2: High-resolution compressing for ocr-free multi- page document understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.142434Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:694028061163af4e30a0f80a101b258b85a862bef5f40a457fd09c69c016c2e4","observation_id":"d5c9bf1e-a4e8-4fb4-b9f3-a137212ed0c2","resolution":{"observed_at":"2026-08-06T22:34:37.142434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.865222Z","title":"Layoutlmv3: Pre-training for document ai with uni- fied text and image masking","venue":null,"work_id":"327083d7-0823-4b2c-8992-91c13e527b31","year":2022},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.230465Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:86e2c49edccf55eee9b9a752c4acb5ea9a616a8c231af8c2ad5603b7b78e1f58","observation_id":"f9551178-2d6b-4390-8a77-4060d5b445cb","resolution":{"observed_at":"2026-08-06T22:34:40.974738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.620654Z","title":null,"venue":null,"work_id":"fff00023-f65a-47ce-a7ff-5bc91bccd996","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.298695Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:0cc281076d764b8271aee4934042337c0b4d962b429a4e544d80e612f906fede","observation_id":"ff6eef45-1be0-4eb1-a914-190b55fc339d","resolution":{"observed_at":"2026-08-06T22:34:40.730665Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:37.388852Z","title":"Towards visual text grounding of multimodal large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.388852Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:44935d3764edaa6ac74ce9c7122da6d419713ea5fce25b0576441cc85b2c5518","observation_id":"a3633cfb-e759-4e92-b1b0-df3cb5bc3d99","resolution":{"observed_at":"2026-08-06T22:34:37.388852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.449124Z","title":"Layoutllm: Layout instruction tun- ing with large language models for document understanding","venue":null,"work_id":"09d7d74d-bc0e-430b-9d18-d7484107eb6b","year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.470543Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:13981ec96037ba2fd4a72b8c32d3f8367ef7de46a3ae0ae2701455e822e59f21","observation_id":"f288daed-560b-4aaa-8e87-ae9c25f7473c","resolution":{"observed_at":"2026-08-06T22:34:40.548635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.285811Z","title":"Manmatha, and C","venue":null,"work_id":"3b47b948-5b18-4005-afaa-d972159d3d76","year":2021},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.514020Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:c1a7f6d75b1bfbbfb1c5d3ccfe0b7c2943ed05b9fe9b5c2a9ddd63af4cc87560","observation_id":"9d8a63d0-4dfb-4ce0-9cfa-fa3d159a3e8e","resolution":{"observed_at":"2026-08-06T22:34:40.370596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:40.091355Z","title":"doctr: Document text recognition","venue":null,"work_id":"e5eecdfd-54cb-43a1-a4ee-058d02ee5bd9","year":2021},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.572451Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:ad7581faa07a36ad6ab9a280d761135ff0cb270529269e81177651be297edd2b","observation_id":"b8237044-855f-4bfa-9c99-a5fc9f649726","resolution":{"observed_at":"2026-08-06T22:34:40.168201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.909045Z","title":"Nagaraja, Vlad I","venue":null,"work_id":"844a66aa-59e2-4f6d-9abe-76af897dd143","year":2016},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.633362Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:f7090f32f5b9bc99a9caf0d246da0d6776cd77385f6a674aa9b7f3fda27f5adb","observation_id":"bd85ff38-1840-4c48-99a1-e8d27e393c66","resolution":{"observed_at":"2026-08-06T22:34:39.997566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.686700Z","title":"Surya: A lightweight document ocr and analysis toolkit","venue":null,"work_id":"acd87b29-c742-446b-8955-589eadcac1c5","year":2025},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.715820Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:0ad63c5aafa5d9712f1823ae3b3e52d099d9e21040b32d20aaec539eb9620096","observation_id":"7293f1f5-efa8-4bdb-b161-831c66a9849a","resolution":{"observed_at":"2026-08-06T22:34:39.784297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.09550","last_updated":"2021-07-12T09:31:31Z","snapshot_observed_at":"2026-08-16T18:44:36.106490Z","submitted_at":"2021-02-18T18:51:47Z","title":"Going Full-TILT Boogie on Document Understanding with Text-Image-Layout Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.09550","snapshot_observed_at":"2026-08-06T22:34:37.794185Z","title":"Go- ing full-tilt boogie on document understanding with text- image-layout transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.794185Z"},"links":{"cited_paper":"/paper/2102.09550","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:3378a3a8722a8db4ff087d271b5bb28293821e9f76fe3d91b7bd9ae91e1a2563","observation_id":"e3ed71f0-a2e2-4a52-9176-52848ac7601f","resolution":{"observed_at":"2026-08-06T22:34:37.794185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.558892Z","title":"Grounding of textual phrases in images by reconstruction","venue":null,"work_id":"301f1d45-9790-49ef-8d21-3cbb9cdaec82","year":2015},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.831093Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:6432f762482d6e78e0d3f1b9bab9140e9629d5cdd0412780e895ff3483047f8f","observation_id":"03772cf5-7c6c-4ee2-879c-a242821c1315","resolution":{"observed_at":"2026-08-06T22:34:39.637526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.338700Z","title":"Unifying vision, text, and layout for universal document processing","venue":null,"work_id":"8d9e6bc9-9200-4d79-96ff-85a48d26b2e7","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:37.916791Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:8cee0d681302d3549c6aaa02ba5ae3d5dba201c6ac989b82758c9a65469533dd","observation_id":"6297c7f0-0d49-47ab-ad74-2602afa5bd94","resolution":{"observed_at":"2026-08-06T22:34:39.447752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:39.145121Z","title":"Gpt-4 technical report","venue":null,"work_id":"38496032-e309-42f1-b4d8-0e8664ddb747","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.003951Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:c7734b9c98c1e1377fbedbd6df3e692d089180269303a1450d2c6701471d2f20","observation_id":"182a84dd-83fc-4dbc-8716-a71a0b4d09d8","resolution":{"observed_at":"2026-08-06T22:34:39.249161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05935","last_updated":"2023-04-01T10:00:35Z","snapshot_observed_at":"2026-08-16T17:16:27.422566Z","submitted_at":"2022-12-07T10:09:49Z","title":"Hierarchical multimodal transformers for Multi-Page DocVQA","version":2},"cited_work":{"arxiv_id":"2212.05935","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.05935","snapshot_observed_at":"2026-08-06T22:34:38.458141Z","title":"Hierarchical multimodal transformers for Multi-Page DocVQA","venue":"cs.CV","work_id":"a48ec8c4-6c29-4a58-a06d-046f64861621","year":2022},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.065829Z"},"links":{"cited_paper":"/paper/2212.05935","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:0b157aa53bfe52ceb263635b53306a5446bdb122b8d858acfd8743e2707e2e3a","observation_id":"887b9de5-1192-48e0-ac6c-e7577ae81940","resolution":{"observed_at":"2026-08-06T22:34:38.562815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:38.962988Z","title":"Docllm: A layout-aware gener- ative language model for multimodal document understand- ing","venue":null,"work_id":"a7e28d40-d955-4bb0-9be7-0361a298b89e","year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.137910Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:b350e6cce1f87945a0b98756ef49177f35ea215df54837887bbdf600902a7393","observation_id":"53c3c62c-21e8-45b2-908f-e25224daeeaa","resolution":{"observed_at":"2026-08-06T22:34:39.037272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:34:38.810563Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":"b814fc54-923f-4b7f-bd3e-699b9bb73646","year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.184240Z"},"links":{"citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:4c478e97994fe1fbf6c7512b4062199adc76a25c7271c5f674fdf5b389d6d172","observation_id":"69761ad4-aa54-4e5e-a872-fc183c7c1275","resolution":{"observed_at":"2026-08-06T22:34:38.861845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.13194","last_updated":"2023-12-15T08:12:32Z","snapshot_observed_at":"2026-08-17T19:51:00.778320Z","submitted_at":"2023-11-22T06:46:37Z","title":"Towards Improving Document Understanding: An Exploration on Text-Grounding via MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.13194","snapshot_observed_at":"2026-08-06T22:34:38.254340Z","title":"Towards improving document understand- ing: An exploration on text-grounding via mllms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.254340Z"},"links":{"cited_paper":"/paper/2311.13194","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:9dcae0945dd788d993434bc3778369fd45e48775be8b54fdacc533e5e8c1bde4","observation_id":"1703ad8c-9734-4663-ade3-b85c758fef5a","resolution":{"observed_at":"2026-08-06T22:34:38.254340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20206","last_updated":"2026-08-04T09:37:47Z","snapshot_observed_at":"2026-08-18T05:53:14.206249Z","submitted_at":"2024-12-28T16:34:35Z","title":"Toward Visual Grounding: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20206","snapshot_observed_at":"2026-08-06T22:34:38.310883Z","title":"Towards visual grounding: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.310883Z"},"links":{"cited_paper":"/paper/2412.20206","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:958870c8026d0380bd8ed8d98d17def907f1ac432b1b9ae7180f0ffc01b4803d","observation_id":"2e77bf65-a5ce-412f-873c-d7c3da2d502a","resolution":{"observed_at":"2026-08-06T22:34:38.310883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.17125","last_updated":"2025-08-06T10:02:43Z","snapshot_observed_at":"2026-08-16T05:35:53.531757Z","submitted_at":"2024-11-26T05:38:34Z","title":"DOGR: Towards Versatile Visual Document Grounding and Referring","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.17125","snapshot_observed_at":"2026-08-06T22:34:38.340134Z","title":"Doge: Towards versatile visual document grounding and referring","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:34:38.340134Z"},"links":{"cited_paper":"/paper/2411.17125","citing_paper":"/paper/2506.21316"},"observation_digest":"sha256:17ca447548732a7299f69e5a1e5ceccd6c2c96a55194f2465402f2a5499dc018","observation_id":"83781985-7053-40ae-a698-8e9887e53953","resolution":{"observed_at":"2026-08-06T22:34:38.340134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.21316","last_updated":"2025-07-16T01:55:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:40:56.451449Z","submitted_at":"2025-06-26T14:32:23Z","title":"DRISHTIKON: Visual Grounding at Multiple Granularities in Documents"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":1,"verified_fuzzy":15},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2506.21316."}