{"as_of":"2026-08-10T10:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9c7a884b640bc8fb76e42dac6fb64738a6dc04bbe9f6fa6a61974f61f5b6e172","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:59:22.014713Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.22723/citation-record","integrity":"/paper/2607.22723/integrity","json":"/paper/2607.22723/citation-record.json","paper":"/paper/2607.22723"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:17.625317Z","title":"& Xiao, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:17.625317Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:483febddc03b7f648492fea89098335d0cb2e269fe9ee3b6b367c9daf9ce6ff2","observation_id":"f45adc82-7f6c-4ed6-8107-c32e23d58b5b","resolution":{"observed_at":"2026-08-01T11:59:17.625317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:17.675935Z","title":"1016/j.neucom.2015.09.116 (2016)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:17.675935Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:8e88f92234c437837c2b52ba0817dc2578b50f5e67d3044faca0bf24c034c6e2","observation_id":"fa15baec-3604-440d-bfb5-896d47cef110","resolution":{"observed_at":"2026-08-01T11:59:17.675935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s10489-024-05937-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Intell.55, 311, DOI: https://doi.org/10.1007/s10489-024-05937-6 (2025)","venue":"Applied Intelligence","work_id":"307a0426-a55a-4626-8afc-a081c08f9073","year":2025},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:17.747551Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:1c75ac166c319fa87aabd369ba994bf0cd89e84ac39284f54651162f43be5aac","observation_id":"c2f1e716-7552-4d5c-9163-b5ff65b74176","resolution":{"observed_at":"2026-08-01T12:03:38.477275Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.12277","last_updated":"2022-03-23T08:49:29Z","snapshot_observed_at":"2026-08-09T18:00:23.673755Z","submitted_at":"2022-03-23T08:49:29Z","title":"Unified Structure Generation for Universal Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.12277","snapshot_observed_at":"2026-08-01T11:59:17.837923Z","title":"5.Lu, Y .et al.Unified structure generation for universal information extraction.arXiv preprint arXiv:2203.12277(2022)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:17.837923Z"},"links":{"cited_paper":"/paper/2203.12277","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:88df70e48c7ed5af8a7f90d97ff57eceb7a706dd8bc7a29c9cd631e0c29de484","observation_id":"d424ca4c-d719-46a8-9f43-4f8d3af12675","resolution":{"observed_at":"2026-08-01T11:59:17.837923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-41731-3_3","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InInternational Conference on Document Analysis and Recognition, 36–53, DOI: https://doi.org/10.1007/978-3-031-41731-3_3 (2023)","venue":"Lecture notes in computer science","work_id":"3c447260-ecee-4cbd-a2b5-ebe6a64a7290","year":2023},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:17.879594Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:cf196158850c1a1e0798a2fa39f74933d11b06aedb1f384e0d0180034b861bae","observation_id":"49b92728-5006-4879-8d70-b365fdf842f6","resolution":{"observed_at":"2026-08-01T12:03:38.044236Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i4.16378","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InProceedings of the AAAI Conference on Artificial Intelligence, vol","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"0a93ee68-32c3-4c6f-8e11-288b10ca631c","year":2021},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:17.980289Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:553e502878bd57d94e9e385887202acc9d269ed3caff03fe1d7fe460d5a9fbba","observation_id":"1a36ce43-8f5f-4368-a06e-1591774a79dc","resolution":{"observed_at":"2026-08-01T12:03:37.684842Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-20862-1_31","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Luo, X","venue":"Lecture notes in computer science","work_id":"27fe241f-564a-40f3-a7bf-76ed7a161665","year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.028640Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:56052696d5fa31c8e4acb78d8f07f15a431f81e15823e2e2522223712725661d","observation_id":"9c532239-abbb-43b5-a908-96eb7ca96102","resolution":{"observed_at":"2026-08-01T12:03:37.320469Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16809","last_updated":"2023-10-29T10:59:21Z","snapshot_observed_at":"2026-08-07T19:55:58.258313Z","submitted_at":"2023-10-25T17:38:55Z","title":"Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16809","snapshot_observed_at":"2026-08-01T11:59:18.087177Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.087177Z"},"links":{"cited_paper":"/paper/2310.16809","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:495c43f8da26c67beedd99dbe8e067ee5e6cb93f31857d0334b641a957e954be","observation_id":"dc601ed0-71f4-416a-a89a-46f156c7a3b3","resolution":{"observed_at":"2026-08-01T11:59:18.087177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-01T11:59:18.141053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.141053Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:d22b94d952880f80207ad35a8178858a7b780b1e411b89031fab274ce262373a","observation_id":"a7cb975d-64bf-4e65-8960-c53fa956e32c","resolution":{"observed_at":"2026-08-01T11:59:18.141053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:18.265613Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.265613Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:a49aca10d5c1d70e2a004d72b7f640825894ce46bed2999c8c977774a3815390","observation_id":"47063345-1be5-4073-a46e-7ec4443a7c74","resolution":{"observed_at":"2026-08-01T11:59:18.265613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:18.356247Z","title":"& Zhang, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.356247Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:a0ff258aca44a5274a43af360642f276534569278915d7add2c27955c5442da6","observation_id":"ccb896f8-ab00-4f40-b328-d121bdd9ec3c","resolution":{"observed_at":"2026-08-01T11:59:18.356247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.08799","last_updated":"2018-09-24T08:37:02Z","snapshot_observed_at":"2026-07-06T07:03:50.375976Z","submitted_at":"2018-09-24T08:37:02Z","title":"Chargrid: Towards Understanding 2D Documents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.08799","snapshot_observed_at":"2026-08-01T11:59:18.497158Z","title":"In2013 12th International Conference on Document Analysis and Recognition, 101–105, DOI: 10.1109/ICDAR.2013.28 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.497158Z"},"links":{"cited_paper":"/paper/1809.08799","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:fa5c61c47ad1fa08ba233d42232bb817a46d960a102c81939cdc11ce70c974b5","observation_id":"18af6bcc-6a6e-4987-901d-ad8d1fb95038","resolution":{"observed_at":"2026-08-01T11:59:18.497158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.04948","last_updated":"2019-10-14T09:55:39Z","snapshot_observed_at":"2026-08-10T00:35:17.748791Z","submitted_at":"2019-09-11T09:51:02Z","title":"BERTgrid: Contextualized Embedding for 2D Document Representation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.04948","snapshot_observed_at":"2026-08-01T11:59:18.616511Z","title":null,"venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.616511Z"},"links":{"cited_paper":"/paper/1909.04948","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:01a42af1eb4bbf1148205623fbbd31358aa56220c87343ed866d4bfab3d61d25","observation_id":"6968f33b-c631-4d08-929f-7a262d28bbf1","resolution":{"observed_at":"2026-08-01T11:59:18.616511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.13083","last_updated":"2019-04-05T14:46:09Z","snapshot_observed_at":"2026-08-07T20:19:29.920429Z","submitted_at":"2018-10-31T02:52:21Z","title":"GraphIE: A Graph-Based Framework for Information Extraction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.13083","snapshot_observed_at":"2026-08-01T11:59:18.777538Z","title":"InDocument Analysis and Recognition, 548–563 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.777538Z"},"links":{"cited_paper":"/paper/1810.13083","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:04856dcd860dbb46e52c52963424296fcc05b72e82588b1cda9a5905812067e3","observation_id":"e1bde485-56e1-4a56-a246-c74e016c1859","resolution":{"observed_at":"2026-08-01T11:59:18.777538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.12940","last_updated":"2021-06-24T12:06:29Z","snapshot_observed_at":"2026-08-09T23:07:36.833008Z","submitted_at":"2021-06-24T12:06:29Z","title":"MatchVIE: Exploiting Match Relevancy between Entities for Visual Information Extraction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.12940","snapshot_observed_at":"2026-08-01T11:59:18.891263Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:18.891263Z"},"links":{"cited_paper":"/paper/2106.12940","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:b2fe0bb6d61b48d8a9f8ca867413ff1bc14dca2a2e18bf9c67dd497574a3a2a7","observation_id":"d63abcac-5910-4f2f-8199-fdd2771e48f8","resolution":{"observed_at":"2026-08-01T11:59:18.891263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:19.030776Z","title":"& Zhang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.030776Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:84b4ba1ee480b87b4e604e060701ca1e0f5f73cdcb09185eb03ad4833d73769d","observation_id":"71716ef6-6f4a-4954-b647-1ef8b9995e1d","resolution":{"observed_at":"2026-08-01T11:59:19.030776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:19.161415Z","title":"& Wei, F","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.161415Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:ac543df0a48ed4b329a82482b94c9f2f70ced917a99cd16bdbc5840c4d4ad18b","observation_id":"059fbc0d-3b96-4cb0-84dc-287d883a8b01","resolution":{"observed_at":"2026-08-01T11:59:19.161415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:19.277839Z","title":"InProceedings of the 29th ACM International Conference on Multimedia, 1912–1920, DOI: https://doi.org/10.1145/3474085.34753 (2021)","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.277839Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:7e6cb92c4cd4da8e5b1e5563e92d0003e09e305bd26cd530c9a16e242a8b7132","observation_id":"201a0053-00db-4206-b0bb-f82617b0ab4e","resolution":{"observed_at":"2026-08-01T11:59:19.277839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:19.429106Z","title":"Neural Inf","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.429106Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:e4daecbcf55af9773b240d276e2c9c45ebcef1b793d256845c6f01af5e4d1839","observation_id":"d6aa68a6-dd92-44a8-8fa0-0d1ea794d140","resolution":{"observed_at":"2026-08-01T11:59:19.429106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08836","last_updated":"2021-09-09T11:37:48Z","snapshot_observed_at":"2026-08-05T21:16:34.313942Z","submitted_at":"2021-04-18T12:16:00Z","title":"LayoutXLM: Multimodal Pre-training for Multilingual Visually-rich Document Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08836","snapshot_observed_at":"2026-08-01T11:59:19.585721Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.585721Z"},"links":{"cited_paper":"/paper/2104.08836","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:2de6b99c2dce2364a340fe7384c963fe942ed4ed07d9a8d395d14c0c8064cfb1","observation_id":"4e8b07bc-dab5-48a4-a47c-0954e3c08d2e","resolution":{"observed_at":"2026-08-01T11:59:19.585721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.13669","last_updated":"2022-02-28T10:33:01Z","snapshot_observed_at":"2026-08-09T18:35:45.316749Z","submitted_at":"2022-02-28T10:33:01Z","title":"LiLT: A Simple yet Effective Language-Independent Layout Transformer for Structured Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.13669","snapshot_observed_at":"2026-08-01T11:59:19.719598Z","title":"& Ding, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.719598Z"},"links":{"cited_paper":"/paper/2202.13669","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:3e38cbb58a3cbff5cef7d86749df6ecb8b06fb9b9b258df10e4a550af9fd501e","observation_id":"c090e139-ab1d-437c-b44d-c3211b7e939c","resolution":{"observed_at":"2026-08-01T11:59:19.719598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:19.845817Z","title":"In2019 International Conference on Document Analysis and Recognition (ICDAR), 254–259, DOI: 10.1109/ICDAR.2019.00049 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.845817Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:0e697cea254ec5d2e50558c7103efe5290526a515344cd91f4ea76f3f3c43b1b","observation_id":"d394141f-5516-4e0a-83a0-f36563d100d1","resolution":{"observed_at":"2026-08-01T11:59:19.845817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:19.946498Z","title":"InProceedings of the 28th ACM International Conference on Multimedia, 1413–1422, DOI: https://doi.org/10.1145/3394171.341390 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:19.946498Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:081fe34ac92ac27409bf7f574aa1d6fb1529103ea27825d1ec5f62ded84c8390","observation_id":"afba1850-c6fd-4169-9a1e-8fdfa672f1ef","resolution":{"observed_at":"2026-08-01T11:59:19.946498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:20.109094Z","title":"InEuropean Conference on Computer Vision, 498–517, DOI: https://doi.org/10.1007/978-3-031-19815-1_29 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.109094Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:6c26ec2667da63abe5f2ace8bb8f2a92a90b7433fa55410d32cfac98f458ed39","observation_id":"e26908bb-191c-4b79-9739-bbbb38779410","resolution":{"observed_at":"2026-08-01T11:59:20.109094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:20.208664Z","title":"& Lin, W","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.208664Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:7e11b35fc0482853b33a2c223a089d8959152e41659742234aba96be4f81e99a","observation_id":"61a547f8-bfbe-4254-8a56-afe7a5be6858","resolution":{"observed_at":"2026-08-01T11:59:20.208664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05819","last_updated":"2022-03-30T18:30:42Z","snapshot_observed_at":"2026-08-07T14:27:51.373252Z","submitted_at":"2022-03-30T18:30:42Z","title":"Towards Few-shot Entity Recognition in Document Images: A Label-aware Sequence-to-Sequence Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05819","snapshot_observed_at":"2026-08-01T11:59:20.367919Z","title":"& Shang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.367919Z"},"links":{"cited_paper":"/paper/2204.05819","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:fc7e9f0fb0e8ee859187ccaa6ee0aac86bfbdbde00ada3e834d1db6c82e2cb25","observation_id":"d32d5119-d1f9-4450-a6f9-7dca13fb2c4d","resolution":{"observed_at":"2026-08-01T11:59:20.367919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14122","last_updated":"2023-08-23T05:04:58Z","snapshot_observed_at":"2026-08-02T10:54:28.719233Z","submitted_at":"2023-06-25T04:33:56Z","title":"Chain-of-Thought Prompt Distillation for Multimodal Named Entity Recognition and Multimodal Relation Extraction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14122","snapshot_observed_at":"2026-08-01T11:59:20.476653Z","title":"& Feng, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.476653Z"},"links":{"cited_paper":"/paper/2306.14122","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:2d40ab15022030a8d4f0385a6544e425b9155fa0d07b84fcc525c4d9f6957f23","observation_id":"49b5706a-0f62-4c91-9c71-4e30e454915e","resolution":{"observed_at":"2026-08-01T11:59:20.476653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.196","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"InFindings of the Association for Computational Linguistics: EMNLP 2023, 2969–2979, DOI: 10.18653/v1/2023.findings-emnlp.196 (2023)","venue":null,"work_id":"d2d700c6-2cda-4b7f-a8a1-0d5d20d344d8","year":2023},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.479592Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:e2d77ec21a066106aee1e45e2422953a89fb2173e8f21e4bfe0c25a6c83a25e4","observation_id":"18b68db9-e95d-47c9-b397-711319edd654","resolution":{"observed_at":"2026-08-01T12:03:37.039967Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11263-025-02643-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"International Journal of Computer Vision","work_id":"7ae09cea-c278-4fab-bd2a-98c6055d63d9","year":2026},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.482267Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:57c8eb576097f1dc57ac94f1a75b8d0125d6ee7049df1b60b89702933269ee82","observation_id":"f5410b56-3cbd-4bba-adf4-ae2d34b9d1d8","resolution":{"observed_at":"2026-08-01T12:03:36.694195Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:20.505811Z","title":"In Ku, L.-W., Martins, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.505811Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:f0b6a86f480e74d7c36ca37730d59236ebc23371dad0f5a1aa602f7e49a41455","observation_id":"59c2a76b-54d4-4878-b44b-50cd8a0cff9d","resolution":{"observed_at":"2026-08-01T11:59:20.505811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:20.671257Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.671257Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:1f73001bb5082caeca3ec6f969404c3ace5754dacaaedf9e4976c9655af9fc98","observation_id":"1c0a5133-ebcb-45d7-9502-81fd71b57dc8","resolution":{"observed_at":"2026-08-01T11:59:20.671257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:20.828846Z","title":"In2024 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 26753–26763, DOI: 10.1109/CVPR52733.2024.02527 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.828846Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:bd687b8a6bc3b3c00662105b66f79bb811ec08354f98e57fcfff372c4171351d","observation_id":"9064e0cf-1bda-42db-a5ec-0cc99396b5ec","resolution":{"observed_at":"2026-08-01T11:59:20.828846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:20.991352Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:20.991352Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:0baec7e78de1ca0f8145e94b4e4b2159d5a2c218c4c9ed865de9364b8f3e730f","observation_id":"ab9d084d-9c46-4594-837e-e94c8292e958","resolution":{"observed_at":"2026-08-01T11:59:20.991352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11946","last_updated":"2020-09-11T05:08:01Z","snapshot_observed_at":"2026-08-06T22:36:56.473526Z","submitted_at":"2019-05-28T17:05:32Z","title":"EfficientNet: Rethinking Model Scaling for Convolutional Neural Networks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11946","snapshot_observed_at":"2026-08-01T11:59:21.153288Z","title":null,"venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:21.153288Z"},"links":{"cited_paper":"/paper/1905.11946","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:d2aac3424836f2de5bb088364e9fca0af9c5b937d67453f8b5b8a49d7d264ea0","observation_id":"9e5df790-5993-4e22-b407-ec9293e1a09e","resolution":{"observed_at":"2026-08-01T11:59:21.153288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:21.315479Z","title":"In2022 IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 11966–11976, DOI: 10.1109/CVPR52688.2022.01167 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:21.315479Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:30c2caaad736724fe5844566af853dd37ae731c07c38480fb63823a54bab8a2b","observation_id":"f563174e-8301-4165-9ba7-c90c4db1264c","resolution":{"observed_at":"2026-08-01T11:59:21.315479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:21.475760Z","title":"In2019 International Conference on Document Analysis and Recognition (ICDAR), 1516–1520, DOI: 10.1109/ICDAR.2019.00244 (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:21.475760Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:168592c5783a0bd9dae3a32d63ac90d4f50a0e4b50abdbae1256a801e72ed295","observation_id":"b17ab408-0576-442d-90ff-8f64de7ddf55","resolution":{"observed_at":"2026-08-01T11:59:21.475760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.11834/jig.220911","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":null,"venue":"Journal of Image and Graphics","work_id":"4f22fa3b-3e8e-4b2c-8743-b049e3a1d875","year":2023},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:21.580405Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:481730dc4b74d854ec5b394ef54e1138732393fa98950f959c13de2891b640b1","observation_id":"345ed0d4-f050-4c03-8df4-ba451cd25737","resolution":{"observed_at":"2026-08-01T12:03:36.373401Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03001","last_updated":"2022-06-14T12:00:10Z","snapshot_observed_at":"2026-07-06T13:18:06.376608Z","submitted_at":"2022-06-07T04:33:50Z","title":"PP-OCRv3: More Attempts for the Improvement of Ultra Lightweight OCR System","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03001","snapshot_observed_at":"2026-08-01T11:59:21.691605Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:21.691605Z"},"links":{"cited_paper":"/paper/2206.03001","citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:b29bd48650a5c7bb2acd8f9cd28e8b04c67c3e576b83977cfe5260985c66d39c","observation_id":"440b72f5-9b54-4daf-a980-e38f0e32455d","resolution":{"observed_at":"2026-08-01T11:59:21.691605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:21.805133Z","title":"Paddlelabel, an effective and flexible tool for data annotation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:21.805133Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:213d4e58759ed1489ee08d54020235f5f546a871ddbe26397de26e1848128980","observation_id":"c1c3746b-2b87-4e44-b5d2-8048fc7a969b","resolution":{"observed_at":"2026-08-01T11:59:21.805133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:21.894838Z","title":"& Liang, X","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:21.894838Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:c8e2277cf60ddc7bfeaa0178bde19f6dd4cf6f2a1bd3dab9e51cff77b839344e","observation_id":"88ef2078-ffbf-44a6-b93a-e228e0165832","resolution":{"observed_at":"2026-08-01T11:59:21.894838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:59:22.014713Z","title":"InProceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, 16133–16142, DOI: 10.1109/CVPR52729.2023.01548 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T11:59:22.014713Z"},"links":{"citing_paper":"/paper/2607.22723"},"observation_digest":"sha256:f2dd9669c1d4c213c789a0f883431762c851d6c6b557a6402a052e49ded0eb4f","observation_id":"f0d9c65e-093f-439c-bad1-6d34325a1476","resolution":{"observed_at":"2026-08-01T11:59:22.014713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.22723","last_updated":"2026-07-22T03:27:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T18:00:35.495359Z","submitted_at":"2026-07-22T03:27:50Z","title":"Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":7,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2607.22723."}