{"as_of":"2026-08-09T19:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f365dd6a0100fd3ce210b5902917b0388f778829349ebb6d53064b02f480f69","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T06:01:13.400059Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T19:15:47.123482Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-05T03:42:54.599829Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-17T05:30:27.667126Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2401.16420"},"observation_digest":"sha256:06c0c5d321861a92fdb9915d41bebb0402ce1d80c7a56cfc37867278886fdb0e","observation_id":"4ef0877b-8a2d-4ce0-bcb8-f8cb00d2e87e","resolution":{"observed_at":"2026-05-17T05:30:27.746237Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2402.03766","last_updated":"2024-02-06T07:16:36Z","snapshot_observed_at":"2026-08-09T19:28:34.281681Z","submitted_at":"2024-02-06T07:16:36Z","title":"MobileVLM V2: Faster and Stronger Baseline for Vision Language Model","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-18T15:27:51.839171Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2402.03766"},"observation_digest":"sha256:edabc84eb6e06e6a4a503e2f4ca409364dd568245afdca117e2d21cf65a0c796","observation_id":"3cb97303-4f3a-4cb8-9c4d-7f55523da5bb","resolution":{"observed_at":"2026-05-18T15:27:52.114785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:7f98de9eace57b9664e4b9f252dadb6cea279aaf0e3af52f3617e8f04af87870","observation_id":"df5d7acb-9b2d-4270-826e-e8951235dad4","resolution":{"observed_at":"2026-05-12T20:58:59.251278Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-04T22:09:42.241578Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:414afe09d9d5de314f686f10414f5cf118d67b0909d4cfda0501cebdd0d13ae3","observation_id":"8cc8cd89-b9b6-4665-bf4b-548ff47a3707","resolution":{"observed_at":"2026-05-17T10:46:28.764945Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-08T22:58:25.892839Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T20:50:57.814634Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2409.01704"},"observation_digest":"sha256:c4e8d181ef4bf2c4b9957a220771869da4bb1c60e584bf90ea1ae056349ab7e4","observation_id":"d04d7704-ece2-451a-9042-66889085de75","resolution":{"observed_at":"2026-05-17T20:50:57.889473Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2409.18839","last_updated":"2024-09-27T15:35:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T15:35:15Z","title":"MinerU: An Open-Source Solution for Precise Document Content Extraction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T04:00:25.624430Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2409.18839"},"observation_digest":"sha256:45bbf20e2254327d67f15986d84214d2a84657afae413b0e116c5760bdcdf989","observation_id":"1df1c459-d0b3-480a-a4b6-574ad46b64a8","resolution":{"observed_at":"2026-05-16T04:00:25.727604Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2410.21169","last_updated":"2026-04-04T17:04:02Z","snapshot_observed_at":"2026-07-06T19:40:52.844113Z","submitted_at":"2024-10-28T16:11:35Z","title":"Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction","version":5},"reference_index":254,"source":"pdf_text","source_observed_at":"2026-05-23T19:15:21.695801Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2410.21169"},"observation_digest":"sha256:c992a3dfcfb32e972b63a0996faf3ed70608e28bd2a917306a0b1827a3ebec06","observation_id":"58b1c4e7-4b60-4776-8ec3-6ad76ebe60e9","resolution":{"observed_at":"2026-05-23T19:15:47.126496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2501.13106","last_updated":"2025-06-03T03:33:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T18:59:46Z","title":"VideoLLaMA 3: Frontier Multimodal Foundation Models for Image and Video Understanding","version":4},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-11T01:19:59.603343Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2501.13106"},"observation_digest":"sha256:854f4593f669b43e71ae99bc82d19de07e596f95ad1d8dff4e9bb06e6d1ac481","observation_id":"1019c037-da64-4eca-8f24-c4e4c910e79c","resolution":{"observed_at":"2026-05-11T01:19:59.938795Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-09T06:01:13.400059Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04371","last_updated":"2025-02-05T11:28:11Z","snapshot_observed_at":"2026-08-09T05:54:22.550320Z","submitted_at":"2025-02-05T11:28:11Z","title":"PerPO: Perceptual Preference Optimization via Discriminative Rewarding","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-09T06:01:13.400059Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2502.04371"},"observation_digest":"sha256:ae1104c9a3ba4eb5b406b1bcddc935674418ab7d7720b6ad4f740c33f1ef2b89","observation_id":"3436fd0d-5181-4763-9b4c-c52b886c7a6f","resolution":{"observed_at":"2026-08-09T06:01:13.400059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-06T18:43:20.589681Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07572","last_updated":"2025-07-10T09:18:06Z","snapshot_observed_at":"2026-08-06T18:35:13.554849Z","submitted_at":"2025-07-10T09:18:06Z","title":"Single-to-mix Modality Alignment with Multimodal Large Language Model for Document Image Machine Translation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T18:43:20.589681Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2507.07572"},"observation_digest":"sha256:e58dced30d9c28c115e27b13e95f7e48e625804ba62fee985b7d9ff8e49089b7","observation_id":"367341b0-89e6-42f2-b246-9aedb38f19ec","resolution":{"observed_at":"2026-08-06T18:43:20.589681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-06T15:57:04.951038Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.14675","last_updated":"2025-07-19T16:03:34Z","snapshot_observed_at":"2026-08-09T00:51:52.133273Z","submitted_at":"2025-07-19T16:03:34Z","title":"Docopilot: Improving Multimodal Models for Document-Level Understanding","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T15:57:04.951038Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2507.14675"},"observation_digest":"sha256:e26d25bd3c1117cd73b2ccae65cdd0b453e2be722d23494979e4e948d3a8d43c","observation_id":"b199610d-4032-4a37-9d45-19e25c4ca3f1","resolution":{"observed_at":"2026-08-06T15:57:04.951038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-08-05T19:39:48.124792Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.12263","last_updated":"2025-08-29T05:28:01Z","snapshot_observed_at":"2026-08-07T22:41:31.395227Z","submitted_at":"2025-08-17T07:18:43Z","title":"Region-Level Context-Aware Multimodal Understanding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:39:48.124792Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2508.12263"},"observation_digest":"sha256:4deab0b17bf9268c4f51c283710b6fb3db53ce8d06a041e962f59d3622be649f","observation_id":"069b9a4b-b512-452b-ab20-7cb3fc479039","resolution":{"observed_at":"2026-08-05T19:39:48.124792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2511.14998","last_updated":"2026-04-07T03:13:19Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-19T00:41:14Z","title":"FinCriticalED: A Visual Benchmark for Financial Fact-Level OCR","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-17T20:19:52.701262Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2511.14998"},"observation_digest":"sha256:cbf380a9747a6cf65ad344351785097d81de396fe4245188923bc2fe11a7330e","observation_id":"ee790206-4216-4ee4-a93c-76a684ebae5d","resolution":{"observed_at":"2026-05-17T20:20:11.552117Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2512.10362","last_updated":"2026-04-27T05:32:18Z","snapshot_observed_at":"2026-07-06T22:38:40.044448Z","submitted_at":"2025-12-11T07:22:54Z","title":"Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T23:47:08.562575Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2512.10362"},"observation_digest":"sha256:08b9af493962422d31712a7a38a4db3dabeb981e16c440d657835b78427a7450","observation_id":"521868e3-1820-4574-98d7-0385c01efb93","resolution":{"observed_at":"2026-05-16T23:48:41.910094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2604.11042","last_updated":"2026-04-13T06:14:20Z","snapshot_observed_at":"2026-07-06T22:59:32.051572Z","submitted_at":"2026-04-13T06:14:20Z","title":"Improving Layout Representation Learning Across Inconsistently Annotated Datasets via Agentic Harmonization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-10T16:28:16.315767Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2604.11042"},"observation_digest":"sha256:2ae32bc537a5b06efbee41b6c14df5f80138b8685771d953e5fd2e923a36e5a7","observation_id":"721e2ad1-8cdd-4d8c-918e-d53071e49527","resolution":{"observed_at":"2026-05-11T08:50:58.336351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2312.06109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vary: Scaling up the vision vocabulary for large vision-language models","venue":null,"work_id":"76fe758e-793c-44d6-b972-5a5680cf3fc3","year":2023},"citing_paper":{"arxiv_id":"2604.23813","last_updated":"2026-04-26T17:26:06Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T17:26:06Z","title":"ShredBench: Evaluating the Semantic Reasoning Capabilities of Multimodal LLMs in Document Reconstruction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-08T06:34:56.032634Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2604.23813"},"observation_digest":"sha256:0e55db6cf66b0971915e4d72b218599c7489380da5c0bbb73c37c238804ca4fc","observation_id":"7744dddc-a0cb-46dc-9637-e394843eb390","resolution":{"observed_at":"2026-05-11T21:11:15.855625Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06109","snapshot_observed_at":"2026-07-14T09:13:07.507164Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10796","last_updated":"2026-07-12T15:09:03Z","snapshot_observed_at":"2026-08-07T10:02:01.144681Z","submitted_at":"2026-07-12T15:09:03Z","title":"Mixture of Cognitive Experts in Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T09:13:07.507164Z"},"links":{"cited_paper":"/paper/2312.06109","citing_paper":"/paper/2607.10796"},"observation_digest":"sha256:4b568c3dde8c82779f145b39098ea519f30fef7149b2d7448cfabc8529abfcca","observation_id":"7223f609-576a-4723-92e8-4aff541737be","resolution":{"observed_at":"2026-07-14T09:13:07.507164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.06109/citation-record","integrity":"/paper/2312.06109/integrity","json":"/paper/2312.06109/citation-record.json","paper":"/paper/2312.06109"},"outbound":[],"paper":{"arxiv_id":"2312.06109","last_updated":"2023-12-11T04:26:17Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T16:59:36.461335Z","submitted_at":"2023-12-11T04:26:17Z","title":"Vary: Scaling up the Vision Vocabulary for Large Vision-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2312.06109."}