{"as_of":"2026-08-10T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cad3397fed6f6538c26041e0b045504afb7f772e9fc08ee9546c292b1f29693","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:25:30.406334Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:48:56.125898Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":"2206.01718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-07-03T20:48:56.125898Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022a","venue":null,"work_id":"9a1c2036-b40c-4789-bbde-66bd3d822dda","year":2022},"citing_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-15T09:15:07.523565Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2412.03555"},"observation_digest":"sha256:a77e6a390f6be70a4fc1044e7ba5e2b80bd0b1dc6947ef6297e9c16bb2c75d4f","observation_id":"16a34589-c3e6-4c0a-8aeb-1f0f3f041b6f","resolution":{"observed_at":"2026-05-15T09:15:07.686800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-07T05:25:30.406334Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07936","last_updated":"2025-06-09T16:55:32Z","snapshot_observed_at":"2026-08-08T00:05:54.804087Z","submitted_at":"2025-06-09T16:55:32Z","title":"Mimicking or Reasoning: Rethinking Multi-Modal In-Context Learning in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:25:30.406334Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2506.07936"},"observation_digest":"sha256:b8130daca9cc10ea21c015b425601d97f7b7db85e49c3cc5ab2a488cdaf49275","observation_id":"cdd8f034-939e-43fc-bb23-0587c90b662e","resolution":{"observed_at":"2026-08-07T05:25:30.406334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-07T04:59:41.169719Z","title":"Sharma, P., Ding, N., Goodman, S., and Soricut, R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09172","last_updated":"2025-06-17T03:30:48Z","snapshot_observed_at":"2026-08-10T04:09:06.138790Z","submitted_at":"2025-06-10T18:38:19Z","title":"An Open-Source Software Toolkit & Benchmark Suite for the Evaluation and Adaptation of Multimodal Action Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:59:41.169719Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2506.09172"},"observation_digest":"sha256:558cfc747d77e737773283a32d81fced7bca3aef60e361470df0f245fe8da22d","observation_id":"c3dd53f6-5450-4264-ba80-d621e0ba4f29","resolution":{"observed_at":"2026-08-07T04:59:41.169719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-06T18:39:29.346954Z","title":"A-okvqa: A benchmark for visual question answering using world knowl- edge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07731","last_updated":"2025-07-10T13:12:08Z","snapshot_observed_at":"2026-08-09T18:58:09.583513Z","submitted_at":"2025-07-10T13:12:08Z","title":"Energy-Guided Decoding for Object Hallucination Mitigation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:39:29.346954Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2507.07731"},"observation_digest":"sha256:76ccc96defd7526e8945fc4e9a0e1ae9713d85aa96a7239a6aef5d2fbc65c66f","observation_id":"07f9fa56-b472-488a-872f-2df762b68909","resolution":{"observed_at":"2026-08-06T18:39:29.346954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-05T15:38:03.112975Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.19724","last_updated":"2025-08-28T12:05:33Z","snapshot_observed_at":"2026-08-09T08:35:03.288703Z","submitted_at":"2025-08-27T09:34:28Z","title":"NLKI: A lightweight Natural Language Knowledge Integration Framework for Improving Small VLMs in Commonsense VQA Tasks","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T15:38:03.112975Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2508.19724"},"observation_digest":"sha256:66a25b177b88b26e52b4c320f0fbfdc2a783703832370f05c3ed154219b21b8d","observation_id":"955cd114-199f-4fdf-8eb6-aa661f482904","resolution":{"observed_at":"2026-08-05T15:38:03.112975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-02T19:41:34.384639Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.01471","last_updated":"2026-06-02T03:52:48Z","snapshot_observed_at":"2026-08-08T12:47:40.189675Z","submitted_at":"2026-03-02T05:34:45Z","title":"Reconstructing Content with Collaborative Attention for Universal Multimodal Representation Learning","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T19:41:34.384639Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2603.01471"},"observation_digest":"sha256:696ff77400d1c6b3e84679cdb7859f7d6804db65b4b878512c8f650220c7d89f","observation_id":"10f43b8f-337d-4867-aa4c-b0f61930d71d","resolution":{"observed_at":"2026-08-02T19:41:34.384639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":"2206.01718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-07-03T20:48:56.125898Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022a","venue":null,"work_id":"9a1c2036-b40c-4789-bbde-66bd3d822dda","year":2022},"citing_paper":{"arxiv_id":"2604.16930","last_updated":"2026-04-18T09:28:23Z","snapshot_observed_at":"2026-08-02T04:52:08.615719Z","submitted_at":"2026-04-18T09:28:23Z","title":"CoGR-MoE: Concept-Guided Expert Routing with Consistent Selection and Flexible Reasoning for Visual Question Answering","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-10T07:09:48.239662Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2604.16930"},"observation_digest":"sha256:9161b77198411438381b6ff4cbbc67b27735de40deaa8458070824da9f06d07b","observation_id":"5a3054a3-c4d5-4a2c-b8be-0ab3d6e5d051","resolution":{"observed_at":"2026-05-10T07:11:53.257275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":"2206.01718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-07-03T20:48:56.125898Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022a","venue":null,"work_id":"9a1c2036-b40c-4789-bbde-66bd3d822dda","year":2022},"citing_paper":{"arxiv_id":"2605.20177","last_updated":"2026-05-19T17:58:40Z","snapshot_observed_at":"2026-08-02T05:10:06.894644Z","submitted_at":"2026-05-19T17:58:40Z","title":"From Seeing to Thinking: Decoupling Perception and Reasoning Improves Post-Training of Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-20T05:13:03.237427Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2605.20177"},"observation_digest":"sha256:51e7e8864af8f12cbc15f859ffc0e1885315a79d8900c1447152ecabce76af67","observation_id":"ae7bedce-d04a-4558-ab12-656c1ddcfc70","resolution":{"observed_at":"2026-05-20T05:13:21.565954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":"2206.01718","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-07-03T20:48:56.125898Z","title":"A-okvqa: A benchmark for visual question answering using world knowledge, 2022a","venue":null,"work_id":"9a1c2036-b40c-4789-bbde-66bd3d822dda","year":2022},"citing_paper":{"arxiv_id":"2606.18216","last_updated":"2026-06-16T17:46:02Z","snapshot_observed_at":"2026-08-09T07:41:33.424534Z","submitted_at":"2026-06-16T17:46:02Z","title":"Zone of Proximal Policy Optimization: Teacher in Prompts, Not Gradients","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-06-27T01:08:52.981296Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2606.18216"},"observation_digest":"sha256:39849e52835f7742874e0a56e45a012e7c36a2d43c8c83edcf32aa51397d6901","observation_id":"acaa0f1b-ce9d-4ccb-94d5-8f4300e3817c","resolution":{"observed_at":"2026-07-03T20:48:56.127307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01718","snapshot_observed_at":"2026-08-01T09:59:07.664355Z","title":"2022 , eprint =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20402","last_updated":"2026-07-22T17:38:39Z","snapshot_observed_at":"2026-08-06T00:09:47.516703Z","submitted_at":"2026-07-22T17:38:39Z","title":"SoftReason: A Fully Differentiable Neuro-Soft-Symbolic Deductive Reasoning Architecture over High-Dimensional Perceptual Data","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T09:59:07.664355Z"},"links":{"cited_paper":"/paper/2206.01718","citing_paper":"/paper/2607.20402"},"observation_digest":"sha256:6205c9b7de7dbabcf0bf6c686c324039b39ff9e6cba4dad0fd30b1a7a292fc09","observation_id":"0ac0000a-1037-43e0-8da1-9b634a951c6f","resolution":{"observed_at":"2026-08-01T09:59:07.664355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2206.01718/citation-record","integrity":"/paper/2206.01718/integrity","json":"/paper/2206.01718/citation-record.json","paper":"/paper/2206.01718"},"outbound":[],"paper":{"arxiv_id":"2206.01718","last_updated":"2022-06-03T17:52:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T06:39:37.280127Z","submitted_at":"2022-06-03T17:52:27Z","title":"A-OKVQA: A Benchmark for Visual Question Answering using World Knowledge"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2206.01718."}