{"as_of":"2026-08-09T08:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b3f01d68a61bdd075e9229ffb18ec39036e62a8ac185161e0266e2129525a5f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T23:20:01.008761Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T09:29:06.156996Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":"2112.08614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KAT : A knowledge augmented transformer for vision-and-language","venue":null,"work_id":"a134c9a0-c717-47c4-b4ad-d2634879e129","year":2021},"citing_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-12T04:22:30.008355Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2204.14198"},"observation_digest":"sha256:9fcce03c74c3f208358a817c9728395a30fdb479d6e16ed8cb166a7ba4af31b6","observation_id":"314f70ec-9202-4977-92e7-e119a1d396f1","resolution":{"observed_at":"2026-05-12T04:22:30.515015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":"2112.08614","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"KAT : A knowledge augmented transformer for vision-and-language","venue":null,"work_id":"a134c9a0-c717-47c4-b4ad-d2634879e129","year":2021},"citing_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-16T09:29:05.956863Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2209.06794"},"observation_digest":"sha256:5ca2c3fa0bd60f0538884f4590b10b8d6d52e60b8b191c73114f55b3c12c5abb","observation_id":"e6066f6a-638b-4807-a821-03f2b87b3c70","resolution":{"observed_at":"2026-05-16T09:29:06.160017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-08T23:20:01.008761Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04176","last_updated":"2025-04-21T12:02:08Z","snapshot_observed_at":"2026-08-08T23:12:59.210731Z","submitted_at":"2025-02-06T16:07:24Z","title":"MRAMG-Bench: A Comprehensive Benchmark for Advancing Multimodal Retrieval-Augmented Multimodal Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T23:20:01.008761Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2502.04176"},"observation_digest":"sha256:7a290121fa427d1f276371d683ddda158985f9979f9ddcb199afb150e5238735","observation_id":"f80fd8c1-cbf8-4f06-9b3e-ffd6659b9abf","resolution":{"observed_at":"2026-08-08T23:20:01.008761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-07T05:50:00.032601Z","title":"Kat: A knowledge augmented transformer for vision-and-language","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06962","last_updated":"2025-06-14T00:40:34Z","snapshot_observed_at":"2026-08-08T17:13:59.793181Z","submitted_at":"2025-06-08T01:33:05Z","title":"AR-RAG: Autoregressive Retrieval Augmentation for Image Generation","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:50:00.032601Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2506.06962"},"observation_digest":"sha256:1cc506f88a6aedcfb11d8bb1b8412f1a831ddf14d32b39a509360541487eab62","observation_id":"976b4ea1-7398-408c-a3d0-a5c54e7311f6","resolution":{"observed_at":"2026-08-07T05:50:00.032601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-07T04:40:42.680705Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09953","last_updated":"2025-06-11T17:23:35Z","snapshot_observed_at":"2026-08-07T09:14:08.520195Z","submitted_at":"2025-06-11T17:23:35Z","title":"Outside Knowledge Conversational Video (OKCV) Dataset -- Dialoguing over Videos","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T04:40:42.680705Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2506.09953"},"observation_digest":"sha256:39c944fb2fd58fc12df1cae4e29dce2e96bf0916c8d8d2fb7f7537ce83c9847a","observation_id":"9e38a3e0-8a2c-4e85-833e-23fce8378416","resolution":{"observed_at":"2026-08-07T04:40:42.680705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-06T14:33:32.886456Z","title":"Hauptmann, Yonatan Bisk, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22933","last_updated":"2025-07-24T16:27:38Z","snapshot_observed_at":"2026-08-07T10:18:49.594691Z","submitted_at":"2025-07-24T16:27:38Z","title":"Augmented Vision-Language Models: A Systematic Review","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T14:33:32.886456Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2507.22933"},"observation_digest":"sha256:e60de7f4896b663f7bbc917cc6f0c5c0b38f38e9b7ab261fe69e1d3501af3115","observation_id":"c52725fd-73e1-406e-99ad-cbe082c6f92f","resolution":{"observed_at":"2026-08-06T14:33:32.886456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-03T10:44:08.543771Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.11632","last_updated":"2026-05-27T09:42:06Z","snapshot_observed_at":"2026-08-07T16:45:57.772090Z","submitted_at":"2026-01-14T07:16:11Z","title":"KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T10:44:08.543771Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2601.11632"},"observation_digest":"sha256:321df4973591b91d2ac23fe3913ac9f4217f69b6d9f60db499dad6855c90a9d3","observation_id":"daa8d02c-ec27-49cd-b82c-d503d87aedbf","resolution":{"observed_at":"2026-08-03T10:44:08.543771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Hauptmann, Yonatan Bisk, and Jianfeng Gao","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:baac5713b397bc2781e74a538efd93827c39f05d64e3156a149675d9fa1633e0","observation_id":"30f15c67-efb6-4c83-8562-bc0caaa8c014","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.08614","snapshot_observed_at":"2026-08-01T09:59:08.317646Z","title":"2022 , eprint =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20402","last_updated":"2026-07-22T17:38:39Z","snapshot_observed_at":"2026-08-06T00:09:47.516703Z","submitted_at":"2026-07-22T17:38:39Z","title":"SoftReason: A Fully Differentiable Neuro-Soft-Symbolic Deductive Reasoning Architecture over High-Dimensional Perceptual Data","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T09:59:08.317646Z"},"links":{"cited_paper":"/paper/2112.08614","citing_paper":"/paper/2607.20402"},"observation_digest":"sha256:5b7bc3ac57f439a8ce67e11cf9f7156fafa95a06c4b4892a804c523b347f2844","observation_id":"74f849e7-7ed7-4da1-8285-2917f20e487c","resolution":{"observed_at":"2026-08-01T09:59:08.317646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.08614/citation-record","integrity":"/paper/2112.08614/integrity","json":"/paper/2112.08614/citation-record.json","paper":"/paper/2112.08614"},"outbound":[],"paper":{"arxiv_id":"2112.08614","last_updated":"2022-05-05T04:20:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T12:19:22.234875Z","submitted_at":"2021-12-16T04:37:10Z","title":"KAT: A Knowledge Augmented Transformer for Vision-and-Language"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2112.08614."}