{"as_of":"2026-08-14T21:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cbca051800eb5a38f7e4d1ea609e147caebaa0123a2bac7e3c165535c31bdfd5","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:01:13.283168Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:30:37.351291Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T18:56:48.399498Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06066","snapshot_observed_at":"2026-08-14T13:30:37.351291Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T13:22:42.499878Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.351291Z"},"links":{"cited_paper":"/paper/1908.06066","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:e26ee5aa0e259730629ae599858d699a7dfa8989d1a6d523933313e9bc0728db","observation_id":"dfbe82c1-dc26-4f58-bde9-8af72792eba4","resolution":{"observed_at":"2026-08-14T13:30:37.351291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"cited_work":{"arxiv_id":"1908.06066","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.06066","snapshot_observed_at":"2026-08-12T18:56:48.399498Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","venue":"cs.CV","work_id":"19d388fd-864c-49cd-b7e8-b8453a3b4ff0","year":2019},"citing_paper":{"arxiv_id":"2411.11162","last_updated":"2024-11-17T19:45:26Z","snapshot_observed_at":"2026-08-14T04:45:38.459526Z","submitted_at":"2024-11-17T19:45:26Z","title":"RPN 2: On Interdependence Function Learning Towards Unifying and Advancing CNN, RNN, GNN, and Transformer","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:56:47.983074Z"},"links":{"cited_paper":"/paper/1908.06066","citing_paper":"/paper/2411.11162"},"observation_digest":"sha256:c045cd41732580a7594de1cb85a9ea5804bc37c0377b2212ea82c13d3d56d4b1","observation_id":"b95b9913-23a5-4f1d-8966-17d993acb34c","resolution":{"observed_at":"2026-08-12T18:56:48.403207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.06066/citation-record","integrity":"/paper/1908.06066/integrity","json":"/paper/1908.06066/citation-record.json","paper":"/paper/1908.06066"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-14T13:01:13.239231Z","title":"arXiv preprint arXiv:1504.00325","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.239231Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:57ef83b31f00b5a9efccc8da6507b9e6f8a4069c673bde327f1efba6b70660a6","observation_id":"57f21e8d-bbdc-40d9-b965-da369a6c3c88","resolution":{"observed_at":"2026-08-14T13:01:13.239231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11740","last_updated":"2020-07-17T22:19:59Z","snapshot_observed_at":"2026-08-09T19:02:25.484253Z","submitted_at":"2019-09-25T20:02:54Z","title":"UNITER: UNiversal Image-TExt Representation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11740","snapshot_observed_at":"2026-08-14T13:01:13.242260Z","title":"arXiv preprint arXiv:1909.11740","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.242260Z"},"links":{"cited_paper":"/paper/1909.11740","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:4955c10cafd2da52414e8644279f220771e39d3663e3118942bce9873fc97629","observation_id":"629aeb46-409d-49bc-9c0a-18157c1721af","resolution":{"observed_at":"2026-08-14T13:01:13.242260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00964","last_updated":"2019-09-04T08:33:34Z","snapshot_observed_at":"2026-08-14T10:45:40.273965Z","submitted_at":"2019-09-03T06:11:44Z","title":"Unicoder: A Universal Language Encoder by Pre-training with Multiple Cross-lingual Tasks","version":2},"cited_work":{"arxiv_id":"1909.00964","doi":null,"metadata_source":"pith","pith_arxiv_id":"1909.00964","snapshot_observed_at":"2026-08-14T13:01:13.360711Z","title":"Unicoder: A Universal Language Encoder by Pre-training with Multiple Cross-lingual Tasks","venue":"cs.CL","work_id":"b6b92d12-afa4-4f7b-8551-234bb8658212","year":2019},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.254177Z"},"links":{"cited_paper":"/paper/1909.00964","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:9808088806849a03916fd3caf6b7902d92f2d53d8a49a94c387405302bcdd71c","observation_id":"6d571d1d-7950-465c-a25c-7c2f6d927fe2","resolution":{"observed_at":"2026-08-14T13:01:13.365671Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.07291","last_updated":"2019-01-22T13:22:34Z","snapshot_observed_at":"2026-08-14T17:27:41.965844Z","submitted_at":"2019-01-22T13:22:34Z","title":"Cross-lingual Language Model Pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.07291","snapshot_observed_at":"2026-08-14T13:01:13.257054Z","title":"arXiv preprint arXiv:1901.07291","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.257054Z"},"links":{"cited_paper":"/paper/1901.07291","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:5082217a4dc459da170453f3d59796760d105e22f3b9d2702ce2d5a09357f3f2","observation_id":"55160a59-8588-412b-9488-78404417ba9c","resolution":{"observed_at":"2026-08-14T13:01:13.257054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-14T13:01:13.259950Z","title":"arXiv preprint arXiv:1908.03557","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.259950Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:959f17f5407bac40ec4b62cec30191f2ab6a382c3f4e95666c472b2bef6720ae","observation_id":"6c52cbe4-2736-4864-993a-4a72b1742700","resolution":{"observed_at":"2026-08-14T13:01:13.259950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-14T13:01:13.263107Z","title":"arXiv preprint arXiv:1907.11692","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.263107Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:32800d9bd44d163cfe564e3b66c4b9ec657baedbf9f5e8f3a6f31ca95b057921","observation_id":"646cbc41-217c-4cf3-a704-543d6adf4a31","resolution":{"observed_at":"2026-08-14T13:01:13.263107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-14T14:46:41.013114Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T13:01:13.266000Z","title":"arXiv preprint arXiv:1908.02265","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.266000Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:6cab5d32889d7b9975739fa9e6dc472e47b9ca8d69246f3df703b12c36984bea","observation_id":"0ee6b0e0-0cef-45be-b6ad-9436b121f399","resolution":{"observed_at":"2026-08-14T13:01:13.266000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-14T11:34:50.321403Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-14T13:01:13.274718Z","title":"arXiv preprint arXiv:1908.08530","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.274718Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:cb4352928b8e493d8ae7d5cf387ae9b2ef47599d7504be3d0be2cd2e9aee9a08","observation_id":"74967b05-acba-452a-955a-957c1b8c84e2","resolution":{"observed_at":"2026-08-14T13:01:13.274718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01766","last_updated":"2019-09-11T19:52:54Z","snapshot_observed_at":"2026-08-14T16:52:36.554748Z","submitted_at":"2019-04-03T04:40:16Z","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01766","snapshot_observed_at":"2026-08-14T13:01:13.277528Z","title":"arXiv preprint arXiv:1904.01766","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.277528Z"},"links":{"cited_paper":"/paper/1904.01766","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:c9eaac0f9dc6945fab35aa8a511696bf8ef6a64cc42d7583cb459c0b58191de7","observation_id":"e77d5504-8c88-424c-8260-53f0907d3b74","resolution":{"observed_at":"2026-08-14T13:01:13.277528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-14T13:01:13.280406Z","title":"arXiv preprint arXiv:1609.08144","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.280406Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:1dc53a9166f642b975a1099b5526f3f5f4ce781a9dda63ea35dd8d7bf9d98db5","observation_id":"34afb34b-0a1b-4e82-8ee2-daa0cc7cba2d","resolution":{"observed_at":"2026-08-14T13:01:13.280406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-08-14T13:01:13.283168Z","title":"arXiv preprint arXiv:1906.08237","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.283168Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:9a96bed30c2565554206af6c587f87e628f3ce886c2d2a8049003e294daf1192","observation_id":"d5f54d87-ddce-49b9-a752-40a05e710b58","resolution":{"observed_at":"2026-08-14T13:01:13.283168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:01:13.407470Z","title":"In 2009 IEEE conference on computer vision and pattern recognition, 248–255","venue":null,"work_id":"1e5fe650-416c-4a1f-9ee6-afb4a04e830d","year":2009},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.245337Z"},"links":{"citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:3a987925f8117acaa37f87f73763036b3737d98627670c4e694c1b657248df7b","observation_id":"5b5d464f-2550-46e4-95e0-c764e5ecf590","resolution":{"observed_at":"2026-08-14T13:01:13.410714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T04:13:35.056640Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T13:01:13.271786Z","title":"arXiv preprint arXiv:1409.1556","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.271786Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:35f2700fd3bba82a468bdfba9e69023fd3bbdc67085610b8256239b66fba6cf4","observation_id":"dc70a464-2a05-470d-aef4-48481e2d1098","resolution":{"observed_at":"2026-08-14T13:01:13.271786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.05326","last_updated":"2015-08-21T16:17:01Z","snapshot_observed_at":"2026-08-10T11:52:49.214145Z","submitted_at":"2015-08-21T16:17:01Z","title":"A large annotated corpus for learning natural language inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.05326","snapshot_observed_at":"2026-08-14T13:01:13.236228Z","title":"arXiv preprint arXiv:1508.05326","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.236228Z"},"links":{"cited_paper":"/paper/1508.05326","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:3b74786e37fc9f2285d0602e235203fe2b84a50cae48928f7ac55e4977c89120","observation_id":"d270b1b0-f24e-48f2-bff2-0345e1f3ea6b","resolution":{"observed_at":"2026-08-14T13:01:13.236228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-12T23:01:26.406202Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-14T13:01:13.268745Z","title":"arXiv preprint arXiv:1606.05250","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.268745Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:13543b0a13423b9ea7bdf94c4899789479977483c64277224d31ea5cc65cd87e","observation_id":"6a986e2f-d17c-4e60-aede-58f4c888cc73","resolution":{"observed_at":"2026-08-14T13:01:13.268745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05612","last_updated":"2018-07-29T19:11:57Z","snapshot_observed_at":"2026-08-14T20:46:56.185352Z","submitted_at":"2017-07-18T13:51:32Z","title":"VSE++: Improving Visual-Semantic Embeddings with Hard Negatives","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05612","snapshot_observed_at":"2026-08-14T13:01:13.251075Z","title":"arXiv preprint arXiv:1707.05612 2(7):8","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.251075Z"},"links":{"cited_paper":"/paper/1707.05612","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:2ffee7a34d365dfbf1a60f04ee1f947729fe2e0ccb8feeef097ea7ea31e7566a","observation_id":"3d69f56a-31b7-4b92-9e98-ec399527844f","resolution":{"observed_at":"2026-08-14T13:01:13.251075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T13:01:13.248145Z","title":"arXiv preprint arXiv:1810.04805","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.248145Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:c8d7a31c4dea645a541d60553d3b00b7545b4ce8be6986389f071784231f3117","observation_id":"cd129c4a-1d34-4cde-94a7-c8db5588cd4d","resolution":{"observed_at":"2026-08-14T13:01:13.248145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T13:22:42.499878Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05054","snapshot_observed_at":"2026-08-14T13:01:13.232217Z","title":"arXiv preprint arXiv:1908.05054","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.232217Z"},"links":{"cited_paper":"/paper/1908.05054","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:0a11b23afdcb9ea0127ad2f3250ffa604b6787764732bdbabb29db3be455ee6d","observation_id":"58888512-c5e6-46c3-8956-85fd6c948f8a","resolution":{"observed_at":"2026-08-14T13:01:13.232217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T14:56:36.660428Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":16,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 2 inbound Pith citation observations for arXiv:1908.06066."}