{"as_of":"2026-08-15T21:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:236f5240e1eca9ebf3e169e5cba2c65ad3e91d38c02d386c0ad2356cdafc6188","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:30:37.432399Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:01:13.232217Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T13:03:58.089358Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05054","snapshot_observed_at":"2026-08-14T13:01:13.232217Z","title":"arXiv preprint arXiv:1908.05054","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-15T04:23:49.826285Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T13:01:13.232217Z"},"links":{"cited_paper":"/paper/1908.05054","citing_paper":"/paper/1908.06066"},"observation_digest":"sha256:5761918d2a8a81fe2fc4d06347251a5e5765c0a0ed2b80175aabbbf52521901d","observation_id":"58888512-c5e6-46c3-8956-85fd6c948f8a","resolution":{"observed_at":"2026-08-14T13:01:13.232217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.05054","snapshot_observed_at":"2026-08-14T11:42:18.974728Z","title":"Fusion of detected objects in text for visual question answering","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T11:42:18.974728Z"},"links":{"cited_paper":"/paper/1908.05054","citing_paper":"/paper/1908.08530"},"observation_digest":"sha256:ad2c35ab7ff5faf605dfbd645460e125e2ae0f53edb5d5e0f1dc532a3f192295","observation_id":"3a1a173a-97d1-48b2-ae03-9441c812b080","resolution":{"observed_at":"2026-08-14T11:42:18.974728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"cited_work":{"arxiv_id":"1908.05054","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.05054","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , journal =","venue":null,"work_id":"5e43fe9c-4916-4653-8f8e-63dad61f041d","year":2019},"citing_paper":{"arxiv_id":"2308.08089","last_updated":"2023-08-16T01:43:41Z","snapshot_observed_at":"2026-07-06T16:06:38.424057Z","submitted_at":"2023-08-16T01:43:41Z","title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-20T13:03:57.828598Z"},"links":{"cited_paper":"/paper/1908.05054","citing_paper":"/paper/2308.08089"},"observation_digest":"sha256:cefc080683e3fc6f3ad1426ab04a1dc4fe0b9e5cddbbed854cac2a7f7e4b11de","observation_id":"8850bb14-7819-4336-8af0-ba5204082ab3","resolution":{"observed_at":"2026-05-20T13:03:58.090968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.05054/citation-record","integrity":"/paper/1908.05054/integrity","json":"/paper/1908.05054/citation-record.json","paper":"/paper/1908.05054"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.253125Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.253125Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:ac92f121b87f5638ee0e36d34f70b666d78a611bfa9322e418ad1b8999f29a06","observation_id":"4ccb0bb9-47f5-490b-9b41-9fbfb1942630","resolution":{"observed_at":"2026-08-14T13:30:37.253125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.259261Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.259261Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:16dfedef4abaefb0f252d163a1799d8667e68b6e35b8cd64b95618d195d64b7f","observation_id":"11b9a89c-e133-4739-97ae-342d0802d52e","resolution":{"observed_at":"2026-08-14T13:30:37.259261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.265173Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.265173Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:b8701d857f00d8662ad6c132eb8d532ee3feae409945217921bf3ebfab558300","observation_id":"05c165af-d2d8-4bbb-a38e-bc3847d17c62","resolution":{"observed_at":"2026-08-14T13:30:37.265173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.271022Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.271022Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:1882f119d2f4f263d5e95e3e7129bf3d489ad22f15beb4cb57c1ffe89c422575","observation_id":"31dbb148-0144-4f56-9129-5dd0b8b7adb3","resolution":{"observed_at":"2026-08-14T13:30:37.271022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:38.010327Z","title":null,"venue":null,"work_id":"5fa3d735-a26c-4f32-8c9a-ad77741b2839","year":2014},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.276113Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:2d248eaced6274efd3460ac3bf2b8dadf17b0699da50631926b73d0bb59091b5","observation_id":"5aa9e006-f9b5-49c0-ba15-64c01e057948","resolution":{"observed_at":"2026-08-14T13:30:38.016914Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.281716Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.281716Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:153943d08f92d22c07b478fcdb0b0b6cab3acccb65035358c6c6a7d9bc5a13db","observation_id":"e618b184-9f10-4eaa-9d1a-a23dc8445165","resolution":{"observed_at":"2026-08-14T13:30:37.281716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T13:30:37.288311Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.288311Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:07a8763ef8ec8e3de3d6dd188aacc9c2e46a2cd92c22de6d0da6e10ceebda721","observation_id":"043e9063-fc3c-418c-9d8f-f8dad886f8a4","resolution":{"observed_at":"2026-08-14T13:30:37.288311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.294146Z","title":null,"venue":null,"work_id":null,"year":1957},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.294146Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:88eb5d3eb5dc06caa149c2287a5ad8bb66f2f9188e52c8d6a2fa51434d65fe35","observation_id":"1ef2e083-dea4-4620-9190-7f0ae24888b4","resolution":{"observed_at":"2026-08-14T13:30:37.294146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.08008","last_updated":"2018-11-19T22:23:59Z","snapshot_observed_at":"2026-08-14T17:56:30.174932Z","submitted_at":"2018-11-19T22:23:59Z","title":"End-to-End Retrieval in Continuous Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.08008","snapshot_observed_at":"2026-08-14T13:30:37.299870Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.299870Z"},"links":{"cited_paper":"/paper/1811.08008","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:a89f8f432229f5685954aaa12fe925bdd285b7398aeb5dfa77d811b1a3f0c945","observation_id":"4b65b0a6-6ca3-4e30-bde0-c601f86c88cf","resolution":{"observed_at":"2026-08-14T13:30:37.299870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.958739Z","title":null,"venue":null,"work_id":"f9874700-f0ac-4957-a15f-073bb0e6f9ca","year":2017},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.305737Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:da754a0c3430e4604a7a9223bd0a17bd885de12d980bc7cc48d2c35b973ae2ab","observation_id":"0c2b84ef-4568-424e-a289-8bda653cb6c9","resolution":{"observed_at":"2026-08-14T13:30:37.964558Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.313896Z","title":null,"venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.313896Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:f26fcd41a897a4ec80276741d9d7946f37d0a51ce27b6a302dc2ba2f02abf7e5","observation_id":"8aaf8743-8927-4a47-8efa-6f36688b73b1","resolution":{"observed_at":"2026-08-14T13:30:37.313896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.921305Z","title":null,"venue":null,"work_id":"075b76f3-4834-4d07-8c96-a208e72e37f1","year":2016},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.319838Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:78b568854d9cf17a5e1b71e58989b5dfa7cda77dc43758dda9f747d02bdf667b","observation_id":"8e3d74d8-e3a9-432c-a3e2-12040b1d9070","resolution":{"observed_at":"2026-08-14T13:30:37.928650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.899416Z","title":null,"venue":null,"work_id":"41865e48-ef2c-49ae-ab32-3a79bc429254","year":2018},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.325216Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:3633526090746bfe66e6978a017847b724a17a0c973ac6962179d219e2c37e96","observation_id":"78e29a82-1070-4b8c-909b-2fb66d1a7dfd","resolution":{"observed_at":"2026-08-14T13:30:37.906943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-14T17:11:31.853801Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-14T13:30:37.330350Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.330350Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:d7865a69f52f0e8c8aca139cb38829fe8e380621bf90745a09cc15dc20a792bd","observation_id":"6cf61d05-c208-4829-a937-bb205bd025c2","resolution":{"observed_at":"2026-08-14T13:30:37.330350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.335390Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.335390Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:9fd3047ef1635b554a8f565f1c6bfbaecb067f74c61011da33ff90574b1d2334","observation_id":"3008f3d6-c80d-4622-8b5f-0053c7caa06f","resolution":{"observed_at":"2026-08-14T13:30:37.335390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06320","last_updated":"2018-06-04T20:19:28Z","snapshot_observed_at":"2026-08-14T20:46:30.393421Z","submitted_at":"2017-07-19T23:12:57Z","title":"Learning Visually Grounded Sentence Representations","version":2},"cited_work":{"arxiv_id":"1707.06320","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.06320","snapshot_observed_at":"2026-08-14T13:30:37.622718Z","title":"Learning Visually Grounded Sentence Representations","venue":"cs.CL","work_id":"f636ea6f-f7f0-4962-89d9-1d062236dfbb","year":2017},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.340406Z"},"links":{"cited_paper":"/paper/1707.06320","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:649c99944b7a7b050dadaf928d0acc21ea11d86d26031eb1004b9f12e65ae183","observation_id":"d4fe3b53-98ea-49c4-a1ae-10ebab73d83e","resolution":{"observed_at":"2026-08-14T13:30:37.634650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T13:30:37.345838Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.345838Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:62958dbc060a54ff0cb2848e9cbeb092ae768ecfcc40e6fc1dfd50abb1847c0f","observation_id":"1e8560b2-c313-49af-a7f9-6dd45ffdd36a","resolution":{"observed_at":"2026-08-14T13:30:37.345838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.06066","last_updated":"2019-12-02T10:15:38Z","snapshot_observed_at":"2026-08-15T04:23:49.826285Z","submitted_at":"2019-08-16T17:26:56Z","title":"Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.06066","snapshot_observed_at":"2026-08-14T13:30:37.351291Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.351291Z"},"links":{"cited_paper":"/paper/1908.06066","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:589ebc5a41c23d6ebbecc44f8cc50fd65a624e3d18f68ce21b20bb0fc043ed7f","observation_id":"dfbe82c1-dc26-4f58-bde9-8af72792eba4","resolution":{"observed_at":"2026-08-14T13:30:37.351291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.03557","last_updated":"2019-08-09T17:57:13Z","snapshot_observed_at":"2026-08-07T01:39:40.489262Z","submitted_at":"2019-08-09T17:57:13Z","title":"VisualBERT: A Simple and Performant Baseline for Vision and Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.03557","snapshot_observed_at":"2026-08-14T13:30:37.356713Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.356713Z"},"links":{"cited_paper":"/paper/1908.03557","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:aa5a22b2acecddd590344cea5044e784be8c757316ac0c76eb726730aeecea7c","observation_id":"cf8c80d7-1864-4e9b-9e44-140ceefe7e79","resolution":{"observed_at":"2026-08-14T13:30:37.356713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.362170Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.362170Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:4591f975fe488c906acbb8041e76cc5bfd47ec753133f87e456dccf112c8e6b6","observation_id":"27d52ebb-3d83-4a4e-939d-52d7f94dda0c","resolution":{"observed_at":"2026-08-14T13:30:37.362170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-14T14:46:41.013114Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T13:30:37.367264Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.367264Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:44a1b4cef44667fdd7d78530d55b28fa4683c0c3f5a2f095da83e347c2a82736","observation_id":"22ca41b3-de21-4c32-925f-6933a0f7f51a","resolution":{"observed_at":"2026-08-14T13:30:37.367264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.848259Z","title":null,"venue":null,"work_id":"db802ebe-1a14-4aeb-a039-2abff1b6eeb5","year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.372574Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:62e1185695ec87e41111342330ed4e73366f5cba7c2cd28c0c8206bc1a9e4140","observation_id":"78bfafc2-37a7-4236-aa37-cc6cf814bc3d","resolution":{"observed_at":"2026-08-14T13:30:37.854627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.377545Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.377545Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:4e50e9949d9e1bb1eeb5ee8fe050f1c1e03a1b671e9e183f7450ab5916236d67","observation_id":"b11a1e46-7299-46e7-ba4e-90c9131974ea","resolution":{"observed_at":"2026-08-14T13:30:37.377545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.808917Z","title":"Ororbia, Ankur Mali, Matthew A","venue":null,"work_id":"98df3a6c-7a63-4ff1-a68f-5a1def241970","year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.383263Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:187a0cdc67d009acc45c629b9cc427e6282de770545183b01ba244620536cf3d","observation_id":"7e46b79f-1ebe-456e-9617-bf69d3b901ec","resolution":{"observed_at":"2026-08-14T13:30:37.814975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.786148Z","title":null,"venue":null,"work_id":"5b223483-60ce-4d8f-8b09-658281b143fc","year":2018},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.388635Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:2fc503daaace56c2fd62440445a7e766c5af0e552babde44467bd437a62ad30d","observation_id":"15b902d3-d93d-40a1-a3a5-7cdfa23b106c","resolution":{"observed_at":"2026-08-14T13:30:37.792555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.08530","last_updated":"2020-02-18T02:59:17Z","snapshot_observed_at":"2026-08-15T04:23:02.210168Z","submitted_at":"2019-08-22T17:59:30Z","title":"VL-BERT: Pre-training of Generic Visual-Linguistic Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.08530","snapshot_observed_at":"2026-08-14T13:30:37.394653Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.394653Z"},"links":{"cited_paper":"/paper/1908.08530","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:75d4a9e8dc3a0f21a6695f30c52f99d4bf4eb7abb591d2e0a4f6640904d3d11d","observation_id":"7ea1d988-d974-4305-81b9-403be01ce3ef","resolution":{"observed_at":"2026-08-14T13:30:37.394653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01766","last_updated":"2019-09-11T19:52:54Z","snapshot_observed_at":"2026-08-14T16:52:36.554748Z","submitted_at":"2019-04-03T04:40:16Z","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01766","snapshot_observed_at":"2026-08-14T13:30:37.401404Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.401404Z"},"links":{"cited_paper":"/paper/1904.01766","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:b8d89387b2c2d5560db4a66d11208cb1baf26d420e1aaa816b65eeed94b56574","observation_id":"ec81e925-860a-474d-a44e-a849cdd4ca24","resolution":{"observed_at":"2026-08-14T13:30:37.401404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.407783Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.407783Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:a796c42b234975ba092051a0f2df5ed34508ed60f52704ab50d4d2dfc56a59ca","observation_id":"3496b57e-4417-4ee7-8e07-f373f648c696","resolution":{"observed_at":"2026-08-14T13:30:37.407783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.413255Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.413255Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:1ef8f76cd905461bf563ff4d76bc56715d65a298fafa3f34f8017f19fb51dbe9","observation_id":"43783d88-15ab-4c61-9ddd-cff605fb5eec","resolution":{"observed_at":"2026-08-14T13:30:37.413255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.738110Z","title":null,"venue":null,"work_id":"365d3ec2-2878-4c47-9f84-e57298a86edb","year":2018},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.418907Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:46450b50519e0b6267487c41a904d7ed1689956ce9715476908094b90e3e91d2","observation_id":"7d6d95d9-8619-465f-ba8e-a47dab8f830c","resolution":{"observed_at":"2026-08-14T13:30:37.743792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.10830","last_updated":"2019-03-26T17:50:34Z","snapshot_observed_at":"2026-08-14T17:52:51.584611Z","submitted_at":"2018-11-27T06:22:26Z","title":"From Recognition to Cognition: Visual Commonsense Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.10830","snapshot_observed_at":"2026-08-14T13:30:37.425624Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.425624Z"},"links":{"cited_paper":"/paper/1811.10830","citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:d7c2a5830ec80f23d47a3dd67eea76dd7bc06062aeb42dc7e67a4dcde4b512fb","observation_id":"50db3b6f-5790-4d7b-a58b-09da03951377","resolution":{"observed_at":"2026-08-14T13:30:37.425624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:30:37.718690Z","title":null,"venue":null,"work_id":"83ff52e5-7976-4c8a-a2b1-6851a6a99129","year":2016},"citing_paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T13:30:37.432399Z"},"links":{"citing_paper":"/paper/1908.05054"},"observation_digest":"sha256:9828934e21613d871d443ecf1ca3e8882cb1f3455657582b0e3e49a6cc1ed2f7","observation_id":"eb3b3d02-e598-43e1-8da1-5a426f0765d6","resolution":{"observed_at":"2026-08-14T13:30:37.724844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.05054","last_updated":"2019-11-03T05:04:09Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T22:19:16.516623Z","submitted_at":"2019-08-14T10:03:12Z","title":"Fusion of Detected Objects in Text for Visual Question Answering"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 3 inbound Pith citation observations for arXiv:1908.05054."}