{"as_of":"2026-08-11T21:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cd8ca95e1612805419fa80b630365bb69e1ced82db7710018627349757df37e5","coverage":[{"denominator":98,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":98,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:51:54.013771Z","state":"measured"},{"denominator":99,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":99,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T08:14:20.558527Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T08:23:15.762203Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"cited_work":{"arxiv_id":"2501.07109","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.07109","snapshot_observed_at":"2026-06-29T08:23:15.762203Z","title":"The quest for visual understanding: A journey through the evolution of visual question answering.arXiv preprint arXiv:2501.07109, 2025","venue":null,"work_id":"dbfbc16a-284c-4899-aebc-8252a0b89f72","year":2025},"citing_paper":{"arxiv_id":"2605.29602","last_updated":"2026-05-28T08:40:34Z","snapshot_observed_at":"2026-07-31T08:03:40.151420Z","submitted_at":"2026-05-28T08:40:34Z","title":"CogniVerse: Revolutionizing Multi-Modal Retrieval-Augmented Generation with Cognitive Reflection and Geometric Reasoning","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-06-29T08:14:20.558527Z"},"links":{"cited_paper":"/paper/2501.07109","citing_paper":"/paper/2605.29602"},"observation_digest":"sha256:04718597ba2bdf68ec1ac17d687273815ad8b147dbbbefca5a23b43a1541a4f6","observation_id":"a958bc92-d6d5-40e6-af6d-71921515cd98","resolution":{"observed_at":"2026-06-29T08:23:15.763771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.07109/citation-record","integrity":"/paper/2501.07109/integrity","json":"/paper/2501.07109/citation-record.json","paper":"/paper/2501.07109"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.512492Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.512492Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:ffaa804feb5fe4c95eae3fe31a8e3fb668c259ab015b1dd629ec8db4b7ebb1cb","observation_id":"1661980b-d101-441c-9317-61e96842c2b6","resolution":{"observed_at":"2026-08-10T20:51:53.512492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.518253Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.518253Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:922812d32beff8cca6ed8972f3461fc40b33b8aeda4485d0177152e8e9d6e203","observation_id":"d874d895-26d9-4c74-993d-6564963c938c","resolution":{"observed_at":"2026-08-10T20:51:53.518253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.522946Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.522946Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:7495f509e36935ef4db28997691c199f02d82b7904518d7d410cc08e1c1b75b8","observation_id":"acc7e388-358d-40d6-8bd4-ba30c66fa2a8","resolution":{"observed_at":"2026-08-10T20:51:53.522946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-10T20:51:53.527412Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.527412Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:0c6b7abb0dc6aec531ec6b44e0b438d7de1667d59b091811b75f4bcf28c0d84b","observation_id":"7d57b587-6a4a-43eb-b6c3-75d10307ed32","resolution":{"observed_at":"2026-08-10T20:51:53.527412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.531521Z","title":"Anderson, X","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.531521Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:68b30f19d0eac64cf3fba4fc77318d539f9009d0a186dd3ad9fa90e3829da634","observation_id":"f35e7743-41a9-4f46-b58a-1c16455b3a64","resolution":{"observed_at":"2026-08-10T20:51:53.531521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.535384Z","title":"Andreas, M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.535384Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:471a2f5d76d3cd0368dbde0879853b15f7140efaaff1194785bf23186eebc85f","observation_id":"fd1c25a9-6b5c-42c5-8b59-4699cf5271fa","resolution":{"observed_at":"2026-08-10T20:51:53.535384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.539415Z","title":"Antol, A","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.539415Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:2772a1ee160e09f14c445659147822b55cbdf60c412e03bafc775522187aa237","observation_id":"52199a33-fc72-410e-94d0-f353729b1f79","resolution":{"observed_at":"2026-08-10T20:51:53.539415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1505.00468","last_updated":"2016-10-27T03:50:19Z","snapshot_observed_at":"2026-08-06T13:04:32.551262Z","submitted_at":"2015-05-03T20:07:39Z","title":"VQA: Visual Question Answering","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1505.00468","snapshot_observed_at":"2026-08-10T20:51:53.543663Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.543663Z"},"links":{"cited_paper":"/paper/1505.00468","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:b2c26f618c33c32634b1904bf829e31ed99b116af58d18c594e4c7f57c023916","observation_id":"6708cd42-cbfa-4359-ac3c-1e9f97f02fba","resolution":{"observed_at":"2026-08-10T20:51:53.543663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-07-06T03:53:10.336430Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-10T20:51:53.548575Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.548575Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:a7aebdb0d839db1af0a9a431c44abffe1b4ab2f92432cb0935bd8267ad06c9cc","observation_id":"95f84fb1-9e97-40b6-a850-6476187a5523","resolution":{"observed_at":"2026-08-10T20:51:53.548575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.00650","last_updated":"2022-05-13T14:41:49Z","snapshot_observed_at":"2026-08-08T03:25:09.401749Z","submitted_at":"2021-04-01T17:48:27Z","title":"Frozen in Time: A Joint Video and Image Encoder for End-to-End Retrieval","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.00650","snapshot_observed_at":"2026-08-10T20:51:53.552740Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.552740Z"},"links":{"cited_paper":"/paper/2104.00650","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:75158d29c5674489aeeb8eb03c81972e11cd1ffc4e12413ce04a3fee82d559af","observation_id":"2da1b664-61d3-4d23-a49f-fd2b553d01fa","resolution":{"observed_at":"2026-08-10T20:51:53.552740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.556988Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.556988Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:91f014b226badf4edbb4dc56dc69df2b1e433c221425ded1885b07381bd6f387","observation_id":"e27a6e22-cc25-4857-951a-7edbc6608ddb","resolution":{"observed_at":"2026-08-10T20:51:53.556988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.06676","last_updated":"2017-05-18T16:23:22Z","snapshot_observed_at":"2026-08-11T07:26:11.530028Z","submitted_at":"2017-05-18T16:23:22Z","title":"MUTAN: Multimodal Tucker Fusion for Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1705.06676","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.06676","snapshot_observed_at":"2026-08-10T20:51:54.818400Z","title":"MUTAN: Multimodal Tucker Fusion for Visual Question Answering","venue":"cs.CV","work_id":"a7307f75-7105-47bd-805c-08586d89e1c3","year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.560956Z"},"links":{"cited_paper":"/paper/1705.06676","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:ffb917f726b237daf78e52fe01c109be8f108a17a6516ef669e21e67a3fab6af","observation_id":"d6337484-1fd3-41d1-8863-290f7bdbda7f","resolution":{"observed_at":"2026-08-10T20:51:54.821909Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.07427","last_updated":"2016-05-24T12:48:19Z","snapshot_observed_at":"2026-07-06T04:57:23.396208Z","submitted_at":"2016-05-24T12:48:19Z","title":"Hierarchical Memory Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.07427","snapshot_observed_at":"2026-08-10T20:51:53.565207Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.565207Z"},"links":{"cited_paper":"/paper/1605.07427","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:c2ae7c507ed7d5c9afd89ded93cb540ee6f78a45b5def146b9d9c56000ff3c9d","observation_id":"3bb5cc80-036b-491c-a931-87a4e7292458","resolution":{"observed_at":"2026-08-10T20:51:53.565207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.569392Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.569392Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:37e7002c01ffe82af1c094a29801137807ada6520016503e4570442a6177d42a","observation_id":"552dd82f-0c23-46c7-b1f2-5f63d6010286","resolution":{"observed_at":"2026-08-10T20:51:53.569392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.573945Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.573945Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:6e4cc4439977cf4d54d618707f02a4ccaa24c97b476da95cc7ab6bde53a193ad","observation_id":"eba79db3-8943-44bc-a5f9-a978667269bc","resolution":{"observed_at":"2026-08-10T20:51:53.573945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09277","last_updated":"2022-03-26T16:53:26Z","snapshot_observed_at":"2026-08-09T16:56:43.973662Z","submitted_at":"2022-02-18T15:58:54Z","title":"(2.5+1)D Spatio-Temporal Scene Graphs for Video Question Answering","version":2},"cited_work":{"arxiv_id":"2202.09277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.09277","snapshot_observed_at":"2026-08-10T20:51:54.793822Z","title":"(2.5+1)D Spatio-Temporal Scene Graphs for Video Question Answering","venue":"cs.CV","work_id":"8011d41e-e803-4ae0-81f6-8d66ed66ce14","year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.577656Z"},"links":{"cited_paper":"/paper/2202.09277","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:dc8dabb2ab2ffdab18252ecb61aaa74c5a2f87907ba9ff2e6cdabc0ee27ec8ef","observation_id":"8776198c-d73f-44f0-afa7-8bc42e543a27","resolution":{"observed_at":"2026-08-10T20:51:54.797958Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-07-06T03:45:28.546418Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-10T20:51:53.581283Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.581283Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:be23a368bef48f0076108d822557bbee64057f2c547138e6c7a9a57ea2007c4f","observation_id":"9fed11bd-702f-4b3b-9a27-31bb3ca65a20","resolution":{"observed_at":"2026-08-10T20:51:53.581283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.08669","last_updated":"2017-08-01T22:04:37Z","snapshot_observed_at":"2026-08-02T01:42:46.317909Z","submitted_at":"2016-11-26T06:39:28Z","title":"Visual Dialog","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.08669","snapshot_observed_at":"2026-08-10T20:51:53.585850Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.585850Z"},"links":{"cited_paper":"/paper/1611.08669","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:fe02d46fa7414b20ee344ccdff37db9a584a8ed9903abe545befab9fb6959830","observation_id":"5fe705a4-d221-4ade-bd1b-e93c995f5abc","resolution":{"observed_at":"2026-08-10T20:51:53.585850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.589802Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.589802Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:5e96ce53c8c5d47afab3a3d75d7cab9fd1f507a0114d942867695bda9b0dd29b","observation_id":"845ce702-8f57-4bde-8f07-e85d11687d4b","resolution":{"observed_at":"2026-08-10T20:51:53.589802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.593422Z","title":null,"venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.593422Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:aa34cf88b7c7ad3e6c775b564eae01594b320a127533ef80535b1e8e5da9063a","observation_id":"8346e116-4b78-4c78-a1dc-f2a2557f37d5","resolution":{"observed_at":"2026-08-10T20:51:53.593422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.596864Z","title":"Everingham, L","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.596864Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:4eae7d85ece9b9dfb4c227405977cf9b3ac1372c788a8b9d56af3792c12742bc","observation_id":"d4263eb3-91e7-4bcc-8c9f-15f6000c7927","resolution":{"observed_at":"2026-08-10T20:51:53.596864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.600147Z","title":"Fukui, D","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.600147Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:e70025c6b1b61c003e46f09ccab2a24f1e0a6b9e1952094751ea3403472710b3","observation_id":"f8de9fd6-7455-4273-a4c3-1e66712f4863","resolution":{"observed_at":"2026-08-10T20:51:53.600147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.603392Z","title":null,"venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.603392Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:5ca4ff4c9f75d049f766e9fe7d674f7c5edc5fb77cd15f3ad483cdce3823dab9","observation_id":"69d16bfc-cc2e-4aa4-bc2a-d0ebbda614fb","resolution":{"observed_at":"2026-08-10T20:51:53.603392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.606893Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.606893Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:a84927d542819e446bc7ed912d12d9adc5484210c03e877893918cc2445d5ce4","observation_id":"d57470d0-b132-416f-9095-908467470cbd","resolution":{"observed_at":"2026-08-10T20:51:53.606893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1073/pnas.1422953112","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.098441Z","title":null,"venue":null,"work_id":"d2d376d0-dedd-475b-97dd-fc159e0d5170","year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.610134Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:8706b341672108becb4a13068978e92b211cb859eeb6f79ddb3e62c59bac6c8f","observation_id":"75e23ac0-1883-4b67-979f-8cce8f76320d","resolution":{"observed_at":"2026-08-10T20:51:54.102537Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.614025Z","title":"Girshick, J","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.614025Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:a44aaa84403d4c9dd174db2993e585462fd2c1d70f8c40cfbf1b3b2a2b94f78f","observation_id":"fad5db89-1ac7-499a-a5f4-58cee56afe2b","resolution":{"observed_at":"2026-08-10T20:51:53.614025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1311.2524","last_updated":"2014-10-22T17:23:20Z","snapshot_observed_at":"2026-07-06T03:27:53.279398Z","submitted_at":"2013-11-11T18:43:49Z","title":"Rich feature hierarchies for accurate object detection and semantic segmentation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1311.2524","snapshot_observed_at":"2026-08-10T20:51:53.618661Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.618661Z"},"links":{"cited_paper":"/paper/1311.2524","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:6b1bcce692d6dbc2a15583ae637cf0ac7b0fce1bae9bbd2da1427a425bc095bb","observation_id":"40f662ab-f85b-4a1f-adb7-e047336c2499","resolution":{"observed_at":"2026-08-10T20:51:53.618661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.622576Z","title":"Goyal, T","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.622576Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:8d39f4f6f9c708798f420084cb5659147537a750018767caa8a36eb1e0983d3c","observation_id":"e54df75a-aba3-4b19-82a5-c9ae15c7a952","resolution":{"observed_at":"2026-08-10T20:51:53.622576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.08218","last_updated":"2018-05-09T17:26:40Z","snapshot_observed_at":"2026-08-10T08:46:04.120079Z","submitted_at":"2018-02-22T18:16:53Z","title":"VizWiz Grand Challenge: Answering Visual Questions from Blind People","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.08218","snapshot_observed_at":"2026-08-10T20:51:53.626147Z","title":"Stangl, Anhong Guo, Chi Lin, Kristen Grauman, Jiebo Luo, and Jeffrey P","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.626147Z"},"links":{"cited_paper":"/paper/1802.08218","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:0ca81a259b19e30f4ffbe586fc475f3f71adf5f8865e96efcb4f9f1df73ae2e3","observation_id":"0fc4b13a-5157-4685-bd2d-e6b489a6e9a7","resolution":{"observed_at":"2026-08-10T20:51:53.626147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.630060Z","title":"Hasan, Yuan Ling, Oladimeji Farri, Joey Liu, Matthew Lungren, and Henning M\\\"uller","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.630060Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:2181a87d359fcd80ec729eacd37ad4df5825037aba3ea1132e3018f8b08e6721","observation_id":"c7fce29b-70c9-4652-a6fe-1485a817ac36","resolution":{"observed_at":"2026-08-10T20:51:53.630060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.03385","last_updated":"2015-12-10T19:51:55Z","snapshot_observed_at":"2026-07-06T04:39:28.429064Z","submitted_at":"2015-12-10T19:51:55Z","title":"Deep Residual Learning for Image Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.03385","snapshot_observed_at":"2026-08-10T20:51:53.633462Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.633462Z"},"links":{"cited_paper":"/paper/1512.03385","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:21e3fe5709f3e548792a6da4f722db0114f51dc728fa0a068261b1c227e55fa9","observation_id":"7c6fd8a7-a71a-44f3-8d27-5b935061848c","resolution":{"observed_at":"2026-08-10T20:51:53.633462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.642669Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.642669Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:19f73521aae2a0468a90ace68be1cb6e9eafd21b254ac612737abba5de83d162","observation_id":"c59df8c1-e445-424c-a5d2-b79e941f42b9","resolution":{"observed_at":"2026-08-10T20:51:53.642669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.646588Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.646588Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:b1a2ec07ee8968b9f12fe2a257b3a1c3b8b7676502717abb53e031574ee54cca","observation_id":"9a4ae3b4-0c76-4153-a1f7-3b085e63be83","resolution":{"observed_at":"2026-08-10T20:51:53.646588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-04T09:51:28.249111Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-10T20:51:53.650769Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.650769Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:e9f928380d1ea5c9d9770b557fb72e8dfff3fc4ea0e2e071d56cd2f6ffb1ee89","observation_id":"8696c7cf-e3b0-4888-81a2-0ff45cfa67ce","resolution":{"observed_at":"2026-08-10T20:51:53.650769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.654856Z","title":"Johnson, B","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.654856Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:68b81bacac2da097acaadfcd8ecc2a147febb0e6b9c703e19faaa855fb7ba492","observation_id":"48f102c3-fa47-4a74-8380-b0495d88e5a3","resolution":{"observed_at":"2026-08-10T20:51:53.654856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.159466Z","title":"Johnson, B","venue":null,"work_id":"6574cc99-9ab8-408c-ad8b-8f5db6dbffb3","year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.658258Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:b5e0bb07358679cc01d5470b9f808e82e7c49b0d59ffafb8a95bd93fccbaa4f5","observation_id":"063cae58-4fed-43d9-8b0d-05344dd6e948","resolution":{"observed_at":"2026-08-10T20:51:55.162535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1703.09684","last_updated":"2017-09-13T18:56:45Z","snapshot_observed_at":"2026-07-06T05:35:33.417225Z","submitted_at":"2017-03-28T17:48:07Z","title":"An Analysis of Visual Question Answering Algorithms","version":2},"cited_work":{"arxiv_id":"1703.09684","doi":null,"metadata_source":"pith","pith_arxiv_id":"1703.09684","snapshot_observed_at":"2026-08-10T20:51:54.718719Z","title":"An Analysis of Visual Question Answering Algorithms","venue":"cs.CV","work_id":"8a2410e3-41f1-4327-bb66-ef8df3f73752","year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.661985Z"},"links":{"cited_paper":"/paper/1703.09684","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:1ffd41e8509f87c1e207a76cb519ac9bad5b285f2c086cbf19f38e620e38327f","observation_id":"b66afe3c-e8e3-456a-83f4-ac5af537e3e1","resolution":{"observed_at":"2026-08-10T20:51:54.723031Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.07300","last_updated":"2018-02-22T22:50:42Z","snapshot_observed_at":"2026-08-04T06:17:25.388464Z","submitted_at":"2017-10-19T18:01:38Z","title":"FigureQA: An Annotated Figure Dataset for Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.07300","snapshot_observed_at":"2026-08-10T20:51:53.665246Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.665246Z"},"links":{"cited_paper":"/paper/1710.07300","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:e49ce624267cf47a0d225b064f9c92311700b93875765b9e7c696301f9c406e1","observation_id":"b8dfbd71-6ec9-4e65-b082-6fa0d2acb3fe","resolution":{"observed_at":"2026-08-10T20:51:53.665246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.149697Z","title":null,"venue":null,"work_id":"58666ca1-2c00-4ac3-98bd-fe1687946521","year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.668714Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:d1a6e5d6be8dcfb416833abfc1a88be981ff39c09faad146add7cc51ea7b0767","observation_id":"f810e9ce-2b3c-4ada-873f-7f5c553dee1e","resolution":{"observed_at":"2026-08-10T20:51:55.152807Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14095","last_updated":"2020-10-27T06:34:14Z","snapshot_observed_at":"2026-08-06T09:04:13.865739Z","submitted_at":"2020-10-27T06:34:14Z","title":"MMFT-BERT: Multimodal Fusion Transformer with BERT Encodings for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14095","snapshot_observed_at":"2026-08-10T20:51:53.671744Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.671744Z"},"links":{"cited_paper":"/paper/2010.14095","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:8283ab9c6696ae7c19afa3416ece2aabaf457c7878837289f02962e8fedbe2ce","observation_id":"543f2115-b2f4-49f9-a956-fef4fbe21af0","resolution":{"observed_at":"2026-08-10T20:51:53.671744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04653","last_updated":"2021-09-10T03:47:29Z","snapshot_observed_at":"2026-07-06T11:46:13.308578Z","submitted_at":"2021-09-10T03:47:29Z","title":"Towards Developing a Multilingual and Code-Mixed Visual Question Answering System by Knowledge Distillation","version":1},"cited_work":{"arxiv_id":"2109.04653","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.04653","snapshot_observed_at":"2026-08-10T20:51:54.682114Z","title":"Towards Developing a Multilingual and Code-Mixed Visual Question Answering System by Knowledge Distillation","venue":"cs.CL","work_id":"4a077726-3762-4b1d-b893-fd4f7f28b264","year":2021},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.675339Z"},"links":{"cited_paper":"/paper/2109.04653","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:940e8e007447635bec6155f4d1f2f0e05522bd0bd75d10bfe004bbf4b2df03c5","observation_id":"a8b50f5f-9128-41a5-be03-56196b479db8","resolution":{"observed_at":"2026-08-10T20:51:54.686660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01394","last_updated":"2021-04-03T13:01:19Z","snapshot_observed_at":"2026-08-08T15:51:22.683833Z","submitted_at":"2021-04-03T13:01:19Z","title":"MMBERT: Multimodal BERT Pretraining for Improved Medical VQA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01394","snapshot_observed_at":"2026-08-10T20:51:53.678965Z","title":"Deva Priyakumar, and C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.678965Z"},"links":{"cited_paper":"/paper/2104.01394","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:7d92b94e5cb25b5e373a8807c71f946cb902928b14eee78bf42b6ed5d0b7f62b","observation_id":"056b46d7-12b1-4dad-90bb-a88d67243925","resolution":{"observed_at":"2026-08-10T20:51:53.678965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.139451Z","title":null,"venue":null,"work_id":"5c3f098c-fdc2-4d1d-b17e-e16147d121c0","year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.682312Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:a309e7f32f266fb3f8f89bc7360de37a32ceb3f4867de2ce9ef91299de1d9427","observation_id":"9836f9b8-054a-49a1-9bbc-232366d48c75","resolution":{"observed_at":"2026-08-10T20:51:55.143122Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.129386Z","title":null,"venue":null,"work_id":"3e1cca25-3a9a-42c9-929b-41c9d51e13fa","year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.685566Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:96c10ea9b0c2c3b6932c64b0af9df331bd9c91a1c320f4d26ad704939546069b","observation_id":"7491ea61-699f-4ff6-b9d2-9a984d87f813","resolution":{"observed_at":"2026-08-10T20:51:55.132847Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.119106Z","title":"Krishna, Y","venue":null,"work_id":"5997a070-c667-40ac-a3ba-95a0c1685709","year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.688758Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:a4aba4fe6f793fe7425e65abcafd086a7419c26cdc15d22d22e82786b1333a49","observation_id":"87d13233-4745-4574-af4c-9d45c63f1381","resolution":{"observed_at":"2026-08-10T20:51:55.122724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-07-06T04:47:08.658688Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-10T20:51:53.692212Z","title":"Shamma, Michael S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.692212Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:6fd7dd7fc5ef2d43c1b2509cb110e8ce1a9a28648b6a724d7b5132f0d29f57e2","observation_id":"62ba26a3-0e5d-43a5-8a3f-153d4923bbb5","resolution":{"observed_at":"2026-08-10T20:51:53.692212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.108625Z","title":"Krizhevsky, I","venue":null,"work_id":"6dd7f098-e126-4c52-8a9e-07aec43d00b7","year":2012},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.696231Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:157031a27942cfccf83b16c44f00984a1c6c5ea3b3f25fda69014161fb24ec2c","observation_id":"9156d930-80bf-4619-8d25-54f10d0cf800","resolution":{"observed_at":"2026-08-10T20:51:55.112145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.097638Z","title":null,"venue":null,"work_id":"23f4ce52-7a09-42e6-911e-3da6ce782cde","year":2012},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.699898Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:cbafa753f3fcfa0d8af5203424b7e7cae1749c0b793fdc246022ef9e224108d0","observation_id":"c1890111-e123-45ef-958d-e0af600582d6","resolution":{"observed_at":"2026-08-10T20:51:55.101590Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.17605/osf.io/89kps","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.067281Z","title":null,"venue":null,"work_id":"486bead6-208a-4d86-a968-a92e9a740a7d","year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.703457Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:c99b3c7a67953ea03a2f748248ea4463d829c3d513e11476ef0ccae8430a0919","observation_id":"025cbe48-35e4-4df7-a858-5a018f122cfa","resolution":{"observed_at":"2026-08-10T20:51:54.071221Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.707447Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.707447Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:9bafe102802874b352274f1e5e4be98cf0347741465198a0b08fae13bdfeca84","observation_id":"d9329a7c-261d-4e77-a6ba-f374535734bf","resolution":{"observed_at":"2026-08-10T20:51:53.707447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.087232Z","title":null,"venue":null,"work_id":"79b95470-a52e-482c-8cd2-abbd5dbf434a","year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.711066Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:1b5af7604cd1c08e3f8e183c812368be4fa8665fd4c38464e3fe9ce9195affaf","observation_id":"e34e6741-1d78-4d48-9606-a0ba11960a90","resolution":{"observed_at":"2026-08-10T20:51:55.090763Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-10T20:51:53.714591Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.714591Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:7ce16fb84ba9d03b15cba3084ddf931e89d381226c18ef0aea2c832249e27fa3","observation_id":"1eec27e0-e797-4f69-a2c7-c88dc0e33c64","resolution":{"observed_at":"2026-08-10T20:51:53.714591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-10T20:51:53.718308Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.718308Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:b50130f29a6f3e751d3ff3855e467993e9935a6e76f59213a79a4eddf77d318e","observation_id":"78a8eb36-dfd1-4eb8-92a1-cf23ea5d06e3","resolution":{"observed_at":"2026-08-10T20:51:53.718308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.076584Z","title":null,"venue":null,"work_id":"c3084140-6278-4504-a16b-0acffb067537","year":2020},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.722214Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:92809989023135db0b6aa099feab1819f852dea677ba3aca746cb706bc5959c6","observation_id":"996b1c79-41b2-4414-8ee1-afa785fdf02e","resolution":{"observed_at":"2026-08-10T20:51:55.080160Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20381","last_updated":"2024-01-30T19:32:19Z","snapshot_observed_at":"2026-08-01T21:04:54.796195Z","submitted_at":"2023-10-31T11:39:09Z","title":"A Systematic Evaluation of GPT-4V's Multimodal Capability for Medical Image Analysis","version":5},"cited_work":{"arxiv_id":"2310.20381","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.20381","snapshot_observed_at":"2026-08-10T20:51:54.568234Z","title":"A Systematic Evaluation of GPT-4V's Multimodal Capability for Medical Image Analysis","venue":"cs.CV","work_id":"06705c55-4bcd-48c5-9106-7d9b2c47001e","year":2023},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.725794Z"},"links":{"cited_paper":"/paper/2310.20381","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:18f5feb37364bb67613c0bd64382fbf5cafbae660ee91f9d040188291349bf06","observation_id":"428dbde4-0988-432b-b6e8-14c5432b8d0c","resolution":{"observed_at":"2026-08-10T20:51:54.572731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.065819Z","title":null,"venue":null,"work_id":"ce221aa5-289d-4b2a-9b87-24908a58abdd","year":2014},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.729532Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:fb4c63a464c29e07e665801649ecf9399195dd65b52f80e4739b1e7a5d4bf156","observation_id":"c6e5f53f-0c48-41bc-9a54-c708231817ee","resolution":{"observed_at":"2026-08-10T20:51:55.069170Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.733021Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.733021Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:497b7c94fb49c1d993563cffd182766b00cd5016349a78de6a31112d0755dce9","observation_id":"1d3064b5-78e3-4744-a5ec-017b665f3ac9","resolution":{"observed_at":"2026-08-10T20:51:53.733021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.055703Z","title":null,"venue":null,"work_id":"58b29023-e91a-43b2-97d4-27e80cc03809","year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.736779Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:7034262ff2f2e7bba1e99275f4d5c6425c79ab68c735d1c395854fe9599c374d","observation_id":"23baa8f9-0541-4ee3-aaa8-a71c605713ea","resolution":{"observed_at":"2026-08-10T20:51:55.059148Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-10T14:27:42.532216Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-10T20:51:53.740176Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.740176Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:c23161bb79dfb3a1a9a52a8402325315e840796365bc35e42010891dca3ef747","observation_id":"883a7e11-56e0-4ad0-bde5-c29ede8dd36a","resolution":{"observed_at":"2026-08-10T20:51:53.740176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01887","last_updated":"2017-06-06T06:59:15Z","snapshot_observed_at":"2026-07-06T05:21:35.353268Z","submitted_at":"2016-12-06T16:03:50Z","title":"Knowing When to Look: Adaptive Attention via A Visual Sentinel for Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01887","snapshot_observed_at":"2026-08-10T20:51:53.743853Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.743853Z"},"links":{"cited_paper":"/paper/1612.01887","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:6a30d5be5960e31049aaab55c035f13e5eff68db2847cd497b513b32acb69168","observation_id":"c3f304c4-f074-4a50-a7a9-7b5dbdafc4b2","resolution":{"observed_at":"2026-08-10T20:51:53.743853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.044996Z","title":null,"venue":null,"work_id":"f4d8fe1c-c46d-4bab-931e-446ff206eb76","year":2016},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.747478Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:896857c942f47f93d78193dd845b9fb02a10f604eb6a5733c794bc503b1e6996","observation_id":"18ded13a-885f-4687-b7d3-eed9d9fa3fea","resolution":{"observed_at":"2026-08-10T20:51:55.048719Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3695766","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.053607Z","title":null,"venue":null,"work_id":"1022914d-efbf-44d1-a3d1-6fa5cc623ed2","year":2024},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.751028Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:e078fbe0118861a1c509678688dafd81fc8c797787abde1a2c50bda7d68088ba","observation_id":"27184028-38ec-4614-adf8-5f304bfa8969","resolution":{"observed_at":"2026-08-10T20:51:54.058628Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.033442Z","title":"Malinowski, M","venue":null,"work_id":"3124f4bc-b364-4aff-9d57-4be20dbdb9b8","year":2014},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.753921Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:5fcede95c93fa0f8a8e68c84a22bfa9bb5062d50aa6d7048a3de931956be44e7","observation_id":"5519e78a-7f37-49a6-b973-b11eeb03d00b","resolution":{"observed_at":"2026-08-10T20:51:55.036992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.022048Z","title":null,"venue":null,"work_id":"46736dbe-27f5-4e31-85aa-8bea6061ba3d","year":1993},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.756874Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:87a903eb00aadfa3ab6cf8e4598e51ffdf9eb401aacbb2b5f24b177f4b515e07","observation_id":"0c0fecb6-9c39-483e-a4f6-155060dc14d1","resolution":{"observed_at":"2026-08-10T20:51:55.025910Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00067","last_updated":"2019-09-04T10:43:20Z","snapshot_observed_at":"2026-08-07T00:54:00.522873Z","submitted_at":"2019-05-31T20:29:01Z","title":"OK-VQA: A Visual Question Answering Benchmark Requiring External Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.00067","snapshot_observed_at":"2026-08-10T20:51:53.760050Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.760050Z"},"links":{"cited_paper":"/paper/1906.00067","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:d0ec7f51d325d7827900d5065123ed553edbf1bd3f21869107148183c98a0189","observation_id":"545ce01b-647f-4949-975e-33176d4e992e","resolution":{"observed_at":"2026-08-10T20:51:53.760050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.00997","last_updated":"2020-02-01T06:56:30Z","snapshot_observed_at":"2026-08-11T13:15:09.543573Z","submitted_at":"2019-09-03T08:23:51Z","title":"PlotQA: Reasoning over Scientific Plots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.00997","snapshot_observed_at":"2026-08-10T20:51:53.763426Z","title":"Khapra, and Pratyush Kumar","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.763426Z"},"links":{"cited_paper":"/paper/1909.00997","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:ae7b268259a0b3f275d926e9510f89a8463ebce59d4a93f38bade0809928d19f","observation_id":"4c91c05a-0a83-4f39-b2c3-e819878e58d2","resolution":{"observed_at":"2026-08-10T20:51:53.763426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:55.010166Z","title":"Mikolov, K","venue":null,"work_id":"6e1c4add-2d9e-464b-a69f-6374063f42ec","year":2013},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.766525Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:95e9c9c9a0e94bda17bfbe9e97dc3da50afca8cf945c8c7a56cc255197b80d9c","observation_id":"ca79ace3-b7c7-4bae-a559-415aa9b19d90","resolution":{"observed_at":"2026-08-10T20:51:55.014211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3781","last_updated":"2013-09-07T00:30:40Z","snapshot_observed_at":"2026-07-06T03:04:11.148340Z","submitted_at":"2013-01-16T18:24:43Z","title":"Efficient Estimation of Word Representations in Vector Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3781","snapshot_observed_at":"2026-08-10T20:51:53.769535Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.769535Z"},"links":{"cited_paper":"/paper/1301.3781","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:0d37400a17f1c6209eb4a761d3345afc748a21c94b2a2a93567b5f0c1d09d357","observation_id":"842f6d05-5545-4299-a29d-f096eee7fd0e","resolution":{"observed_at":"2026-08-10T20:51:53.769535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.772581Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.772581Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:f14fe6df352b8ed7ad70f2ca1f7acd1b5750e190aaf0eed3558d5c9f8fc4fee3","observation_id":"93aa5152-6915-46e2-bbe0-45fa855864cf","resolution":{"observed_at":"2026-08-10T20:51:53.772581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.998204Z","title":null,"venue":null,"work_id":"681a7a7f-dbc7-42cc-8ddc-bd36c18b5abb","year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.775560Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:0dbbec256e4687e41bd54a1eb6ceebcea551a17fb5259b6f9151cea5ec6db842","observation_id":"d3b3149c-0f2d-4f50-9aae-ca2a729dce3e","resolution":{"observed_at":"2026-08-10T20:51:55.002125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13843","last_updated":"2022-03-25T18:17:16Z","snapshot_observed_at":"2026-08-03T10:44:24.480046Z","submitted_at":"2022-03-25T18:17:16Z","title":"Quantifying Demonstration Quality for Robot Learning and Generalization","version":1},"cited_work":{"arxiv_id":"2203.13843","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.13843","snapshot_observed_at":"2026-08-10T20:51:54.356993Z","title":"Quantifying Demonstration Quality for Robot Learning and Generalization","venue":"cs.RO","work_id":"0af93f26-685f-413b-b4e6-419ad23f98ec","year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.778973Z"},"links":{"cited_paper":"/paper/2203.13843","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:cd76a399dcba52288c11db9fae76876b601813f46ab5f029791841c1549b093e","observation_id":"f9a0e8c7-4bdf-41a8-a9d2-06cb9364ec41","resolution":{"observed_at":"2026-08-10T20:51:54.360999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.782442Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.782442Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:2ca63d049393edc9336b042d233d344eb55e39ef889778d44d834a5dd5f10033","observation_id":"92f11b32-629d-4748-b5c6-99039f3716d6","resolution":{"observed_at":"2026-08-10T20:51:53.782442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.987187Z","title":"Radford, J","venue":null,"work_id":"22314dc4-3f36-4d53-98c4-a14d4a8e6874","year":2021},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.786073Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:f382678883a3e2d3db2395cbc4477bd06f123fd9eb0c8da0c67313dbbd31ec14","observation_id":"885ce99f-65a2-49bc-ba2a-4ee555ffb698","resolution":{"observed_at":"2026-08-10T20:51:54.990833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.789691Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.789691Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:aa9bfbfadcd2ea31269239c232b04fb5fab32d0832a6ff06391a8359ba285f56","observation_id":"388981fd-48ba-4d6f-af41-2c690c4f43a3","resolution":{"observed_at":"2026-08-10T20:51:53.789691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.968986Z","title":"Dai, Nissan Hajaj, Michaela Hardt, Peter J","venue":null,"work_id":"8903ccdc-b5b0-4268-8202-2e34145dc68c","year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.793155Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:35d50268445a5b03eaa2d8fa972188e31ba8de9f463ee5ac07e2d29a0dcefde6","observation_id":"72ef862a-6cdf-42f9-9c02-5ae13a347aa1","resolution":{"observed_at":"2026-08-10T20:51:54.972805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-10T22:24:05.831832Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-10T20:51:53.796603Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.796603Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:865383d400bfc512a9dd565ed5367a646e14dffe376f148f207878a82f503361","observation_id":"9ac4dfb0-ef30-4095-a712-7352b302e23a","resolution":{"observed_at":"2026-08-10T20:51:53.796603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-10T20:51:53.800473Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.800473Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:95acc4581d1356474644943c41f8175b3992ca4417d9154d424e40a1e2fddf80","observation_id":"f7b80098-fa2b-4499-a264-81ea2c383d0b","resolution":{"observed_at":"2026-08-10T20:51:53.800473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00491","last_updated":"2019-07-21T05:26:36Z","snapshot_observed_at":"2026-08-01T22:56:26.162617Z","submitted_at":"2018-11-01T16:47:44Z","title":"A Corpus for Reasoning About Natural Language Grounded in Photographs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00491","snapshot_observed_at":"2026-08-10T20:51:53.804420Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.804420Z"},"links":{"cited_paper":"/paper/1811.00491","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:f18482d38b02975b8cfd0e75918674780ed5fe3a48202ace4eff3efcff9b7093","observation_id":"be10e4ab-bdf5-4ccb-a755-925eb3c47120","resolution":{"observed_at":"2026-08-10T20:51:53.804420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01766","last_updated":"2019-09-11T19:52:54Z","snapshot_observed_at":"2026-07-06T07:43:30.348919Z","submitted_at":"2019-04-03T04:40:16Z","title":"VideoBERT: A Joint Model for Video and Language Representation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01766","snapshot_observed_at":"2026-08-10T20:51:53.808283Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.808283Z"},"links":{"cited_paper":"/paper/1904.01766","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:30e1d80f0f6594b3f22be475da00b1edcbe86ef6b544ab9732d7745efe93481c","observation_id":"75c44360-d008-4f0e-a0ae-fa6d3816ddef","resolution":{"observed_at":"2026-08-10T20:51:53.808283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.3215","last_updated":"2014-12-14T20:59:51Z","snapshot_observed_at":"2026-08-02T03:58:50.109606Z","submitted_at":"2014-09-10T19:55:35Z","title":"Sequence to Sequence Learning with Neural Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.3215","snapshot_observed_at":"2026-08-10T20:51:53.812131Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.812131Z"},"links":{"cited_paper":"/paper/1409.3215","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:276e02cc7f4d500ca67095c3331835a65b69290fa7f9965668f209f43c3d0583","observation_id":"5d1c6ec6-ec7c-4456-8e92-52c82063aea9","resolution":{"observed_at":"2026-08-10T20:51:53.812131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.957994Z","title":"Tan and M","venue":null,"work_id":"ad86616c-2f89-40ff-91d7-ddd4c78c1be9","year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.815502Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:f8780b62685d7f8fff9f203f5c7a3e2090652cdb83e9a1675e3cc06d0f762176","observation_id":"70892113-6b05-49a8-9f51-178220627eb7","resolution":{"observed_at":"2026-08-10T20:51:54.961598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02902","last_updated":"2016-09-21T04:52:35Z","snapshot_observed_at":"2026-07-06T04:39:19.023282Z","submitted_at":"2015-12-09T15:34:31Z","title":"MovieQA: Understanding Stories in Movies through Question-Answering","version":2},"cited_work":{"arxiv_id":"1512.02902","doi":null,"metadata_source":"pith","pith_arxiv_id":"1512.02902","snapshot_observed_at":"2026-08-10T20:51:54.292236Z","title":"MovieQA: Understanding Stories in Movies through Question-Answering","venue":"cs.CV","work_id":"64deffd7-133b-464a-ae62-0fea097fafa7","year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.819154Z"},"links":{"cited_paper":"/paper/1512.02902","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:7c2abbd60f2dceee39948c138070c8c126b7403cefdbdf8f7901d8b4bb86802b","observation_id":"13269cf6-e7fb-4a2a-b0e7-f0eea277706c","resolution":{"observed_at":"2026-08-10T20:51:54.295923Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.946679Z","title":"Teney, L","venue":null,"work_id":"9a1b4693-fd9d-4f51-ab3d-228bb256a74d","year":2017},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.822615Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:54c2bfe688e6f68dda772de568c74b34762df1fc97519cca7b3b8fb3d00bd8d5","observation_id":"fe4e0938-5c4c-4f67-a459-f6f126badfc6","resolution":{"observed_at":"2026-08-10T20:51:54.950368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-10T20:51:53.825741Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.825741Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:fd5c0ffb62a4825270be36b6c22d2733b7aabf30334774e4ce599315a8b1ff1b","observation_id":"9d81a6dd-1980-4dd0-bc5a-4dfbb6011aad","resolution":{"observed_at":"2026-08-10T20:51:53.825741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.936152Z","title":"Vinyals, A","venue":null,"work_id":"ed10b9ab-ce7e-47a1-bb4d-a3db24e368de","year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.829085Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:dfa8b82a6b43c49951a0fc80c9d3fb193e68faf249af851fcbbae73dff068e03","observation_id":"98e160a2-136c-44b3-a828-fb35bf84fd16","resolution":{"observed_at":"2026-08-10T20:51:54.939815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:53.832129Z","title":"Viola and M","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.832129Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:cfb7852199751f3368f92e9deae6bda8c6ab89cf653d15713c51a5c7ae1407d7","observation_id":"157da2b2-89cb-4d8b-b5a2-03f7c67f38ed","resolution":{"observed_at":"2026-08-10T20:51:53.832129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.11253","last_updated":"2022-08-24T01:18:13Z","snapshot_observed_at":"2026-07-06T13:44:48.609196Z","submitted_at":"2022-08-24T01:18:13Z","title":"FashionVQA: A Domain-Specific Visual Question Answering System","version":1},"cited_work":{"arxiv_id":"2208.11253","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.11253","snapshot_observed_at":"2026-08-10T20:51:54.193883Z","title":"FashionVQA: A Domain-Specific Visual Question Answering System","venue":"cs.CV","work_id":"278c3a48-3ce0-4413-a4ff-b36c07a6716d","year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.835270Z"},"links":{"cited_paper":"/paper/2208.11253","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:fc6ca2fe9a9b668376e2ceacce993071ae8c6d37a36f063b2c1ef6b21b63b1e7","observation_id":"83e42a7c-2a31-40e8-92a4-f576a0583106","resolution":{"observed_at":"2026-08-10T20:51:54.198162Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02310","last_updated":"2023-12-04T19:48:02Z","snapshot_observed_at":"2026-07-06T16:56:53.868165Z","submitted_at":"2023-12-04T19:48:02Z","title":"VaQuitA: Enhancing Alignment in LLM-Assisted Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02310","snapshot_observed_at":"2026-08-10T20:51:53.838388Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.838388Z"},"links":{"cited_paper":"/paper/2312.02310","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:fd6d6c954856b495bc83c6fa154ca9fc363cfb831639300e0d16b6446b81a382","observation_id":"47112ba6-bd39-4f46-82fa-3d78eeab9d10","resolution":{"observed_at":"2026-08-10T20:51:53.838388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.923935Z","title":null,"venue":null,"work_id":"166f6f05-42e3-43e4-b7f4-7d270fe7b016","year":2010},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.841749Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:4f627dd99c9eaab6c3f0362575aaed6f8c4bfc7d6213bf18d8e8895e675e3029","observation_id":"cc571ed1-ecb3-41f8-802d-08c8027e0404","resolution":{"observed_at":"2026-08-10T20:51:54.928239Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.911925Z","title":"Zemel, and Yoshua Bengio","venue":null,"work_id":"a28f7ca5-b454-4884-af7d-ee29660d3c23","year":2015},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.845389Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:e56b6e36d1c16f050be05f9f3f0f8d0838d07debfe83505f88e5f1a43652046f","observation_id":"5b80980b-9b95-4c84-b1ae-c667f9a142b1","resolution":{"observed_at":"2026-08-10T20:51:54.916372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.901076Z","title":null,"venue":null,"work_id":"c6df8f15-38c7-4e56-b908-930c801d3de9","year":2016},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.848327Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:ad4df77630c11495fd442418eb64e73db84a5e0aeeb6deaf7dde34c80faf890c","observation_id":"9e411ca9-4a94-4f71-907b-5dcab2059b05","resolution":{"observed_at":"2026-08-10T20:51:54.904192Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.890555Z","title":null,"venue":null,"work_id":"121a148f-7ec4-4eda-8280-9548e822f7eb","year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.851340Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:f0fb30e300a6ae1f91d406304c07e875abfea4a6a00a37a44dc5b6e796944f03","observation_id":"dff3f1b9-4857-40c8-82d9-f598ba45cfde","resolution":{"observed_at":"2026-08-10T20:51:54.893773Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.880786Z","title":null,"venue":null,"work_id":"ccbac091-06e7-442c-96b9-11fceba724aa","year":2018},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.854396Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:3bedd3e4d1c60cc24ba23e6408e4f5a7dff54309f1c40c590f7fb4898a8e3fd4","observation_id":"8fc1a8d5-2d8a-4449-9258-537cfe60cbe2","resolution":{"observed_at":"2026-08-10T20:51:54.883861Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.10770","last_updated":"2019-06-25T22:16:03Z","snapshot_observed_at":"2026-07-06T08:02:48.571514Z","submitted_at":"2019-06-25T22:16:03Z","title":"Deep Modular Co-Attention Networks for Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1906.10770","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.10770","snapshot_observed_at":"2026-08-10T20:51:54.168435Z","title":"Deep Modular Co-Attention Networks for Visual Question Answering","venue":"cs.CV","work_id":"e32b914e-2137-4cf6-8941-098f7c39328e","year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.857494Z"},"links":{"cited_paper":"/paper/1906.10770","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:661520ba44851035aef34f7b79a3c0c12bbd8a175422075b30cd5aca36c26c1c","observation_id":"7256b2b9-055c-4b35-be01-de20f51bd6c9","resolution":{"observed_at":"2026-08-10T20:51:54.172449Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:51:54.870804Z","title":null,"venue":null,"work_id":"11f46081-82da-4394-943b-b96aac1d931d","year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.861454Z"},"links":{"citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:1c6a9819c9d988714fdb8a1191997036e6f81614c568fbac478629cb5cefb9ce","observation_id":"819221e7-4a8c-49f1-8b06-8aa895dcc46f","resolution":{"observed_at":"2026-08-10T20:51:54.873982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.01225","last_updated":"2022-11-02T05:25:06Z","snapshot_observed_at":"2026-07-30T11:11:52.165985Z","submitted_at":"2022-03-02T16:34:09Z","title":"Video Question Answering: Datasets, Algorithms and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.01225","snapshot_observed_at":"2026-08-10T20:51:53.864871Z","title":"Zhong et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.864871Z"},"links":{"cited_paper":"/paper/2203.01225","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:5ceacb88e74c26e4a6720f94ca816af027a012d836c823483570bb4993a418c2","observation_id":"f955df89-9382-4154-9cce-d308592807f8","resolution":{"observed_at":"2026-08-10T20:51:53.864871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11059","last_updated":"2019-12-04T18:48:15Z","snapshot_observed_at":"2026-07-06T08:24:14.564207Z","submitted_at":"2019-09-24T17:17:26Z","title":"Unified Vision-Language Pre-Training for Image Captioning and VQA","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11059","snapshot_observed_at":"2026-08-10T20:51:53.868522Z","title":"Corso, and Jianfeng Gao","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:53.868522Z"},"links":{"cited_paper":"/paper/1909.11059","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:6f9a623e0696f6a2d625891eddf52fce7fda77927e5ffd222b4a27bc1f08a434","observation_id":"8029f90d-1061-4de4-a39a-82d37954b3d8","resolution":{"observed_at":"2026-08-10T20:51:53.868522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00973","last_updated":"2024-04-01T07:44:24Z","snapshot_observed_at":"2026-07-06T17:53:51.988186Z","submitted_at":"2024-04-01T07:44:24Z","title":"VideoDistill: Language-aware Vision Distillation for Video Question Answering","version":1},"cited_work":{"arxiv_id":"2404.00973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.00973","snapshot_observed_at":"2026-08-10T20:51:54.129720Z","title":"VideoDistill: Language-aware Vision Distillation for Video Question Answering","venue":"cs.CV","work_id":"5adfd178-194d-4ab6-a0d5-3a4490c9aa65","year":2024},"citing_paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-10T20:51:54.013771Z"},"links":{"cited_paper":"/paper/2404.00973","citing_paper":"/paper/2501.07109"},"observation_digest":"sha256:02ff37b899d57364959713435fe6c43e3400235146eed6749d1f9827ee4b9968","observation_id":"c7339b61-c655-4569-902f-aec0ec4c0aab","resolution":{"observed_at":"2026-08-10T20:51:54.135094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.07109","last_updated":"2025-01-13T07:43:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T06:20:11.565093Z","submitted_at":"2025-01-13T07:43:33Z","title":"The Quest for Visual Understanding: A Journey Through the Evolution of Visual Question Answering"},"reference_resolution":{"displayed":98,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":74,"verified_exact":12,"verified_fuzzy":11},"total_outbound_references":98},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 98 of 98 outbound references and 1 inbound Pith citation observation for arXiv:2501.07109."}