{"as_of":"2026-08-16T15:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dd4069525f8ede7a60bdceea538288d6983937974686790ce6ee1afaffb9955f","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:22:44.533980Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.03289/citation-record","integrity":"/paper/1908.03289/integrity","json":"/paper/1908.03289/citation-record.json","paper":"/paper/1908.03289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.914239Z","title":"Block: Bilinear Superdiagonal Fusion for Visual Question Answering and Visual Rela- tionship Detection,","venue":null,"work_id":"2b063732-1250-4cdd-9d57-cecc4232ef57","year":2019},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.413094Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:aeb98bb29487b1361f731904410ba1939b42027868eba2b41de58e2206f54977","observation_id":"47c493d0-6c15-4e69-998c-84e2633fb546","resolution":{"observed_at":"2026-08-14T14:22:44.919349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.898689Z","title":"Vqa: Visual question answering,","venue":null,"work_id":"3cd24970-c41c-4107-8e0d-0cda568b9d5e","year":2015},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.418613Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:f9af9df1cbfe5ddb04a1b6d8e1d6dc54f0272035cfef9b92b898b31e7ebd3f32","observation_id":"8e86f382-2e26-4705-8bcb-d70441bd0cd7","resolution":{"observed_at":"2026-08-14T14:22:44.903435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01847","last_updated":"2016-09-24T01:58:59Z","snapshot_observed_at":"2026-08-14T21:53:59.472078Z","submitted_at":"2016-06-06T17:59:56Z","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01847","snapshot_observed_at":"2026-08-14T14:22:44.423711Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.423711Z"},"links":{"cited_paper":"/paper/1606.01847","citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:d8f1797352d8f49a8ab06f357f53b1bcc3baf413c35a6d6ef0b86170dd18650a","observation_id":"c0fb161a-f99e-4715-a5b9-2002e84523d2","resolution":{"observed_at":"2026-08-14T14:22:44.423711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.429142Z","title":"Stacked attention networks for image question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.429142Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:4186b9e4ca20b5874dd7897b023e121c2e2e161e389d9b61cbeaceff0e14fc69","observation_id":"736b6f5d-db2f-45b7-be16-3525e7ffb9ce","resolution":{"observed_at":"2026-08-14T14:22:44.429142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.434232Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.434232Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:ba35e082a36514bc76ca16909065270d97108f650419f1a0ef14a70ed61dc4de","observation_id":"cb3c2835-e211-45e3-8c2d-8e860f536b56","resolution":{"observed_at":"2026-08-14T14:22:44.434232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.862246Z","title":"Reciprocal attention fusion for visual question answering,","venue":null,"work_id":"1ccbaf81-6945-41d3-89db-e00339a308dd","year":2018},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.439147Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:389c44cf3755eb4b7c4e4aca8ea53d0f5e9286a97661fa9cfb9a737046a9f74c","observation_id":"7c303ddd-4764-46b6-a2ba-f566aa5c0556","resolution":{"observed_at":"2026-08-14T14:22:44.867166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.846428Z","title":"Co-attending free-form regions and detections with multi-modal multiplicative feature embed- ding for visual question answering,","venue":null,"work_id":"0bd515da-bfdb-47c1-ac0e-8b886105fc79","year":2018},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.444383Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:f104b17ac09c38a15f2c248e179bdd8e173d259d6ed87145cc466464f8e12ba4","observation_id":"17841461-4a65-44d8-ba19-047c8d9b01b6","resolution":{"observed_at":"2026-08-14T14:22:44.851711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.830472Z","title":"Mutan: Multi- modal tucker fusion for visual question answering,","venue":null,"work_id":"e4d7076a-1f77-4301-b328-98a0231c05dd","year":2017},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.449093Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:80e768841ffb00ad12c29aad634ca9712461be1b020cafcefbe4d78a69eb8ff8","observation_id":"e1ad8158-dc11-421d-ad7c-9db1e323beaf","resolution":{"observed_at":"2026-08-14T14:22:44.835768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.814629Z","title":"Hierarchical question-image co-attention for visual question answering,","venue":null,"work_id":"756b3fb3-f4ca-4549-97f9-802ee3a9338a","year":2016},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.453878Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:5781100ffd8ab112a81aef1b8c44736f68fcea13287ef54be37785207baa83de","observation_id":"9ef19cd6-219b-4157-b563-7a2f184ed6f4","resolution":{"observed_at":"2026-08-14T14:22:44.819995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.796769Z","title":"From known to the unknown: Transferring knowledge to answer questions about novel visual and semantic concepts,","venue":null,"work_id":"ac0c7557-5dcf-4c2c-b203-beb415696fab","year":2020},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.458840Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:767b4dc5967fca26ef09df8a7ccd5b25980d314f39a5d60adf756c0d07373b5e","observation_id":"2367e106-1b82-4e6c-afb6-0270772732fd","resolution":{"observed_at":"2026-08-14T14:22:44.801910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.463309Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.463309Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:3b2f7bcab2436acfa50fcf539aa687640200a26859858b60df3af5852857764b","observation_id":"bae4e041-29d4-42e4-ab24-b42b3d02a4c1","resolution":{"observed_at":"2026-08-14T14:22:44.463309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.467812Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.467812Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:b6f7993cc58df96668e013cc95b7234fc7f202334a038f49511e44afa361bc14","observation_id":"9c59022a-3daa-4596-abb2-b01b21915148","resolution":{"observed_at":"2026-08-14T14:22:44.467812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.762792Z","title":"Learning to count objects in natural images for visual question answering,","venue":null,"work_id":"bc74b3ee-9ef7-4967-a95e-baaa90bc420a","year":2018},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.472585Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:92d6c1c7f99f5be06044619f5f5b98f92871a99db0fc68bbe9eea9874c4d3ae3","observation_id":"dc960ddd-e561-42c9-a403-e10c34e0b435","resolution":{"observed_at":"2026-08-14T14:22:44.767736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.748113Z","title":"Where to look: Focus regions for visual question answering,","venue":null,"work_id":"ccf11ab1-c494-41e6-a44d-7ae7b19d3138","year":2016},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.477125Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:6df1241113bd84180830c73ba499dfd5c9b25f9e2101073453186432864e70af","observation_id":"a573dd06-2643-4640-b59f-e6008ae38b8f","resolution":{"observed_at":"2026-08-14T14:22:44.753045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.732519Z","title":"Human attention in visual question answering: Do humans and deep networks look at the same regions?","venue":null,"work_id":"051f4722-0a1a-4528-bb84-6fe6bd427129","year":2017},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.481693Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:4de2161edc2f696ca2a716fef33131f01e2a3f91c9116bb188ae02de96c8b7dd","observation_id":"c647c78d-3153-48ef-91c4-9f918ed22394","resolution":{"observed_at":"2026-08-14T14:22:44.738023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.717158Z","title":"Learning to predict where humans look,","venue":null,"work_id":"daf94bd2-dc26-43a9-9247-e15286e612b3","year":2009},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.486444Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:f4b4bb372de7d628cee64803b3e561a4183af28fcc2b87f2475a5f854383a409","observation_id":"1e7adb88-2a0f-4503-bd06-757337bb2dec","resolution":{"observed_at":"2026-08-14T14:22:44.721801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.491380Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.491380Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:8b1123b0b0867c35132c1d23c6b6cba80f499dc600ccf86c4a708c65fc5030ce","observation_id":"02e8b8dd-72c5-409b-9008-15eebadaf66e","resolution":{"observed_at":"2026-08-14T14:22:44.491380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.496591Z","title":"Glove: Global vectors for word representation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.496591Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:91619411b8a055e769cbe36d495c7174c461170ca07168acee5f7513b29a02a7","observation_id":"4c75e972-52ae-48f3-9af1-c364c45f2b3a","resolution":{"observed_at":"2026-08-14T14:22:44.496591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.682571Z","title":"Skip-thought vectors,","venue":null,"work_id":"de757f21-2718-47cf-9dc1-b463cefa3029","year":2015},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.501336Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:719572ef6bc2eb563617e17a2164e462cb9c9ff62d4007493f040e46a43e70f8","observation_id":"60e3aa4f-8069-455d-afd3-d1472d3db324","resolution":{"observed_at":"2026-08-14T14:22:44.687279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.666641Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"24854a29-2be0-4441-8e77-4202de5fba41","year":2017},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.505959Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:cfb8df54c2742bb936ae40629ba4667b4e0a3c0a2810930a10a37d0c72e4192d","observation_id":"cd9c8b41-44ce-43fe-b66d-518a0c8ed28d","resolution":{"observed_at":"2026-08-14T14:22:44.672563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.510738Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.510738Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:4f77c8c00ef07cc4870df0dce1b35a3f29626ccf1a62d1033f3c6dcb64b4ee26","observation_id":"abe71735-c3c3-4dc6-bf45-ad43e6f3641c","resolution":{"observed_at":"2026-08-14T14:22:44.510738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.642688Z","title":"An analysis of visual question answering algorithms,","venue":null,"work_id":"95bddfa0-9c49-4247-882f-1da9a175db34","year":2017},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.515249Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:05cebc17f15fcce042b8fafc42c218b29fc022de7c99a122d4cb6ca2f5e87d40","observation_id":"970d208f-f64b-415e-8881-ca0986a43e2a","resolution":{"observed_at":"2026-08-14T14:22:44.647382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.520068Z","title":"Mask r-cnn,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.520068Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:fd56c0a778d6b559006acda95bc23b94bd6e88d122df6a42317565050cd04f8a","observation_id":"b981af2b-7c2d-45c0-a924-f859149ec356","resolution":{"observed_at":"2026-08-14T14:22:44.520068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.615314Z","title":"Beyond bilinear: Generalized multimodal factorized high-order pooling for visual question answering,","venue":null,"work_id":"e7f121bd-438f-431e-bd70-d090b578f3d7","year":2018},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.524730Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:65adbacb795ddcdb32beb89b19a63227e2146c568aabafc30f912f510413a374","observation_id":"1d032b3f-d186-4bcc-a3fc-99a724c87178","resolution":{"observed_at":"2026-08-14T14:22:44.621310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:22:44.598188Z","title":"Neural module networks,","venue":null,"work_id":"9c71dc30-349f-4468-a460-8e85ae086245","year":2016},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.529554Z"},"links":{"citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:44152ae01d42a8671c3f893c5e17c9c553aef6e27e60c4f5c0875c40b32a4b33","observation_id":"b9b87779-5061-46c9-93e2-d4400070b731","resolution":{"observed_at":"2026-08-14T14:22:44.604528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03647","last_updated":"2016-09-30T03:31:53Z","snapshot_observed_at":"2026-08-16T01:37:33.075457Z","submitted_at":"2016-06-12T00:47:46Z","title":"Training Recurrent Answering Units with Joint Loss Minimization for VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03647","snapshot_observed_at":"2026-08-14T14:22:44.533980Z","title":"Training recurrent answering units with joint loss minimization for vqa,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:22:44.533980Z"},"links":{"cited_paper":"/paper/1606.03647","citing_paper":"/paper/1908.03289"},"observation_digest":"sha256:877d53597141c5bc5782cef2d0366d128e8cb728567e1832ebf37e9d65100ee6","observation_id":"a88bf7d5-96d7-4a68-bee0-5934215e4b5a","resolution":{"observed_at":"2026-08-14T14:22:44.533980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"1908.03289","last_updated":"2020-09-06T03:52:27Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T03:05:12.638346Z","submitted_at":"2019-08-09T03:03:23Z","title":"Question-Agnostic Attention for Visual Question Answering"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:1908.03289."}