{"as_of":"2026-08-15T21:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4d6723cbc663bc0c7b0652c24952760af33d512eb6dc1f383c65a29546629268","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T14:10:16.760619Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:22:25.530287Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-14T12:22:25.827597Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"cited_work":{"arxiv_id":"1908.04289","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.04289","snapshot_observed_at":"2026-08-14T12:22:25.827597Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","venue":"cs.CV","work_id":"2ca8d4b8-0a3c-4175-ae2f-57ecce089dcb","year":2019},"citing_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-14T12:12:43.486524Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T12:22:25.530287Z"},"links":{"cited_paper":"/paper/1908.04289","citing_paper":"/paper/1908.07490"},"observation_digest":"sha256:ace0c3911d6fc176ec156870b69ab6e06b2bbd93638719f066b3c114cd8e08c0","observation_id":"32e70082-8c07-4327-8b3d-e21b107212c7","resolution":{"observed_at":"2026-08-14T12:22:25.833918Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.04289/citation-record","integrity":"/paper/1908.04289/integrity","json":"/paper/1908.04289/citation-record.json","paper":"/paper/1908.04289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.551150Z","title":"Bottom-up and top-down attention for image captioning and visual question answering","venue":null,"work_id":"14804795-e013-4a42-a98d-335b7baff5b0","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.516954Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:0acf3880fa8b8f705a964dc1840d597f8ffebc02dd4c52f0481b8b1a25fb9cad","observation_id":"f8794b00-5993-4e9f-9142-22eebf63d381","resolution":{"observed_at":"2026-08-14T14:10:17.556713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.537799Z","title":"Vqa: Visual question answering","venue":null,"work_id":"16c0b0b7-addd-4d45-9e7c-f99733cf439d","year":2015},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.522005Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:05cbd7402eba2cb5fb827381d31693ad67a59bdd15b3a07d59970427bda64482","observation_id":"3941720b-7a5b-43cb-80ca-b9bd5042be37","resolution":{"observed_at":"2026-08-14T14:10:17.542685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.523082Z","title":"Mutan: Multimodal tucker fusion for visual question answering","venue":null,"work_id":"156d0400-9855-43d4-8231-54b43db4198a","year":null},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.526459Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:b6a7dd7e40049053fc44d4944b6fcd4bc80cb06d609fa7c392e912fe81e7126a","observation_id":"52832828-3328-471d-bdde-897415fba561","resolution":{"observed_at":"2026-08-14T14:10:17.527839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.531280Z","title":"Sca-cnn: Spatial and channel-wise attention in convolutional networks for image captioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.531280Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:e98a478b8b7318981b48669aa9c7b2b1da28509009add3f73e55ba42dd7e4945","observation_id":"d7fc90f7-b5cc-4559-9906-8d368a04006d","resolution":{"observed_at":"2026-08-14T14:10:16.531280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.501483Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"130947a5-2b63-4eb4-a165-e5ae04ed8fc2","year":2009},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.535373Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:09992fa745a575c37c2e17cf1cababda9bf4c1963b9396ddab99c40be2081bef","observation_id":"63c24c3a-8e2f-48bf-b099-1c4c1ef00846","resolution":{"observed_at":"2026-08-14T14:10:17.506296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T14:10:16.539555Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.539555Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:feb601bad1d81622d8f11356d620c15a2e44fd5543d990fdee47b1e4920d8d27","observation_id":"61c023c2-b3af-4047-95df-fd6490f84d96","resolution":{"observed_at":"2026-08-14T14:10:16.539555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01847","last_updated":"2016-09-24T01:58:59Z","snapshot_observed_at":"2026-08-14T21:53:59.472078Z","submitted_at":"2016-06-06T17:59:56Z","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01847","snapshot_observed_at":"2026-08-14T14:10:16.544173Z","title":"Multimodal com- pact bilinear pooling for visual question answering and vi- sual grounding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.544173Z"},"links":{"cited_paper":"/paper/1606.01847","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:4b909ba6e26c3b8166b4d7e89425f8c19b58bddfcf66a9431127733cdf5c519b","observation_id":"c7df4cfc-ad11-4d94-9eea-30cb792f96f3","resolution":{"observed_at":"2026-08-14T14:10:16.544173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.487717Z","title":"Dy- namic fusion with intra-and inter-modality attention ﬂow for visual question answering","venue":null,"work_id":"50878b37-ed96-43ae-a4dc-edaa159a84d3","year":2019},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.549038Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:07f039ac88ca82062e99aaa4b79ec8def27cf84772f068fdad10ba12c542bb60","observation_id":"532a131c-4239-4c17-956d-5d8bde91264d","resolution":{"observed_at":"2026-08-14T14:10:17.492429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.473442Z","title":"Question-guided hy- brid convolution for visual question answering","venue":null,"work_id":"e4e06d43-1b6c-44da-baad-926c3a3ef8fe","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.553086Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:e85a8a46309f4cf243ed1b566df87aeac7f43ee9a564e326dac685f53a81acc6","observation_id":"f626cac9-74e9-4d54-8c40-7c3694423d9b","resolution":{"observed_at":"2026-08-14T14:10:17.478287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.457979Z","title":"Compact bilinear pooling","venue":null,"work_id":"c2fb6af4-538b-4295-9aea-c331da6fb4c7","year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.556968Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:b56d728c7e3cf9271ec25189b6c3e1f43e0344c954d796c644cc2e9f98ff99e1","observation_id":"8153b2b5-04b5-446e-a30f-0a7f0c59ab12","resolution":{"observed_at":"2026-08-14T14:10:17.462487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.442855Z","title":"2nd place solution to the gqa challenge","venue":null,"work_id":"02d8b02c-b83b-44bb-a2d7-08d0e0e2598f","year":null},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.561528Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:fc506a8b335a057bc38e2656bbe316cce0042da5584c45a5701d32ed5ac1b327","observation_id":"90176aa6-a73a-4583-9813-cbf714d5130b","resolution":{"observed_at":"2026-08-14T14:10:17.448325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.430094Z","title":"Making the V in VQA matter: Ele- vating the role of image understanding in Visual Question Answering","venue":null,"work_id":"21150ccb-2d23-4103-8612-ff7b2b1caa2c","year":2017},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.570021Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:60a2525cc27c8a6bfeffe69bbf85e213b6b2197ce6e6fd7ac625bed2fcb1ae43","observation_id":"d74ce0eb-9090-44eb-9b36-e42a761c56a5","resolution":{"observed_at":"2026-08-14T14:10:17.434668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.415851Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"4b730b2a-3182-479c-abba-b00aaec80f57","year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.573779Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:135267555795969abe2b37bccbfbb753c5a38eb082a1e8616fd5691c966693eb","observation_id":"88e27c44-0f68-48ef-8eb1-1cef736b7665","resolution":{"observed_at":"2026-08-14T14:10:17.420596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.400008Z","title":"Relation networks for object detection","venue":null,"work_id":"9942ef2c-b2c8-4515-8b47-65aabb8f97af","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.577727Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:2ade0672e7b88f1965f586c65013396f00473900e6ab79e1d5e8dfa6871ba4ed","observation_id":"6a995f6b-c0bd-433d-a828-a4f9984090a5","resolution":{"observed_at":"2026-08-14T14:10:17.405333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04833","last_updated":"2019-06-11T21:34:09Z","snapshot_observed_at":"2026-08-14T16:17:11.113450Z","submitted_at":"2019-06-11T21:34:09Z","title":"Weakly-supervised Compositional FeatureAggregation for Few-shot Recognition","version":1},"cited_work":{"arxiv_id":"1906.04833","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.04833","snapshot_observed_at":"2026-08-14T14:10:16.916665Z","title":"Weakly-supervised Compositional FeatureAggregation for Few-shot Recognition","venue":"cs.CV","work_id":"9a03936e-7078-4e7e-9e28-cd55d1c958b2","year":2019},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.581579Z"},"links":{"cited_paper":"/paper/1906.04833","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:b2d14baf9b1eb3ae5157210c40d0a3733288cb46ff56292058a5039edd6755ba","observation_id":"4fcf0b6b-17f1-4c3c-acad-41557ff3f9be","resolution":{"observed_at":"2026-08-14T14:10:16.921728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.388074Z","title":"Learning to segment every thing","venue":null,"work_id":"74c36206-a85d-4cca-8e35-af63f304cd58","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.585698Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:91a16b6496798ac948c253b2706ee631559c19469e4a78d3f81e7807c4185a81","observation_id":"478c626e-c65b-4415-a993-59441475868e","resolution":{"observed_at":"2026-08-14T14:10:17.392561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.589671Z","title":"Densely connected convolutional net- works","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.589671Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:d072ea11087f58fae53db2ab896f3fc5ff33d6772adb4349148a85cf48729803","observation_id":"c800019c-d2df-4c7e-97fd-1769b900edfc","resolution":{"observed_at":"2026-08-14T14:10:16.589671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.368169Z","title":"Video object detection with locally-weighted deformable neighbors","venue":null,"work_id":"bcc40821-b2e2-4465-af87-3a9b14111c6c","year":2019},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.594324Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:a3fabaa874b097cb8619cc04ff28ac503387214520d707922732536f90bfa33a","observation_id":"7ffb9b8b-e6e0-4ff7-aa07-2c926e53558b","resolution":{"observed_at":"2026-08-14T14:10:17.372598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.353863Z","title":"Clevr: A diagnostic dataset for compositional language and elemen- tary visual reasoning","venue":null,"work_id":"d1e81de0-dff7-4534-9def-79fe8e690f33","year":2017},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.598794Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:401eb3a1b8df929feb284338b75ea5ecd41cd3ce2464b588acb648dd0b473ee4","observation_id":"e35de43b-3009-4694-9a00-0665efae6991","resolution":{"observed_at":"2026-08-14T14:10:17.359045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.334885Z","title":"An analysis of visual question answering algorithms","venue":null,"work_id":"19eba7fc-ac0a-46c2-8284-a32e35a1a0f8","year":1965},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.603448Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:e43659c0150b1fc4a293f4fadbcf2cba54863e5a7a58fda96a7004aa64e70f02","observation_id":"7f53e586-a14c-4007-91de-fa7bf28b6dcc","resolution":{"observed_at":"2026-08-14T14:10:17.340027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.319108Z","title":"Bilin- ear attention networks","venue":null,"work_id":"fff4873b-40f1-4b3a-9c92-8600cdc57ed4","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.607374Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:5470d2ca39b1aa037f4695964b68954a4b9dd64045da5aa4b604020fb5128a91","observation_id":"c2d20e82-c705-4789-8e7b-4f4a32468a76","resolution":{"observed_at":"2026-08-14T14:10:17.324081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.04325","last_updated":"2017-03-26T16:22:47Z","snapshot_observed_at":"2026-08-14T21:35:17.971407Z","submitted_at":"2016-10-14T04:29:52Z","title":"Hadamard Product for Low-rank Bilinear Pooling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.04325","snapshot_observed_at":"2026-08-14T14:10:16.611224Z","title":"Hadamard product for low-rank bilinear pooling","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.611224Z"},"links":{"cited_paper":"/paper/1610.04325","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:15d540780fdb8e38506597bd0ac33dfde60da0f54fedffaa1c8928bfb22b7b2d","observation_id":"789e25c9-c14a-47d9-9448-52a1758c08d1","resolution":{"observed_at":"2026-08-14T14:10:16.611224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T14:10:16.615304Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.615304Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:41fb8e01fdb4124891ebc84dae7b0bcbc1dbb9c3ddc969c7abd44ddef8640b97","observation_id":"d7099b22-edbf-4701-875c-c95a3db858fa","resolution":{"observed_at":"2026-08-14T14:10:16.615304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.303019Z","title":"Skip-thought vectors","venue":null,"work_id":"fc6bccf9-a548-44b0-a751-2e0961b06256","year":2015},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.621107Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:6eb35d27e711550339663285aca119a854c9e2ba92d40f3fde73a4da5347fe5c","observation_id":"fba9b756-99a7-4e13-9aa4-b1a17e9f3783","resolution":{"observed_at":"2026-08-14T14:10:17.308746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.625287Z","title":"Imagenet classiﬁcation with deep convolutional neural net- works","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.625287Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:9ef6c570403f6068dcb28c0b72c2576a7c9cefc42cfe5fee892ae233c852e767","observation_id":"6cfde9e3-b90f-4126-8fe4-a12cc0d4b3ed","resolution":{"observed_at":"2026-08-14T14:10:16.625287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.629337Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.629337Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:91371cd95a2c730b40311a7e6b5a043e2e30c8550a2c0c43cea15fd34147d3f0","observation_id":"567d933e-59d2-4345-9993-f8dfe5c490fa","resolution":{"observed_at":"2026-08-14T14:10:16.629337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.258187Z","title":"Improving referring expression grounding with cross-modal attention-guided erasing","venue":null,"work_id":"3264b1d1-6062-44c9-bb9c-5814cedbcce1","year":1950},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.633455Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:70e1f1b475e7c3e3f57bfc9bd277cbcbc71882bed71e78259f81c5d6de3b9068","observation_id":"7b111dbf-8d54-49fd-9a3e-3b66434d39ef","resolution":{"observed_at":"2026-08-14T14:10:17.264602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.02265","last_updated":"2019-08-06T17:33:52Z","snapshot_observed_at":"2026-08-14T14:46:41.013114Z","submitted_at":"2019-08-06T17:33:52Z","title":"ViLBERT: Pretraining Task-Agnostic Visiolinguistic Representations for Vision-and-Language Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.02265","snapshot_observed_at":"2026-08-14T14:10:16.637749Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic represen- tations for vision-and-language tasks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.637749Z"},"links":{"cited_paper":"/paper/1908.02265","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:1535704643e5cb82c60cbf6c3f96433dcd82a3ab26e8d32dc9a21cb1729916df","observation_id":"fe831b02-d01a-4554-b47e-7eee89b55662","resolution":{"observed_at":"2026-08-14T14:10:16.637749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.238884Z","title":"Hierarchical question-image co-attention for visual question answering","venue":null,"work_id":"cbb87187-faee-415e-9934-7e1021d6194c","year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.642418Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:895972dea834c93aa2fd11e678b569218a7750a1a52a7482acdbe85828887ec1","observation_id":"d1e91f63-aeee-4e88-af30-73411c56a52c","resolution":{"observed_at":"2026-08-14T14:10:17.245332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.224091Z","title":"Distributed representations of words and phrases and their compositionality","venue":null,"work_id":"0e2ee81a-77ed-4841-b0f0-fc58c4f64bb8","year":2013},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.646144Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:8ed7f8fb6f9c55728d83570bd98e38f18428116288c39afd0ffeb6afa3bc99ea","observation_id":"25361de9-a941-441c-b375-964800efefb6","resolution":{"observed_at":"2026-08-14T14:10:17.228948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.210753Z","title":"Improved fusion of visual and language representations by dense symmetric co-attention for visual question answering","venue":null,"work_id":"6ff1947b-861f-408d-abbf-3a1701dd7ee2","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.649799Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:7a3e4b1a9c04b23a29881b383dc3a82de9ddd7a307a187cf5b9fadf9fb26ef27","observation_id":"1a56c1bf-1028-4e01-a1ed-d84b7ac9c4cd","resolution":{"observed_at":"2026-08-14T14:10:17.215859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.03647","last_updated":"2016-09-30T03:31:53Z","snapshot_observed_at":"2026-08-14T21:53:10.432138Z","submitted_at":"2016-06-12T00:47:46Z","title":"Training Recurrent Answering Units with Joint Loss Minimization for VQA","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.03647","snapshot_observed_at":"2026-08-14T14:10:16.653933Z","title":"Training recurrent an- swering units with joint loss minimization for vqa","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.653933Z"},"links":{"cited_paper":"/paper/1606.03647","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:db43dc0cb9ae52dc66476ebb47ef45caff5aad6ccfd905f85e02bf67eabf3aa4","observation_id":"cea23f11-e8c5-4b1f-a78f-7a5d3a403b19","resolution":{"observed_at":"2026-08-14T14:10:16.653933Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.195582Z","title":"Im- age question answering using convolutional neural network with dynamic parameter prediction","venue":null,"work_id":"bdcef051-d711-4f15-bcd4-50c0533969c6","year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.658486Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:24abc7b41997e366d968180904a640b364bd248aa5af12cbd530e76c0c4148f9","observation_id":"60aacede-dd90-40e1-81e4-0b32d574e339","resolution":{"observed_at":"2026-08-14T14:10:17.201769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.180888Z","title":"Learning conditioned graph structures for interpretable vi- sual question answering","venue":null,"work_id":"68c218d0-2179-4f54-bba4-e6da120efe5c","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.664105Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:fd0e1722780bddd9f0c5cc15c32e05d58c57854aa50c9013df0fdc0b634b0604","observation_id":"988bf229-828f-48e0-8335-df53c9ccadca","resolution":{"observed_at":"2026-08-14T14:10:17.185787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.668428Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.668428Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:9bef0db92ffdbb61cdc36f767f939faf4ecc989a52e94a5004530c0c635d73af","observation_id":"9b0fb6fd-9f3c-4f04-9c4f-f11874844548","resolution":{"observed_at":"2026-08-14T14:10:16.668428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05252","last_updated":"2019-08-23T19:25:25Z","snapshot_observed_at":"2026-08-15T20:19:06.192027Z","submitted_at":"2018-12-13T03:41:18Z","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05252","snapshot_observed_at":"2026-08-14T14:10:16.674020Z","title":"Dynamic fusion with intra-and inter-modality attention ﬂow for visual ques- tion answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.674020Z"},"links":{"cited_paper":"/paper/1812.05252","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:c87c7d9a1568d9a20cf978783e6b7229533b188a5343eaf34e0019a4c4670c6d","observation_id":"40a778a7-310d-451a-b131-44197d020028","resolution":{"observed_at":"2026-08-14T14:10:16.674020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.678574Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.678574Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:7a29788eab0a7805b0fb4e34c01a112e4198cb02db2740336ad11a370496242f","observation_id":"ce22324b-860a-4eae-9220-d29dbf2e4eeb","resolution":{"observed_at":"2026-08-14T14:10:16.678574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.140983Z","title":"Film: Visual reasoning with a general conditioning layer","venue":null,"work_id":"b5c11ec8-cc64-47ec-bfa9-dbd4989e1c9b","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.683012Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:44742bc2d9cff3273aba3e549f17e62267464101f149c9ce3846aec10f4cdd86","observation_id":"68e5d917-76b3-4481-877f-3c6e85b6a2b3","resolution":{"observed_at":"2026-08-14T14:10:17.146576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.125720Z","title":"Deep contextualized word representations","venue":null,"work_id":"d546bfd9-187c-4574-9571-015de97cef50","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.688219Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:14dfd15c7a236d1a82deb61d5ae435ebb7b1f2b2fb90ae77d06da13b49760e28","observation_id":"7522a3e6-cf18-4dde-80a8-d9cf8eb13b5c","resolution":{"observed_at":"2026-08-14T14:10:17.130481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.692191Z","title":"Language models are unsuper- vised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.692191Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:8b2a46a8a5826f4f9d6fbc60a81519b978cd8a3c672807cffc4a063be52b7cd8","observation_id":"b48ce64b-0f92-4ee7-a237-1fec3d7f0918","resolution":{"observed_at":"2026-08-14T14:10:16.692191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.103930Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks","venue":null,"work_id":"0126baa1-2ac8-4c97-a6c4-c3ee33f7d7b1","year":2015},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.696716Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:74d071d5962c49bef04a421705a0aecd4a4936f853951fe642385a75dc65d561","observation_id":"52362887-7d93-44d1-b0ee-0963074959e1","resolution":{"observed_at":"2026-08-14T14:10:17.109313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.090007Z","title":"A simple neural network module for relational rea- soning","venue":null,"work_id":"c0b632bf-7e0c-4723-859c-2f7ee0190773","year":2017},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.701080Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:d135a0f63b80975f703f9b7fcd8bb97d4361028916f2709f999337934c4af21e","observation_id":"73f4e08b-e4aa-419a-9b1e-9953aa6767ac","resolution":{"observed_at":"2026-08-14T14:10:17.094891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.077410Z","title":"Question type guided attention in visual ques- tion answering","venue":null,"work_id":"d323576c-fb73-4c1d-b27b-ba2dedec2afa","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.705116Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:32dd7904c72680acf89233ea4eec830deb68a737b1ab3d12fe6446609112b9e0","observation_id":"2d6bca56-b516-466c-b929-64a53a53c5bf","resolution":{"observed_at":"2026-08-14T14:10:17.081647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T14:10:16.709992Z","title":"Very deep convo- lutional networks for large-scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.709992Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:bb03aa224768b8af79d0bf76f4c2d0bad5f6a1bd8c97356adbd46a8a1a28dfb1","observation_id":"85f2cdf2-0d6e-4cbc-97fe-76967bd6ec6a","resolution":{"observed_at":"2026-08-14T14:10:16.709992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.065305Z","title":"Attention is all you need","venue":null,"work_id":"2499326e-babb-4bdb-9902-d080cea161a3","year":2017},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.713848Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:8ab2abe270102adca6bb14e7a498c3c0f3838fb1e5838c68c0e7ad885bbca96a","observation_id":"b6ee223f-13c4-4ed4-b049-003d9f6bf967","resolution":{"observed_at":"2026-08-14T14:10:17.069512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.717747Z","title":"Non-local neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.717747Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:1fc200c9c9787b969b45bce75333e3753d9ec0f7e8be0d7a8d5439f333e408d0","observation_id":"f9aa4ee0-2de4-4ff1-9ddb-b916780cc722","resolution":{"observed_at":"2026-08-14T14:10:16.717747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10430","last_updated":"2019-02-22T23:46:38Z","snapshot_observed_at":"2026-08-15T16:08:35.191385Z","submitted_at":"2019-01-29T18:01:35Z","title":"Pay Less Attention with Lightweight and Dynamic Convolutions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10430","snapshot_observed_at":"2026-08-14T14:10:16.722235Z","title":"Pay less attention with lightweight and dy- namic convolutions","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.722235Z"},"links":{"cited_paper":"/paper/1901.10430","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:1ac8bb9bae8162b297dc88f51d7a1948c5e1873b160d5c04f88caedc4d19e2ac","observation_id":"e530c4c5-f0de-477b-8477-f737887aa4dd","resolution":{"observed_at":"2026-08-14T14:10:16.722235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.043112Z","title":"Show, attend and tell: Neural image caption gen- eration with visual attention","venue":null,"work_id":"dcfabf4e-8dfb-4f7f-9f8e-584c69923cb6","year":2015},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.726466Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:6c0a6ae776d8c55fab03640403be748d6e54cd97fbf3484a00fe9fd3ee03e88e","observation_id":"c1ff441c-aa0b-41ce-b19d-037395704ed9","resolution":{"observed_at":"2026-08-14T14:10:17.047972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.028098Z","title":"Stacked attention networks for image question answering","venue":null,"work_id":"388d333a-75e0-4efc-a6f6-7d7fb4758fe2","year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.731155Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:2c10ff23b7a4ca1063363c47a6856b7f225b9ad61c6f33fa9a19ff4261ecf9c1","observation_id":"00a67c6a-a086-41c4-ad6c-cbc161570100","resolution":{"observed_at":"2026-08-14T14:10:17.034059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.09681","last_updated":"2019-08-21T16:42:04Z","snapshot_observed_at":"2026-08-14T17:39:11.364896Z","submitted_at":"2018-12-23T09:59:49Z","title":"Scene Graph Reasoning with Prior Visual Relationship for Visual Question Answering","version":2},"cited_work":{"arxiv_id":"1812.09681","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.09681","snapshot_observed_at":"2026-08-14T14:10:16.807659Z","title":"Scene Graph Reasoning with Prior Visual Relationship for Visual Question Answering","venue":"cs.MM","work_id":"efc1f1e4-8c8d-46ba-8b28-bd9096e9a719","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.735502Z"},"links":{"cited_paper":"/paper/1812.09681","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:9cfbd3020d2a05e48f668de478c9f2a4d702d72d36d99364e7c89a7d794169fb","observation_id":"e82286dc-ef8a-4aab-aedb-93690a8ffbb2","resolution":{"observed_at":"2026-08-14T14:10:16.814204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.014347Z","title":"Explor- ing visual relationship for image captioning","venue":null,"work_id":"fc97904e-f0f1-4518-8f93-54e30696dbd7","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.739200Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:aa0507d7f3ee9467298713b73c84964f14e9d763956881d98c77913d3ee180b8","observation_id":"7ec17cdb-760a-4643-b1c0-c87333ed883f","resolution":{"observed_at":"2026-08-14T14:10:17.018843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:17.001416Z","title":"Beyond bilinear: generalized multimodal factorized high-order pooling for visual question answering","venue":null,"work_id":"360f7970-7981-4a7d-8f47-7442213f66bf","year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.743986Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:426aebe20916e6778c30938391ae495fe676ea122400fdc4d3c26e9ad9bc48fa","observation_id":"feb6f77b-7d61-4ecb-b53b-76d295491612","resolution":{"observed_at":"2026-08-14T14:10:17.006135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.986268Z","title":"Yin and Yang: Balancing and an- swering binary visual questions","venue":null,"work_id":"e6eac338-d5d8-4551-8d0b-268eb4d867db","year":2016},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.747846Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:11c720a8c65f869e8f5709743411cfa763dac4375dd45e6bfd83aa2b40765ea6","observation_id":"de7e3c54-6ffb-4a8d-a514-38cbd2ab6e8f","resolution":{"observed_at":"2026-08-14T14:10:16.991110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05766","last_updated":"2018-02-15T21:16:59Z","snapshot_observed_at":"2026-08-15T06:59:08.861429Z","submitted_at":"2018-02-15T21:16:59Z","title":"Learning to Count Objects in Natural Images for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05766","snapshot_observed_at":"2026-08-14T14:10:16.755399Z","title":"Learning to count objects in natural images for visual ques- tion answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.755399Z"},"links":{"cited_paper":"/paper/1802.05766","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:425bdc37aed81b255d45939fa3d7ed0233b50d7495d56366e4a9b6ae840ad50c","observation_id":"f4fcaa43-606e-477c-a945-f8fe8977609d","resolution":{"observed_at":"2026-08-14T14:10:16.755399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T14:10:16.970949Z","title":"Structured attentions for visual question answering","venue":null,"work_id":"05ae52fd-2cf3-4ed5-b912-550300514ba5","year":2017},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.760619Z"},"links":{"citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:9effb4f27eb038a48204f814ff4475ccbcb5e4e4bbfbcb1d4367248d152b0e10","observation_id":"57c5b259-ddc5-4643-99f5-a6f8b52f7753","resolution":{"observed_at":"2026-08-14T14:10:16.976330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06794","last_updated":"2019-08-16T22:04:53Z","snapshot_observed_at":"2026-08-14T16:05:35.658050Z","submitted_at":"2019-07-16T00:09:09Z","title":"2nd Place Solution to the GQA Challenge 2019","version":2},"cited_work":{"arxiv_id":"1907.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.06794","snapshot_observed_at":"2026-08-14T14:10:16.935052Z","title":"2nd Place Solution to the GQA Challenge 2019","venue":"cs.CV","work_id":"444a10b0-c0ee-4374-a6b5-338b479a56f5","year":2019},"citing_paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-14T14:10:16.565726Z"},"links":{"cited_paper":"/paper/1907.06794","citing_paper":"/paper/1908.04289"},"observation_digest":"sha256:cc627052d7ff6ff0380e58d7a8232b4480bb01f1acd9786683c0fcfbe800b3cb","observation_id":"abf6c8a0-e384-41c4-a8c4-1eeea82551cd","resolution":{"observed_at":"2026-08-14T14:10:16.939521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.04289","last_updated":"2019-08-10T05:57:01Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T19:26:27.690757Z","submitted_at":"2019-08-10T05:57:01Z","title":"Multi-modality Latent Interaction Network for Visual Question Answering"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":3,"verified_fuzzy":35},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 1 inbound Pith citation observation for arXiv:1908.04289."}