{"as_of":"2026-08-16T00:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:79d2f5422b2d0cda58e05876a965b0729440fbfb77b82974f7b1559c73b68890","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:55:26.757084Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T12:22:25.662003Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:39:30.840356Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04107","snapshot_observed_at":"2026-08-14T12:22:25.662003Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"1908.07490","last_updated":"2019-12-03T19:30:19Z","snapshot_observed_at":"2026-08-14T12:12:43.486524Z","submitted_at":"2019-08-20T17:05:18Z","title":"LXMERT: Learning Cross-Modality Encoder Representations from Transformers","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T12:22:25.662003Z"},"links":{"cited_paper":"/paper/1908.04107","citing_paper":"/paper/1908.07490"},"observation_digest":"sha256:666f1c9715bcab20922812614c40513c5a179c3e9aab48b8f6cc03f557376984","observation_id":"e801b09e-8839-475b-bff5-3d70b5134379","resolution":{"observed_at":"2026-08-14T12:22:25.662003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"cited_work":{"arxiv_id":"1908.04107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04107","snapshot_observed_at":"2026-07-04T03:39:30.840356Z","title":"Multimodal unified attention networks for vision-and-language interactions,","venue":null,"work_id":"0b33c9b5-1894-495e-9263-f41e1a304e47","year":1908},"citing_paper":{"arxiv_id":"2605.29302","last_updated":"2026-05-28T03:33:07Z","snapshot_observed_at":"2026-08-08T14:22:27.872290Z","submitted_at":"2026-05-28T03:33:07Z","title":"ViASNet: A Video Ad Saliency Network for Predicting Dynamic Saliency and Viewer Engagement","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T08:50:03.872247Z"},"links":{"cited_paper":"/paper/1908.04107","citing_paper":"/paper/2605.29302"},"observation_digest":"sha256:1eae737f3b769f4219c71e5f9ad5462be3cfcbd2aa9f43eb048c163eb97c2ad1","observation_id":"727d9b13-5265-4449-ad2c-613515bb85a3","resolution":{"observed_at":"2026-06-29T08:53:15.881026Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"cited_work":{"arxiv_id":"1908.04107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04107","snapshot_observed_at":"2026-07-04T03:39:30.840356Z","title":"Multimodal unified attention networks for vision-and-language interactions,","venue":null,"work_id":"0b33c9b5-1894-495e-9263-f41e1a304e47","year":1908},"citing_paper":{"arxiv_id":"2606.20037","last_updated":"2026-06-18T10:11:14Z","snapshot_observed_at":"2026-08-14T06:06:56.304235Z","submitted_at":"2026-06-18T10:11:14Z","title":"Alzheimer's Disease Diagnosis using a Multimodal Approach with 3D MRI and PET","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T17:44:50.842397Z"},"links":{"cited_paper":"/paper/1908.04107","citing_paper":"/paper/2606.20037"},"observation_digest":"sha256:bb4e0fe1f4d0995950f3b9ac8273656a78205b5cbdcea57576f3313360fa997b","observation_id":"419bf000-2dcf-42f0-a8e1-6427010faba4","resolution":{"observed_at":"2026-07-04T03:39:30.843132Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/1908.04107/citation-record","integrity":"/paper/1908.04107/integrity","json":"/paper/1908.04107/citation-record.json","paper":"/paper/1908.04107"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:28.003318Z","title":"Multimodal deep network embedding with integrated structure and attribute information,","venue":null,"work_id":"f9b797f0-9dfe-4168-bc74-4e9e92d14c70","year":2019},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.405870Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:4115e0676cee4d2ee0346db87e28c9f6740aac145608e80f267432cb43e431ff","observation_id":"e9783f87-858d-4eb4-812b-65d09ad8df0b","resolution":{"observed_at":"2026-08-14T13:55:28.008716Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.986490Z","title":"Discrim- inative coupled dictionary hashing for fast cross-media retrieval,","venue":null,"work_id":"dae60276-9665-46d9-8bc7-48f5056c0d1e","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.411450Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:f39b410a7ba4005fbbfb8b3d92801e3b029f7b1dfd49e041d76bcff074e7ee23","observation_id":"70e901c3-cc0d-40bc-a28c-5f92950e3cc7","resolution":{"observed_at":"2026-08-14T13:55:27.991927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.969393Z","title":"Shared predictive cross-modal deep quantization,","venue":null,"work_id":"f71de6ea-b524-4b73-8b31-d463da3eed9a","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.416382Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:55c6601098b068613a1144332ae63bc8328b5f7a6f4413177b56bdd2a3114ccc","observation_id":"f6859418-36ed-429d-b6ab-d99ffa1366d7","resolution":{"observed_at":"2026-08-14T13:55:27.974963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.952274Z","title":"Show, attend and tell: Neural image caption generation with visual attention","venue":null,"work_id":"226f4072-3ae6-483a-b7fe-caa310b38e94","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.422009Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:01314c7e2deb0fe174cf2a853e4763c45228c2cab4b9ea10535e0a903ef44e97","observation_id":"8b5b2dbe-a68f-456a-b955-3ba975161532","resolution":{"observed_at":"2026-08-14T13:55:27.957946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.935853Z","title":"From deterministic to generative: multi-modal stochastic rnns for video cap- tioning,","venue":null,"work_id":"84bca54c-fc43-4b00-814f-c373df0437d3","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.427042Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:a54d69b7a38fd90c1d74ed3c1b972d5eb07ffeb97c3c7c39a9a79d2cd376a70e","observation_id":"3c17dd8c-eeeb-4498-98a4-fcdeaf39fe57","resolution":{"observed_at":"2026-08-14T13:55:27.940902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.918728Z","title":"Vqa: Visual question answering,","venue":null,"work_id":"9f7be5ad-129a-446d-963a-db826f768356","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.432661Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:c00d2277a255f021645fbd8c22ace12b7ceece4cef45841c73923e83e105e61d","observation_id":"24dfb2cb-350e-48d1-8b1c-330066e7bc33","resolution":{"observed_at":"2026-08-14T13:55:27.923633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.902523Z","title":"Ground- ing of textual phrases in images by reconstruction,","venue":null,"work_id":"451f2c19-94d4-4f4a-9f7a-d7763f3da53a","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.439241Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:c15d5594141904c8164863926a7dfe594dde189313d328f2ef274bc3bea9feb9","observation_id":"a712be8a-2deb-440c-8c4c-31ffb95e8ab3","resolution":{"observed_at":"2026-08-14T13:55:27.907818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-14T13:55:26.444239Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.444239Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:3482f6c045976174926a4960bd2018197564ed11a7b63c39f9ad78f786d4f753","observation_id":"8391a958-710e-4be9-8f55-50c76d8493db","resolution":{"observed_at":"2026-08-14T13:55:26.444239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.886492Z","title":"Recurrent models of visual attention,","venue":null,"work_id":"204e170e-c3e6-4602-be6f-e196b0014c33","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.449809Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:a393b53bdbe2d8aa8d88f285c18a6355bf22d25d3d43a6a63f52b859d645deb2","observation_id":"d9c99a69-6c26-4d21-9df4-79d3556906e4","resolution":{"observed_at":"2026-08-14T13:55:27.891612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.870875Z","title":"Draw: A recurrent neural network for image generation,","venue":null,"work_id":"16e71964-cc13-49d9-ad62-41def4e7f046","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.454446Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:ed6fc5809791f65f9eeec4ff5dcc18532e4e2297b7ed838e1fcee11c3d0dc804","observation_id":"76a48858-2880-49ab-904d-fddcbfed84a8","resolution":{"observed_at":"2026-08-14T13:55:27.875785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.854412Z","title":"Attention to scale: Scale-aware semantic image segmentation,","venue":null,"work_id":"030a1516-e572-4852-bb40-29229214c2b1","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.459270Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:1f6e69fed6ad15a7c1c196efcf4e328910a8ebb078e30a60239a5dca050e2d3f","observation_id":"025187f2-3715-4aa0-b7cb-2d689b66bb17","resolution":{"observed_at":"2026-08-14T13:55:27.859785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.04025","last_updated":"2015-09-20T08:25:52Z","snapshot_observed_at":"2026-08-14T22:36:17.759859Z","submitted_at":"2015-08-17T13:43:19Z","title":"Effective Approaches to Attention-based Neural Machine Translation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.04025","snapshot_observed_at":"2026-08-14T13:55:26.465116Z","title":"Effective ap- proaches to attention-based neural machine translation,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.465116Z"},"links":{"cited_paper":"/paper/1508.04025","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:0301cce0b4982a99873c2ce087bb7f36286dc7523c7db0fe5a5a9929e317988e","observation_id":"cc9ad11a-415f-4503-a2dd-4b836808f174","resolution":{"observed_at":"2026-08-14T13:55:26.465116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.836196Z","title":"Deep biafﬁne attention for neural dependency parsing,","venue":null,"work_id":"3b5d11a1-7e26-4de9-abcf-12f0a0cef09f","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.470402Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:32757d1901f67e4d883c17a60d33ed3ed73a92e979f3f10236ccfe0b4866bed6","observation_id":"7b80ff55-9a49-41b6-9d8f-8b089392bd47","resolution":{"observed_at":"2026-08-14T13:55:27.842087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.00685","last_updated":"2015-09-03T19:55:45Z","snapshot_observed_at":"2026-08-14T22:34:07.154893Z","submitted_at":"2015-09-02T13:20:40Z","title":"A Neural Attention Model for Abstractive Sentence Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.00685","snapshot_observed_at":"2026-08-14T13:55:26.475737Z","title":"A neural attention model for abstractive sentence summarization,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.475737Z"},"links":{"cited_paper":"/paper/1509.00685","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:3f6ac1d302401931c07d9c700ace6293c9b0c5f6c7c59040f1b3f049145f67cf","observation_id":"83ed30e9-de93-4058-95d8-f2258e795eb8","resolution":{"observed_at":"2026-08-14T13:55:26.475737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.819049Z","title":"Stacked attention net- works for image question answering,","venue":null,"work_id":"5d7c61cd-aa6f-482d-a7c8-a6b495bcb320","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.481939Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:63ffe26f781c181bbff1332021d47f69f47948cd677a975dbc490749034f6e29","observation_id":"5ead648f-1b4b-4cdd-b058-1cc5db435c55","resolution":{"observed_at":"2026-08-14T13:55:27.824687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.801474Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding,","venue":null,"work_id":"98c83eaa-09f7-4e27-b91d-487c0752904d","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.487055Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:d74641db7513d4a91413d99e38e36c41838662cc1035e1ec604597347b9105c6","observation_id":"24d92376-f32e-44b1-9559-3cda4b74118f","resolution":{"observed_at":"2026-08-14T13:55:27.807046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.783864Z","title":"Hierarchical question-image co-attention for visual question answering,","venue":null,"work_id":"4fb826a5-8143-4690-959f-5a0eab2b8a6b","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.491852Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:b67ab146276368998c890fd03b8ea10a127c117d9061e612b110fada758144a0","observation_id":"93828af5-dd98-46b0-99cb-bde6d74cd5c6","resolution":{"observed_at":"2026-08-14T13:55:27.790038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.766205Z","title":"Multi-modal factorized bilinear pooling with co-attention learning for visual question answering,","venue":null,"work_id":"be26206b-fe0c-429c-af60-f6ee34cbd8ee","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.496532Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2384a916e0dd3f21fdeaff9e4add0334e607a82e9ca2530e869fd400aa506ef6","observation_id":"79de54b6-0d38-4847-8c0d-9db88de40266","resolution":{"observed_at":"2026-08-14T13:55:27.771611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.747895Z","title":"Bilinear attention networks,","venue":null,"work_id":"71437fce-4322-4835-9d77-9e44cb15f216","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.501649Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:abb5c29b6e388674173269f57dead8314f6a5fb70e6f63b789cca84ef88b2135","observation_id":"2217e021-5f31-4498-b185-6e8a8e8ec933","resolution":{"observed_at":"2026-08-14T13:55:27.754499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.725570Z","title":"Improved fusion of visual and language representations by dense symmetric co-attention for visual question an- swering,","venue":null,"work_id":"9c4cd080-cb35-4d73-bc65-cf4a6239867f","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.506742Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:0752e196a3a6c6a8841d6fb88fea216184379e842ab662c031bb69bd986f246e","observation_id":"b0fe8842-fcf6-4eea-ba58-794f04ddea9e","resolution":{"observed_at":"2026-08-14T13:55:27.731604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.705207Z","title":"Attention is all you need,","venue":null,"work_id":"268546fb-bb24-455c-ba81-9b34611da4e1","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.513064Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:9c7470fd9edf2732eb9d02c99b359c915d52e718a9af0f42312298b4356d43d2","observation_id":"8d40dc6e-7186-4ff5-bb03-b5adeb46d1d9","resolution":{"observed_at":"2026-08-14T13:55:27.710634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-14T13:55:26.518164Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.518164Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:bf8d79eebfa14fb3fcd6202833b231d96e7231604528ec1153ccefd844ea6a41","observation_id":"e4dea28e-54d3-44f4-9553-ddbda29ecfb3","resolution":{"observed_at":"2026-08-14T13:55:26.518164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.687301Z","title":"Non-local neural net- works,","venue":null,"work_id":"b73d8ae0-4a4b-42b7-89c2-6f4eded62f79","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.523097Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:741c3754ee008530f18df601a706f60d81c79f86ccd07f2c58aff47ea28b8eb7","observation_id":"c50333a2-4c3f-4f51-8dc1-1ac7acbcc3b1","resolution":{"observed_at":"2026-08-14T13:55:27.692996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.667826Z","title":"Relation networks for object detection,","venue":null,"work_id":"c49636f7-5cf6-45d2-b6cc-e3a653879a95","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.527825Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:7ed1d9a95b7dd1e0564438339085a1e443d7c277aa504fac0ac202578ee07d9d","observation_id":"4d6962c0-7f30-4f83-80b5-ac0d6d0eff6b","resolution":{"observed_at":"2026-08-14T13:55:27.674066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.650566Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answering,","venue":null,"work_id":"20e6193f-d400-42c4-b6a7-b3e544a19242","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.532554Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:790ca76b47bef1a6a7f1c17728eee606cc13c3f5254725afefdddf1d7e1a10e4","observation_id":"c4fdcde9-6287-4302-8336-8c7a46ddfa72","resolution":{"observed_at":"2026-08-14T13:55:27.655703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.632775Z","title":"Clevr: A diagnostic dataset for compositional language and elementary visual reasoning,","venue":null,"work_id":"dccd93a4-50ee-467b-99b2-94e17b22090b","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.538915Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2cabfe561e27ce8b303fc2c6125343d50f4c230b557b8e329ad7705cb1d0e5d8","observation_id":"51ff0f0b-5de1-4252-830d-3b16362c1344","resolution":{"observed_at":"2026-08-14T13:55:27.638537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:26.543907Z","title":"Referitgame: Referring to objects in photographs of natural scenes,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.543907Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2dce5ef93f5eae99e626470ec2e9e4b21636c5fbfa40c8423ed37dd0ea653eaa","observation_id":"6e577d9d-4dcb-4137-b9d6-1b817db4de5c","resolution":{"observed_at":"2026-08-14T13:55:26.543907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.604563Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":"40ba735e-e103-45ea-8afb-00a52e5821a1","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.549092Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:b8162f4d6c6d6e91856465822bfb3560c5fab4d49f6c91dc59a75106543bdc81","observation_id":"f30f20a7-9f63-40b1-b93a-9a8f24d590bd","resolution":{"observed_at":"2026-08-14T13:55:27.610143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02167","last_updated":"2015-12-15T05:17:49Z","snapshot_observed_at":"2026-08-14T22:19:39.710069Z","submitted_at":"2015-12-07T19:00:54Z","title":"Simple Baseline for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.02167","snapshot_observed_at":"2026-08-14T13:55:26.554516Z","title":"Simple base- line for visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.554516Z"},"links":{"cited_paper":"/paper/1512.02167","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:7e35f6709a7b31468bf53b4965b47e42af8efd4c0ddd4f14f5d02add72e33106","observation_id":"6f797fb1-9b33-429f-a636-b0831eafd354","resolution":{"observed_at":"2026-08-14T13:55:26.554516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.587187Z","title":"Hadamard Product for Low-rank Bilinear Pooling,","venue":null,"work_id":"83953ed9-a547-4cbd-b65e-d4e8a60d4da1","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.559720Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2c8ccbe95f7cc0d01ac3dbf5cf91518198cd82e5913f8b636510a35b58199381","observation_id":"3d147a9b-af1f-4fb7-82c0-5b22177aadf3","resolution":{"observed_at":"2026-08-14T13:55:27.592926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.566358Z","title":"Mutan: Multi- modal tucker fusion for visual question answering,","venue":null,"work_id":"01534947-59be-4b88-8e60-30f90061fd25","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.564802Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:9e43206988685a39034b512595fe2fe6d935137ce3eb5103570dcc2962d5292b","observation_id":"6d9aaaf4-c355-4c10-ab2c-6d3ebe5326e1","resolution":{"observed_at":"2026-08-14T13:55:27.573058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05960","last_updated":"2016-04-03T22:47:38Z","snapshot_observed_at":"2026-08-14T22:22:20.577801Z","submitted_at":"2015-11-18T20:59:50Z","title":"ABC-CNN: An Attention Based Convolutional Neural Network for Visual Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05960","snapshot_observed_at":"2026-08-14T13:55:26.570303Z","title":"Abc- cnn: An attention based convolutional neural network for visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.570303Z"},"links":{"cited_paper":"/paper/1511.05960","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:f024ce6faf3254c3048c721d1647d7fe6c6bbff069b09929d2d433cb2d210d56","observation_id":"6d91550f-15d5-4026-88b0-8a0b3148f76a","resolution":{"observed_at":"2026-08-14T13:55:26.570303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.01485","last_updated":"2016-04-06T05:16:10Z","snapshot_observed_at":"2026-08-14T22:02:54.812748Z","submitted_at":"2016-04-06T05:16:10Z","title":"A Focused Dynamic Attention Model for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.01485","snapshot_observed_at":"2026-08-14T13:55:26.575466Z","title":"A focused dynamic attention model for visual question answering,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.575466Z"},"links":{"cited_paper":"/paper/1604.01485","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:d111fa5e7a56c534f5f7e625ed6e3b103018097b71e929c69bf8b56bc38845a1","observation_id":"109b5f20-38ee-426c-8fee-c9af7d2abde6","resolution":{"observed_at":"2026-08-14T13:55:26.575466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.545934Z","title":"Where to look: Focus regions for visual question answering,","venue":null,"work_id":"4edfcc2c-ca54-432f-9fb9-10b2526ba1b7","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.580811Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:bb47a5338c01c18347444e9f587f1e55e317cf7473366c756c0f95b05be6c688","observation_id":"bb9f24d8-e8e2-4819-8e40-6397ae70a6fa","resolution":{"observed_at":"2026-08-14T13:55:27.553523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.525582Z","title":"Beyond bilinear: Generalized multi-modal factorized high-order pooling for visual question answer- ing,","venue":null,"work_id":"d2667cce-55b4-4b3c-a1eb-0d4bf206abb7","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.586427Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:ed24aadd1740209bea1d8b2ddbfccb5ebbfcf600254bd474024142eb98c85fd9","observation_id":"fb59863f-722b-4c6c-be73-b56a7b16b79a","resolution":{"observed_at":"2026-08-14T13:55:27.533495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.494304Z","title":"A joint speaker-listener- reinforcer model for referring expressions,","venue":null,"work_id":"1f52e9f5-11ce-4c63-a396-83bb386408ac","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.591097Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:17eea65aa89b599a839062ce4b7e36444f015df3f71ff70c8f4024845dbfde22","observation_id":"960371a1-dd9e-41eb-aca8-324d0c3487c9","resolution":{"observed_at":"2026-08-14T13:55:27.501146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.474384Z","title":"Edge boxes: Locating object proposals from edges,","venue":null,"work_id":"ffdec30d-d900-4823-b587-7b828d25cfa9","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.595646Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:666712854c42196cff9eba78390e4d51fd74d359433f841459c35480d1c97690","observation_id":"fd8e2279-07a3-4bb7-a782-0b2172e20416","resolution":{"observed_at":"2026-08-14T13:55:27.481300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.456782Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":"d9a239ff-1b28-400b-b835-8e59cce4d09c","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.600632Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:033ad0d8da8c2479161a1857d6c33bd57585561c11d6de98d066668c0b93724e","observation_id":"eaaee506-d5f9-455d-a353-4f846e9de4db","resolution":{"observed_at":"2026-08-14T13:55:27.462346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.438851Z","title":"Rethinking diversiﬁed and discriminative proposal generation for visual grounding,","venue":null,"work_id":"64267a88-f9c5-416c-affe-daf9df806626","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.606994Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:afa442c58bc22597e14c93731827c1c8f6528e508d326658029ea7f4f600c548","observation_id":"848abf49-fe14-48b4-8ed8-c3d6ab67e6a9","resolution":{"observed_at":"2026-08-14T13:55:27.444232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.420708Z","title":"Mattnet: Modular attention network for referring expression comprehension,","venue":null,"work_id":"1aa62531-bfe2-4090-ad76-ea4c2808489e","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.611863Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:cfdba826fca902ea47db9be178bc546940737ffb70d57988f0f6128267567e26","observation_id":"09816d98-c73d-422d-96a0-3633ac698948","resolution":{"observed_at":"2026-08-14T13:55:27.426916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.402466Z","title":"Parallel attention: A uniﬁed framework for visual object discovery through dialogs and queries,","venue":null,"work_id":"2e439e99-35c7-4a4a-a9a3-0df96297d28c","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.616740Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:12e140e868b18db9ea4b66ef20d7e4449ea28fe4a0b0c45559d80ded344b0a3b","observation_id":"23a1ab66-d516-47ae-a85e-05211370ff20","resolution":{"observed_at":"2026-08-14T13:55:27.407914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.385072Z","title":"Visual grounding via accumulated attention,","venue":null,"work_id":"c8dc0c09-f24d-41c0-b4de-e2165798ae5a","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.622160Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:66d3c929505a6e1f8840c0e5fc98d9031eb81ea1bfb3439c8af470d359b9840e","observation_id":"9aee77a4-0b7a-4c8d-8d49-bcb2a792117e","resolution":{"observed_at":"2026-08-14T13:55:27.390683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.368205Z","title":"Be- yond rnns: Positional self-attention with co-attention for video question answering,","venue":null,"work_id":"f0b8b5e8-a4c8-4b5b-af57-22e737130fff","year":2019},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.627435Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:093e1b639469232114a3d27ee2f805b0e245b7b9cb4b7d503b20c2f226fedd27","observation_id":"619e07f7-7290-4b83-a249-6b0e2840a833","resolution":{"observed_at":"2026-08-14T13:55:27.374092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05252","last_updated":"2019-08-23T19:25:25Z","snapshot_observed_at":"2026-08-15T20:19:06.192027Z","submitted_at":"2018-12-13T03:41:18Z","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","version":4},"cited_work":{"arxiv_id":"1812.05252","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.05252","snapshot_observed_at":"2026-08-14T13:55:26.895921Z","title":"Dynamic Fusion with Intra- and Inter- Modality Attention Flow for Visual Question Answering","venue":"cs.CV","work_id":"d9c3b697-eb0b-4cdc-a5b9-17e513e2e4ee","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.632542Z"},"links":{"cited_paper":"/paper/1812.05252","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:10b06f663c1ee567b551da59bab4ca969396939a475216ab1666e2677632d10a","observation_id":"b487a113-c177-42c6-920b-73ddb6fbff3b","resolution":{"observed_at":"2026-08-14T13:55:26.904087Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.352164Z","title":"Improving language understanding by generative pre-training,","venue":null,"work_id":"e4a32c40-b48c-451d-8b09-0fd9f1a9ef35","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.638333Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:49bf1ebfe95223f0e013e14118aaa5a25b5b4b45db90c2dd3f57aea534dec336","observation_id":"8e1ba17d-fc08-41e7-b6a5-609798755313","resolution":{"observed_at":"2026-08-14T13:55:27.357158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.335412Z","title":"Factorized bilinear models for image recognition,","venue":null,"work_id":"62cd8d11-bcab-4234-845a-8335fe048726","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.643030Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:a74b377b5005307ff449b5bf53513fba857f4a17466cdaff65674529af4b0cb5","observation_id":"56e1d26b-e8d1-4ce0-84c8-e33d878dfbfc","resolution":{"observed_at":"2026-08-14T13:55:27.340667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-14T13:55:26.647648Z","title":"Layer normalization,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.647648Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:b851d70bc155c52dbac425822af83f6887f582a2169f4b380be4ea6eceb20ed4","observation_id":"7c91eab1-0e15-4cd8-a276-5bb7285988bc","resolution":{"observed_at":"2026-08-14T13:55:26.647648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.316352Z","title":"Glove: Global vectors for word representation","venue":null,"work_id":"e9e05c1c-1d91-470b-a850-88a80a86f046","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.652624Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:b2fdec07dc5f6d2800fd94354225c47ef032b8d8b811ec11f51b4eba8b3c1a84","observation_id":"9c91039a-5194-42a8-a217-dc1fad636ef9","resolution":{"observed_at":"2026-08-14T13:55:27.322774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:26.657304Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.657304Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:f28f0aee388159952572e97ab58982b39f12c2d94f27ab752ec4ca72bb1d9397","observation_id":"ca5f6cfb-f77c-4d5d-aa6c-22c2b451f2d7","resolution":{"observed_at":"2026-08-14T13:55:26.657304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.284782Z","title":"Bottom-up and top-down attention for image captioning and visual question answering,","venue":null,"work_id":"ba8bea92-7294-478d-be0f-7d90cc5f26d5","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.662045Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:01b2f4c4ae02bc1bbaca62d3faf59c980c6cb07406da0b7e0267a78164f07b0b","observation_id":"e0c6bc30-b4b8-4e0b-a17d-62af13d28368","resolution":{"observed_at":"2026-08-14T13:55:27.290618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02711","last_updated":"2017-08-09T04:19:42Z","snapshot_observed_at":"2026-08-14T20:42:26.185801Z","submitted_at":"2017-08-09T04:19:42Z","title":"Tips and Tricks for Visual Question Answering: Learnings from the 2017 Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02711","snapshot_observed_at":"2026-08-14T13:55:26.666553Z","title":"Tips and tricks for visual question answering: Learnings from the 2017 challenge,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.666553Z"},"links":{"cited_paper":"/paper/1708.02711","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:55d195275f203b8649f95ec5dbddaa61d820691c89939fef73f651142ed74790","observation_id":"a01fe0f2-a863-4ebd-9edd-2c4db59909f0","resolution":{"observed_at":"2026-08-14T13:55:26.666553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.263466Z","title":"Fast r-cnn,","venue":null,"work_id":"22e9e64d-6a4a-4a9c-9164-4e72cfba1930","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.671520Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:dfb9217393cf10b63d6b6927b5e5c6fa64febd3f17fef76a7ca9e514aba2a75e","observation_id":"9f73072f-c372-4c77-9609-1f8bc3152ae5","resolution":{"observed_at":"2026-08-14T13:55:27.271577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.245495Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":"6c9e6e5e-9e72-4428-aa73-6d71fae329cb","year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.676051Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:48a33978f8db1c219bf79e829c6c686762690f8651974660324ebaa4b63da590","observation_id":"59e2ed05-d7a5-4aba-9e46-0538c12b7244","resolution":{"observed_at":"2026-08-14T13:55:27.251132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T13:55:26.680958Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.680958Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:656b5ed69cef40feb01736ff6c03ff64f336d54f8f6edb8bedcd75a0e0347fd8","observation_id":"5617209c-ca98-4c12-938a-ea8847087550","resolution":{"observed_at":"2026-08-14T13:55:26.680958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.226843Z","title":"Faster r-cnn: Towards real- time object detection with region proposal networks,","venue":null,"work_id":"21872ba7-70f8-4dc2-b204-0b84de7c1079","year":2015},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.685644Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:e315f127faebe03a2abdd8dde1291820652ef8b6bd1fbfab356d6df93ca54000","observation_id":"ccee27c2-86b0-4da9-b579-2767d2a9f8b1","resolution":{"observed_at":"2026-08-14T13:55:27.233090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.07332","last_updated":"2016-02-23T22:00:40Z","snapshot_observed_at":"2026-08-14T22:09:05.495219Z","submitted_at":"2016-02-23T22:00:40Z","title":"Visual Genome: Connecting Language and Vision Using Crowdsourced Dense Image Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.07332","snapshot_observed_at":"2026-08-14T13:55:26.690283Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.690283Z"},"links":{"cited_paper":"/paper/1602.07332","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:d91d91656fae79c396fc0e3cf104de991992bda612a6ff8de26d95a1a6658af7","observation_id":"75b9dd9d-9b4e-436b-a1c0-6d5dae966155","resolution":{"observed_at":"2026-08-14T13:55:26.690283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03067","last_updated":"2018-04-24T10:25:07Z","snapshot_observed_at":"2026-08-14T19:38:12.966052Z","submitted_at":"2018-03-08T12:37:14Z","title":"Compositional Attention Networks for Machine Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03067","snapshot_observed_at":"2026-08-14T13:55:26.694870Z","title":"Compositional attention networks for machine reasoning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.694870Z"},"links":{"cited_paper":"/paper/1803.03067","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:3a36caf1aa6986b83497943312a1312fa73fbcc38d1e4f2acb36017a3166276e","observation_id":"a5d1f2f3-65f2-427c-a4ef-e1246434acb0","resolution":{"observed_at":"2026-08-14T13:55:26.694870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.209088Z","title":"Mask r-cnn,","venue":null,"work_id":"d40b57cd-7205-43b7-9c2d-5fe82d6d9b0d","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.699662Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:e311026c2ad0ff3cca034b70942a7c402c7621860c0bf91223c7936910c1006f","observation_id":"4b37c205-f5f0-4f0b-87de-189dacaa1a74","resolution":{"observed_at":"2026-08-14T13:55:27.214156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.192550Z","title":"Modeling context in referring expressions,","venue":null,"work_id":"e010b573-ee4e-4d6c-839a-32a3ac0ee2ce","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.704689Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:8186b8d92fa2f4cbc8d11208a9d4af996409824e9618acceffaa5848d6460597","observation_id":"dc40e05e-a0b8-42f8-8ecb-56e048881c88","resolution":{"observed_at":"2026-08-14T13:55:27.197496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.176890Z","title":"Learning to count objects in natural images for visual question answering,","venue":null,"work_id":"b17af37d-6e69-4c0b-b716-342ec2df19ef","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.709730Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:01302763898d6d1c7ae06c0f95278b85d1a30ca5fae09081e6f579ec2f1240e2","observation_id":"1cfe4aa3-3e50-4d06-89ae-46bce9abedf8","resolution":{"observed_at":"2026-08-14T13:55:27.182018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.161021Z","title":"Deep modular co- attention networks for visual question answering,","venue":null,"work_id":"583bc6d2-2734-426e-bbe2-e504a67792e8","year":2019},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.714365Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2f8518772e168ad7f374be82891959cd804108cbf841091e63535873d65e525a","observation_id":"5513a91a-6151-457e-b88c-d5b26a4e0e03","resolution":{"observed_at":"2026-08-14T13:55:27.166305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.142769Z","title":"Learning to reason: End-to-end module networks for visual question answering,","venue":null,"work_id":"193b2e18-2c3e-4760-befa-040b800b33e8","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.719073Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:59d07d525961f7f9600e4b508e36e73854bec1a8783a4b231baa4679ac6bb79c","observation_id":"f5eae359-dab9-4bab-b5de-cd6fe415a587","resolution":{"observed_at":"2026-08-14T13:55:27.148630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:26.723698Z","title":"A simple neural network module for relational reasoning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.723698Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:42b39bc9afd3c3a0b2e36ee2b5e8de55068a8b266e4a8632ea979d662ce9e031","observation_id":"a20f6b27-33c3-4b36-a99a-bdcd5ada6b5e","resolution":{"observed_at":"2026-08-14T13:55:26.723698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.114390Z","title":"Inferring and executing programs for visual reasoning,","venue":null,"work_id":"82696139-bc43-4773-9f25-d3852572b11c","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.728584Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:29591fb4b7de36704630bab67943473df299116da51861a9d9b32440dbd64509","observation_id":"263fe6b5-0431-4cd3-9e01-869ad04fabc7","resolution":{"observed_at":"2026-08-14T13:55:27.120140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.097433Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":"c5962a7f-952d-4aa6-8959-429f6d78221b","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.733087Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:0e0f2e57ec26791384d0d3bc685e86cc35f74e850b1302fb4d08a0a764f6fc9c","observation_id":"3982b222-2158-42f5-9eaa-2b9aa7fdce41","resolution":{"observed_at":"2026-08-14T13:55:27.102590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.081519Z","title":"Ssd: Single shot multibox detector,","venue":null,"work_id":"54e1ff77-be93-48e5-b8eb-edd516d0ae95","year":2016},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.737651Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:2d96972d7cb2f2817aaefc7dd4b11bc0ed801b079ed3800023d2e87bf15581b9","observation_id":"fe3807c5-9063-4fe5-b5ee-88a6eb62baa5","resolution":{"observed_at":"2026-08-14T13:55:27.086625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T13:55:26.742259Z","title":"Very deep convolutional networks for large-scale image recognition,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.742259Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:ebc5314dd3ee48d243a99f6c44ef3269e475d7d4286a6ef9f563828c0718c13a","observation_id":"cb4a4a63-7375-47e7-9e60-4868dba22dee","resolution":{"observed_at":"2026-08-14T13:55:26.742259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.063706Z","title":"Referring expression generation and comprehension via attributes,","venue":null,"work_id":"c8d0af14-8209-4e20-b0b1-2061080f643f","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.747240Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:9ad3e2b996f7c77d06d1853aad42890ee00d9838889dff6cbf7004f8d61d3497","observation_id":"113d83f9-c6f5-44b9-9627-4a54f7bf7bbf","resolution":{"observed_at":"2026-08-14T13:55:27.069979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.047493Z","title":"Modeling relationships in referential expressions with compositional modular networks,","venue":null,"work_id":"bf45a569-3598-455e-a689-a9d73f47262c","year":2017},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.752432Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:154ff037b8b3d7a14445adb1c8035858a40c5348dfc3697bd45c942d774d5e64","observation_id":"056540f1-7b59-45d8-bbe2-4ec13864cf9e","resolution":{"observed_at":"2026-08-14T13:55:27.052588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:55:27.030425Z","title":"Grounding referring expressions in images by variational context,","venue":null,"work_id":"5a720427-6ef6-486e-9b5e-8f6a5e098b7d","year":2018},"citing_paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-14T13:55:26.757084Z"},"links":{"citing_paper":"/paper/1908.04107"},"observation_digest":"sha256:608eca17f92c37027972399b1d6038ca8f193a275c99d3c6b8fe28ddadd7c842","observation_id":"ce81e276-226a-4c4f-9822-e6f343ce6cf9","resolution":{"observed_at":"2026-08-14T13:55:27.036101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.04107","last_updated":"2019-08-19T06:14:06Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T13:49:02.909764Z","submitted_at":"2019-08-12T12:12:17Z","title":"Multimodal Unified Attention Networks for Vision-and-Language Interactions"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":53},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 3 inbound Pith citation observations for arXiv:1908.04107."}