{"as_of":"2026-08-15T09:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8f2ed87496297e604cce6bb37d506f9acf396a967375de3309729bab7eaaaaf","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T13:32:25.742010Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.04950/citation-record","integrity":"/paper/1908.04950/integrity","json":"/paper/1908.04950/citation-record.json","paper":"/paper/1908.04950"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1811.05013","last_updated":"2018-11-12T21:45:41Z","snapshot_observed_at":"2026-08-14T18:00:20.615847Z","submitted_at":"2018-11-12T21:45:41Z","title":"Blindfold Baselines for Embodied QA","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.05013","snapshot_observed_at":"2026-08-14T13:32:25.392507Z","title":"Blindfold Baselines for Embodied QA","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.392507Z"},"links":{"cited_paper":"/paper/1811.05013","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:97517f8ea5fef97602c49dcdf7f2da16a31e1b99e916cecf45e81980085d20ed","observation_id":"bb66dcb0-3718-4272-97f1-4862dde0b7a5","resolution":{"observed_at":"2026-08-14T13:32:25.392507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:27.153183Z","title":"VQA: Visual question answering","venue":null,"work_id":"917c57f3-17aa-41f3-9272-be1c4283dc2a","year":2015},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.403046Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:80deb7940d48e8387598df08091d45553cb4154c5a932e14c1058166b764ef10","observation_id":"3ceb717c-cb95-4285-9818-7c304bbd45d0","resolution":{"observed_at":"2026-08-14T13:32:27.161905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.0473","last_updated":"2016-05-19T21:53:22Z","snapshot_observed_at":"2026-08-12T12:07:33.202888Z","submitted_at":"2014-09-01T16:33:02Z","title":"Neural Machine Translation by Jointly Learning to Align and Translate","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.0473","snapshot_observed_at":"2026-08-14T13:32:25.416278Z","title":"Neural machine translation by jointly learning to align and translate","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.416278Z"},"links":{"cited_paper":"/paper/1409.0473","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:57f969371e86269381032abefc90a7a11b6dd8e73d8989602231c545f8214a68","observation_id":"bb7cb70d-7249-41d5-b63f-432c24679e83","resolution":{"observed_at":"2026-08-14T13:32:25.416278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.12889","last_updated":"2019-04-21T15:37:46Z","snapshot_observed_at":"2026-08-14T17:50:28.497400Z","submitted_at":"2018-11-30T17:01:28Z","title":"Systematic Generalization: What Is Required and Can It Be Learned?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.12889","snapshot_observed_at":"2026-08-14T13:32:25.423479Z","title":"Systematic Generalization: What Is Required and Can It Be Learned? arXiv preprint arXiv:1811.12889, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.423479Z"},"links":{"cited_paper":"/paper/1811.12889","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:24bbeab0bb9ee63e267575ba15a756f55028286c0ec5e6b587e23f67b457b3f8","observation_id":"f698ce84-25f4-4e73-a082-099eaa098921","resolution":{"observed_at":"2026-08-14T13:32:25.423479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:27.124303Z","title":"MUREL: Multimodal Relational Reasoning for Visual Question Answering","venue":null,"work_id":"5ffebdb8-f21c-4f19-b110-dbde8a7f0798","year":2019},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.432553Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:0ddbd678abcebf8f011cf2c0582ff32943d548f8b4c03f5e3713b762beae9cd8","observation_id":"d9435600-09ec-4fb2-b0af-0f1bf2f7a7e5","resolution":{"observed_at":"2026-08-14T13:32:27.133297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-07-06T03:45:28.546418Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-14T13:32:25.441540Z","title":"Learning phrase representations using RNN encoder-decoder for statistical machine translation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.441540Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:d56ff90105f761bd40c6aa81f533111ccd80d7ab7ee838ccba53fcf9fc2f089a","observation_id":"21037c04-3690-42e4-9a09-ab511b70b655","resolution":{"observed_at":"2026-08-14T13:32:25.441540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:27.098618Z","title":"Embodied Question Answering","venue":null,"work_id":"1f44a38b-6fb6-45cf-92ff-652a96f8bb2d","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.449561Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:15866d34e5694b8ef3d7a1d73e0768592ef2c2f9e1ade5dbdcefc8a26a3062ba","observation_id":"d902790f-c848-4070-b491-26252b6a3801","resolution":{"observed_at":"2026-08-14T13:32:27.106821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.11181","last_updated":"2019-05-02T23:41:47Z","snapshot_observed_at":"2026-08-14T18:09:04.794752Z","submitted_at":"2018-10-26T03:58:26Z","title":"Neural Modular Control for Embodied Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.11181","snapshot_observed_at":"2026-08-14T13:32:25.457445Z","title":"Neural Modular Control for Embodied Question Answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.457445Z"},"links":{"cited_paper":"/paper/1810.11181","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:9d45b80959842812c72feb963b2c27d4aeb39363be04536b101a63cb13da7d3f","observation_id":"0611e946-1323-42c6-b858-d789e6676321","resolution":{"observed_at":"2026-08-14T13:32:25.457445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01847","last_updated":"2016-09-24T01:58:59Z","snapshot_observed_at":"2026-08-14T21:53:59.472078Z","submitted_at":"2016-06-06T17:59:56Z","title":"Multimodal Compact Bilinear Pooling for Visual Question Answering and Visual Grounding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01847","snapshot_observed_at":"2026-08-14T13:32:25.464101Z","title":"Multimodal compact bilinear pooling for visual question answering and visual grounding","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.464101Z"},"links":{"cited_paper":"/paper/1606.01847","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:73e1ca996697c489051a1a79aeb6220a3a93be1604262d0113914c684516b8a8","observation_id":"e7281b40-acab-49ad-ad69-0787fb0744d3","resolution":{"observed_at":"2026-08-14T13:32:25.464101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:27.076495Z","title":"Deep sparse rectiﬁer neural net- works","venue":null,"work_id":"663eee7f-fbf8-4a3d-98b7-70733a96920e","year":2011},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.469712Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:c99fdec0a1ad575827ea82139d87fe1a66c5c762e66de0ab8552bdd60c924e37","observation_id":"c4b69e52-cbce-46cf-99b2-be8ad2726443","resolution":{"observed_at":"2026-08-14T13:32:27.084683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:27.046520Z","title":"IQA: Visual question answering in interactive environments","venue":null,"work_id":"8c276db6-4d92-4f17-a9d2-a99febd0d226","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.475855Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:17d23ed26c1289417ccf18615cafa9db1df82bbf838e2e679f1d6623cb8300e0","observation_id":"25ae027a-3402-45cb-bb46-353cc3a5dae2","resolution":{"observed_at":"2026-08-14T13:32:27.054516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:25.481520Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.481520Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:24971fc286be9b10f1efcc2cb103714dba002ef8f7fad30ce1a41d1304837984","observation_id":"580fc635-eca8-4468-a0ab-dde7ab6ca1f2","resolution":{"observed_at":"2026-08-14T13:32:25.481520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:27.000594Z","title":"Learning to reason: End-to-end module networks for visual question answering","venue":null,"work_id":"859209c2-9661-410b-8833-c4693eb9f1e2","year":2017},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.489048Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:e177f94e92debd4a23248f42aa6665d6a230a5f21ee8e14f56c33af43bdf01fc","observation_id":"4c4f30e5-db58-4caf-9271-0de752a17aba","resolution":{"observed_at":"2026-08-14T13:32:27.007765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.03067","last_updated":"2018-04-24T10:25:07Z","snapshot_observed_at":"2026-08-14T19:38:12.966052Z","submitted_at":"2018-03-08T12:37:14Z","title":"Compositional Attention Networks for Machine Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.03067","snapshot_observed_at":"2026-08-14T13:32:25.498398Z","title":"Compositional Attention Networks for Machine Reasoning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.498398Z"},"links":{"cited_paper":"/paper/1803.03067","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:249ca3a9670ce8e85c856086db72524419cfdba2a588919b238d3942b16cf37c","observation_id":"8668e006-e0f2-42ff-a27d-75aa378c41fd","resolution":{"observed_at":"2026-08-14T13:32:25.498398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.09506","last_updated":"2019-05-10T22:24:55Z","snapshot_observed_at":"2026-08-14T17:11:31.853801Z","submitted_at":"2019-02-25T18:37:49Z","title":"GQA: A New Dataset for Real-World Visual Reasoning and Compositional Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.09506","snapshot_observed_at":"2026-08-14T13:32:25.507069Z","title":"GQA: a new dataset for compositional question answering over real-world images","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.507069Z"},"links":{"cited_paper":"/paper/1902.09506","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:2ec780ee031bb90db8cdd52451f806fdb4940d7b556a7e22cdae066845c8e64c","observation_id":"5d8ca0f3-662c-475c-9429-cf4b9f0a345d","resolution":{"observed_at":"2026-08-14T13:32:25.507069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.03167","last_updated":"2015-03-02T20:44:12Z","snapshot_observed_at":"2026-08-12T21:01:12.961874Z","submitted_at":"2015-02-11T01:44:18Z","title":"Batch Normalization: Accelerating Deep Network Training by Reducing Internal Covariate Shift","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.03167","snapshot_observed_at":"2026-08-14T13:32:25.514240Z","title":"Batch normalization: Accelerating deep network training by reducing internal covariate shift","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.514240Z"},"links":{"cited_paper":"/paper/1502.03167","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:0392bb92719965d02928d43b863ac9f57250bfe46abb46f8c0ca11baec1c01c4","observation_id":"2f4ecd35-991c-4f79-838f-d2be5c8057e6","resolution":{"observed_at":"2026-08-14T13:32:25.514240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.973521Z","title":"CLEVR: A diagnostic dataset for compo- sitional language and elementary visual reasoning","venue":null,"work_id":"3e495881-31f0-4436-9cea-e6735b7053ba","year":2017},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.524485Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:836b93493ee4d8d1e0dfbb99fe70107f2ea0b2210d140c10689484f88a2ab0af","observation_id":"aac89881-1bbe-4c80-97d8-1b4d1b361ced","resolution":{"observed_at":"2026-08-14T13:32:26.983480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-14T18:51:16.666127Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-14T13:32:25.531651Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.531651Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:94bc0cbb14af29b630aba3da8c5c7ca1a407b1269e881b1704193e72a94dfd80","observation_id":"5667ffb2-fe37-4b0f-9b30-5dedac342b26","resolution":{"observed_at":"2026-08-14T13:32:25.531651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.946892Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","venue":null,"work_id":"4d56275c-ff3a-4de0-9e6c-8a0857ac3a2c","year":2017},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.544151Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:be4ce556214094aa51e0474bdc15d04e2e1bd15c0b1d97137e27e891acf1d49f","observation_id":"8c93cb0d-202b-46c5-a396-3ae3e9b56257","resolution":{"observed_at":"2026-08-14T13:32:26.957511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.917821Z","title":"TVQA: Localized, Composi- tional Video Question Answering","venue":null,"work_id":"93cfc486-d20b-42be-936e-0e9e0f4bae91","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.552668Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:24212814eac0421898b535cb312bf659a59b37af6f6a6495b1fdb384cab0ba66","observation_id":"a5d61e02-1473-4008-9229-22968a93c996","resolution":{"observed_at":"2026-08-14T13:32:26.924883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.882363Z","title":"Learning visual question answering by bootstrapping hard attention","venue":null,"work_id":"bec9c896-2757-406a-965b-098befdb8ec9","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.560966Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:785f19630c0d3c824d7d9588ab1427e4baaf6214c0588af4a4711d646a1de069","observation_id":"5923f293-cfe4-4b89-a1ea-0378f6ec0dc3","resolution":{"observed_at":"2026-08-14T13:32:26.890519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.10915","last_updated":"2019-03-28T11:58:29Z","snapshot_observed_at":"2026-08-14T17:23:35.259647Z","submitted_at":"2019-01-30T15:50:54Z","title":"Benchmarking Classic and Learned Navigation in Complex 3D Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.10915","snapshot_observed_at":"2026-08-14T13:32:25.568564Z","title":"Benchmarking Classic and Learned Navigation in Complex 3D Environments","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.568564Z"},"links":{"cited_paper":"/paper/1901.10915","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:0af0ace451e13e8adad444556fdab73a00babb04be5b7d3c3896b9a5f84a516d","observation_id":"4662b04d-38d0-4ce2-a46a-e98bae3fb0ee","resolution":{"observed_at":"2026-08-14T13:32:25.568564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.859093Z","title":"MarioQA: An- swering Questions by Watching Gameplay Videos","venue":null,"work_id":"14a7c65a-f1ae-4caa-8bf1-722aa631ed95","year":2017},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.583764Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:903ba37bbdca13b0d27fd83acda8a9205b30d4195a55e693453273270ff08542","observation_id":"dc25097c-b4e1-4eab-85ef-b28af294b1f3","resolution":{"observed_at":"2026-08-14T13:32:26.867007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.815402Z","title":"Out of the box: Reasoning with graph convolution nets for factual visual question answering","venue":null,"work_id":"7fed78a4-6379-4be3-84a8-21b512187864","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.596086Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:dfbd71652f2188b7c64be4eaad899c3dc7889c40ad88c9617614c2ed83de4cce","observation_id":"07c20715-2e7c-4fac-870e-9046ed3ed624","resolution":{"observed_at":"2026-08-14T13:32:26.825665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.07023","last_updated":"2018-12-17T19:41:37Z","snapshot_observed_at":"2026-08-14T17:42:16.494753Z","submitted_at":"2018-12-17T19:41:37Z","title":"From FiLM to Video: Multi-turn Question Answering with Multi-modal Context","version":1},"cited_work":{"arxiv_id":"1812.07023","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.07023","snapshot_observed_at":"2026-08-14T13:32:25.925052Z","title":"From FiLM to Video: Multi-turn Question Answering with Multi-modal Context","venue":"cs.CL","work_id":"77d457ef-6f2d-4cf2-acc3-b1dd60912a88","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.601770Z"},"links":{"cited_paper":"/paper/1812.07023","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:c4c446eddb24d49541ed12acc171f2860f1a41e87fef259b0627d02d8d67eee0","observation_id":"96e187f4-df2d-44e5-a2a6-c47974ab5ccb","resolution":{"observed_at":"2026-08-14T13:32:25.943888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.778419Z","title":"Learning conditioned graph structures for interpretable visual question answering","venue":null,"work_id":"3a5f972c-399b-441e-b9e5-3d0f0a93fbc1","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.609549Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:7dd277bb5824807cc278868dd0de520225f153cea90243ce153360c2c7e5a73c","observation_id":"7774f0a4-0872-4422-a644-259a5252035c","resolution":{"observed_at":"2026-08-14T13:32:26.789387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.749126Z","title":"FiLM: Visual reasoning with a general conditioning layer","venue":null,"work_id":"3107227f-8a4d-4dce-b231-ed432dd1e809","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.616696Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:c5751b6fdbbe6a8322edce40245c29563879b09aa4a5745d4465862b041dcb98","observation_id":"fd108471-39a0-4854-aa2d-fd978956a179","resolution":{"observed_at":"2026-08-14T13:32:26.759038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.720581Z","title":"Exploring models and data for im- age question answering","venue":null,"work_id":"9938d6f0-2db3-4e7e-a491-2dfca4b17253","year":2015},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.625152Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:2deb82f00205e8a5b9b590e8536514dbf28a699de2ed3fba8b2386a7c5d4e94b","observation_id":"9b2716db-af14-4eb8-b7d3-59523db26a58","resolution":{"observed_at":"2026-08-14T13:32:26.730829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.689281Z","title":"Faster R-CNN: Towards real- time object detection with region proposal networks","venue":null,"work_id":"a1006b5f-4f2f-434f-bad8-67ca328f428b","year":2015},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.632208Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:d07232fb0bf27a4e48246c331ced0cf939522919692fdf2c15dfde4815448729","observation_id":"4034e400-0c87-4e4e-ab0b-4fb1589ae54e","resolution":{"observed_at":"2026-08-14T13:32:26.698989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.01201","last_updated":"2019-11-25T01:39:04Z","snapshot_observed_at":"2026-08-14T16:53:14.494748Z","submitted_at":"2019-04-02T03:52:27Z","title":"Habitat: A Platform for Embodied AI Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.01201","snapshot_observed_at":"2026-08-14T13:32:25.640466Z","title":"Habitat: A Platform for Embodied AI Research","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.640466Z"},"links":{"cited_paper":"/paper/1904.01201","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:3c4fd271f8c73e23ce29171944b9a5c6842fdfed0151132c8be6fc581569f502","observation_id":"d79b820c-bf94-4b62-b008-a4ae3d148811","resolution":{"observed_at":"2026-08-14T13:32:25.640466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-14T13:32:25.650423Z","title":"Very deep convolutional networks for large- scale image recognition","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.650423Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:e96d49ff2551451aba1bc575750da0bb00c8d331fc2169349303405611eb4ec3","observation_id":"609d4e1c-5610-49f8-b2b0-dd44ac332433","resolution":{"observed_at":"2026-08-14T13:32:25.650423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.635516Z","title":"Semantic Scene Completion from a Single Depth Image","venue":null,"work_id":"b7d134e5-78a9-4d77-a4b3-94b019a224eb","year":2017},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.658370Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:123e928d6a3e4c3b62b2a15548d3731cb581dc324b5db4352b6912e746864c60","observation_id":"45dde7b6-6029-4324-8100-1548eac231b3","resolution":{"observed_at":"2026-08-14T13:32:26.651023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.598068Z","title":"Visual Reasoning with Multi-hop Feature Modulation","venue":null,"work_id":"cae39182-8eda-4240-be04-fe021cc43599","year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.672201Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:c0ed70e419add26a293615ba342fd4e6d0a7faaa7c1f63f63d4d617c7a74f816","observation_id":"9c4266da-d693-4479-aa03-dfee70061caf","resolution":{"observed_at":"2026-08-14T13:32:26.607478Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.567926Z","title":"MovieQA: Understanding Stories in Movies through Question- Answering","venue":null,"work_id":"38ddf791-cdbc-488e-8763-65d705b3981b","year":2016},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.681109Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:e23ab81de7fd7e505ba600463f5ff1c242dca097289cd24c4f7756cebebf3d8c","observation_id":"968ea279-622b-4d55-8611-1bfe24ce2d6c","resolution":{"observed_at":"2026-08-14T13:32:26.579054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.534745Z","title":"Graph-structured repre- sentations for visual question answering","venue":null,"work_id":"fb89d4ee-37dc-4617-b84b-a14802ebd160","year":2017},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.691890Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:3fddac32847f3c0b45aa0fe5a36e2adb958e174db51e45c6c8221a1d016e939a","observation_id":"77497a4e-c0b6-4329-af56-0812a0ce3c07","resolution":{"observed_at":"2026-08-14T13:32:26.546012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.505511Z","title":"Learning spatiotemporal features with 3D convolutional networks","venue":null,"work_id":"86aa95ab-96ee-44c0-99dd-d530f18d5f5a","year":2015},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.709462Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:bf595c4b4c10e04beb5b6f1c00ec6e9e629cbb62b4f6af36afd2c114cd13ab44","observation_id":"c9a2c48c-af4e-4097-ba01-88cb44e7b29d","resolution":{"observed_at":"2026-08-14T13:32:26.515729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.463857Z","title":"Embodied Question Answering in Photorealistic Environments with Point Cloud Perception","venue":null,"work_id":"36c2a56f-e7d4-4278-b049-3badf4e9a507","year":2019},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.716852Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:8061f186cbbe750d3f82df035980fdc8b2ece2ea8f4560d0b8214e490f24bf8f","observation_id":"e0f33697-411a-4f17-815f-210133603017","resolution":{"observed_at":"2026-08-14T13:32:26.483075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1801.02209","last_updated":"2018-04-08T22:09:00Z","snapshot_observed_at":"2026-08-14T19:57:19.628944Z","submitted_at":"2018-01-07T16:34:41Z","title":"Building Generalizable Agents with a Realistic and Rich 3D Environment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.02209","snapshot_observed_at":"2026-08-14T13:32:25.726025Z","title":"Building generalizable agents with a realistic and rich 3D environment","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.726025Z"},"links":{"cited_paper":"/paper/1801.02209","citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:7868fb6298d3ba0c9592e94cae74afdb16bdef5de2598acf51f94ec0f2c76919","observation_id":"ee8e3cb8-e2a5-4a54-9dec-db60094833bc","resolution":{"observed_at":"2026-08-14T13:32:25.726025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:25.733408Z","title":"Stacked attention networks for image question answering","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.733408Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:c38e520c175ed3efb582fd6356fca412882c58e11d82425ef476649b6164b6d0","observation_id":"b8195918-9c8b-482b-a52c-36c9ccd4362f","resolution":{"observed_at":"2026-08-14T13:32:25.733408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T13:32:26.415792Z","title":"Berg, and Dhruv Batra","venue":null,"work_id":"c296bd1c-4c18-4c9c-a433-546508681124","year":2019},"citing_paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T13:32:25.742010Z"},"links":{"citing_paper":"/paper/1908.04950"},"observation_digest":"sha256:a08e0c896cc5fd758ca6fcd1bc5074886e9285ca9e69c5d3373897bdc4e748e9","observation_id":"416e6c67-7bb7-461b-8dc7-a15cb969a60d","resolution":{"observed_at":"2026-08-14T13:32:26.425804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.04950","last_updated":"2019-08-14T04:44:26Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T01:27:44.287634Z","submitted_at":"2019-08-14T04:44:26Z","title":"VideoNavQA: Bridging the Gap between Visual and Embodied Question Answering"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":16,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:1908.04950."}