{"as_of":"2026-08-18T15:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0351f4bf4c85934bd516a0dab07ed3bd43813eb08d6074150193419674ec929a","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T11:41:08.841867Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/1908.08522/citation-record","integrity":"/paper/1908.08522/integrity","json":"/paper/1908.08522/citation-record.json","paper":"/paper/1908.08522"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.571305Z","title":"Stochastic variational video prediction","venue":null,"work_id":"18fa34bd-be3a-4f8e-89f9-8f5461e7a387","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.634515Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:d495beccb8b2d72f5cf6c1df38f4fb73a9e7404610adb937794925769e292d3e","observation_id":"3d30a6e4-18bc-412f-bab8-bb3359f4fc34","resolution":{"observed_at":"2026-08-14T11:41:09.576461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.555000Z","title":"Interaction networks for learning about objects, relations and physics","venue":null,"work_id":"3a11e6af-3ed7-4b33-bd9e-04b6cfba42c6","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.639575Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:bb5bfce704756eefc4b40959ebb5ab20de3748ff0124d048c66d9900a9dec51c","observation_id":"f9d1dc5e-d080-46c1-8525-83ad428be626","resolution":{"observed_at":"2026-08-14T11:41:09.560187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.01261","last_updated":"2018-10-17T17:51:36Z","snapshot_observed_at":"2026-08-17T23:08:02.689731Z","submitted_at":"2018-06-04T17:58:18Z","title":"Relational inductive biases, deep learning, and graph networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.01261","snapshot_observed_at":"2026-08-14T11:41:08.644346Z","title":"Relational inductive biases, deep learn- ing, and graph networks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.644346Z"},"links":{"cited_paper":"/paper/1806.01261","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:b99c787b563d6b2fbcfe7e9fe29808e885eb2216fe1dde246da257aa0f0cc4dc","observation_id":"bcd2b8db-aa73-44f6-a8c9-11063f67c2bd","resolution":{"observed_at":"2026-08-14T11:41:08.644346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.538416Z","title":"A compositional object-based ap- proach to learning physical dynamics","venue":null,"work_id":"65290569-2dce-4f8a-a612-ad7dbfabeffa","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.650025Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a20056aacc5d8b8cbe5be85e3348c6701c844a31c3c07a0164f77a53f6226b09","observation_id":"234dd628-090b-48ab-9401-6ac559646e67","resolution":{"observed_at":"2026-08-14T11:41:09.543937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.522372Z","title":"Video imagination from a single image with transformation gener- ation","venue":null,"work_id":"fc570fcb-30d0-41ac-b1b4-dd3c2e6ecf12","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.654905Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:84de386f7982708d5e4c7fe6f53e034b59c01b8895fbfe8703075256fc50d9d2","observation_id":"85827209-7c76-4c93-9f3a-db5ea8ad0f96","resolution":{"observed_at":"2026-08-14T11:41:09.527550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.505828Z","title":"Stochastic video generation with a learned prior","venue":null,"work_id":"702906cd-e033-41e1-8df8-d60899b6a067","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.659791Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:b80aba9cfee1c5a4b0d0bbf5202536bad7c76e1fdb4f5a0e73b580d4678ef182","observation_id":"077ac245-58c2-4875-8406-e5fcd9d031fc","resolution":{"observed_at":"2026-08-14T11:41:09.510547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.489827Z","title":"Unsupervised learning of disentangled representations from video","venue":null,"work_id":"6832136c-7ef4-4889-b555-6a343a6720ad","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.664798Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:b307c23b01cda7729208263cbd4c8b46ba48da9741cc6e0819ff2ca391fed02f","observation_id":"0f875912-5543-48c3-9f40-0492773cfae3","resolution":{"observed_at":"2026-08-14T11:41:09.494760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.473968Z","title":"RMPE: Regional multi-person pose estimation","venue":null,"work_id":"ad04d552-e45a-40c0-9b80-f4acb0dd85b9","year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.669860Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:5a167a55d86ee04dcd8d9a77aac9b21f0add61d015534b13cd005b9fd345ea30","observation_id":"22df3983-089f-430d-8911-af0805b1a915","resolution":{"observed_at":"2026-08-14T11:41:09.479235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.458729Z","title":"Unsuper- vised learning for physical interaction through video predic- tion","venue":null,"work_id":"abd1fbe4-d428-43db-8c82-603cbc7f1198","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.674302Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:57efa079755c2a28bfdeaed3e83054c08cea9d11a6d2979aebe6ae45568869ad","observation_id":"b65381be-5e1e-46cf-9039-7f3455984de2","resolution":{"observed_at":"2026-08-14T11:41:09.463687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.442098Z","title":"Learning visual predictive models of physics for playing billiards","venue":null,"work_id":"ac70a8bb-4496-4b5c-bec9-2766f1e08558","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.679069Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:ed9f98d0c8e73eb39f873e8483b67626ee95229269aca3bdf41edfb389f976ca","observation_id":"e58683e6-acb0-4571-b04c-e841462215fd","resolution":{"observed_at":"2026-08-14T11:41:09.447847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.02082","last_updated":"2017-05-05T04:19:40Z","snapshot_observed_at":"2026-08-14T21:02:40.105667Z","submitted_at":"2017-05-05T04:19:40Z","title":"Motion Prediction Under Multimodality with Conditional Stochastic Networks","version":1},"cited_work":{"arxiv_id":"1705.02082","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.02082","snapshot_observed_at":"2026-08-14T11:41:08.922537Z","title":"Motion Prediction Under Multimodality with Conditional Stochastic Networks","venue":"cs.CV","work_id":"2c7e7cab-7114-4da6-a3ed-c53502da40c6","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.683694Z"},"links":{"cited_paper":"/paper/1705.02082","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:2b8845cf78efeef0286bad039a67565f52c2d90bda7939bb81d9e829f814aef8","observation_id":"a703787a-e12c-4704-a3a6-5834004fe025","resolution":{"observed_at":"2026-08-14T11:41:08.927880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.689100Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.689100Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:4047f93c8bd69cc13168b61b7759612834e4b81a6885e4ff745b623e8d175fc6","observation_id":"74a09ed0-3509-4981-963c-2a02a0b7d913","resolution":{"observed_at":"2026-08-14T11:41:08.689100Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.417063Z","title":"Shapestacks: Learning vision-based physical in- tuition for generalised object stacking","venue":null,"work_id":"b733d3bf-e2ec-4725-aea3-0beb2caefc63","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.693908Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:2c647c08f6ded144c4c2dab719e1ad097ca536b1dcb275a6c613d6d9d5bd7dcd","observation_id":"310dd530-e1d9-4a6a-a41f-0272c7f88e0d","resolution":{"observed_at":"2026-08-14T11:41:09.422057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.698483Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.698483Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:0d577bf742434eb45a7749726381e83d81f62428e4a836026030efcb5edd622b","observation_id":"74966240-e9fe-4c3b-ab90-5fe762d30e66","resolution":{"observed_at":"2026-08-14T11:41:08.698483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.391665Z","title":"Learning to decompose and disentangle representations for video prediction","venue":null,"work_id":"2d1eb9ea-9fc5-427d-bb38-56f6e9ce6ad3","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.703392Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a8dea8010d7f24a68fe8cffd416fe8ba5701c5f35ebf9b5a3f785ca1fd6d4e11","observation_id":"f6830c78-1ae6-46ba-9642-53d8051fea2e","resolution":{"observed_at":"2026-08-14T11:41:09.396793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.376796Z","title":"Approximate maxent inverse optimal control and its application for mental simulation of human interactions","venue":null,"work_id":"4bf23bba-95be-423d-9e02-c3d083db9446","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.707917Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:0e2af3d663d39552542e01461f1cb6c41c7eb66153b8ab1707871391e0fe2404","observation_id":"adeec566-7bf2-4c73-b822-6a03f6767069","resolution":{"observed_at":"2026-08-14T11:41:09.381801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.361146Z","title":"Spatial transformer networks","venue":null,"work_id":"3e9f6f47-226a-40b1-ad83-735a21899550","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.712444Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:e894bab36bf55efe74bb103e25ecad5f248353f228570bfbceec617aa90a86ca","observation_id":"1beadcb7-598e-48e1-8dc6-d930ffb5a179","resolution":{"observed_at":"2026-08-14T11:41:09.365929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.345488Z","title":"Dynamic ﬁlter networks","venue":null,"work_id":"d0a14ac5-9c43-45a6-aeb5-06e7dfa65b30","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.716730Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:1ac5ac401b55a0371a2545fa2efbf279f1ea6f02866f613e7c7e373ef73ab79d","observation_id":"758b5521-dacc-4802-a0c5-7567287a095c","resolution":{"observed_at":"2026-08-14T11:41:09.350340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.329372Z","title":"3d reasoning from blocks to stability","venue":null,"work_id":"7e9631d4-2bff-47b5-a3d9-7b0de9f67eda","year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.721273Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:7167226c2d18d5c8ac9f550899b76fad63356f3c9484ead9a2fc89c5391e32bf","observation_id":"a033b557-33c6-4330-9d2e-50cc0f4d6235","resolution":{"observed_at":"2026-08-14T11:41:09.335303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.313190Z","title":"Auto-encoding varia- tional bayes","venue":null,"work_id":"8b073ffb-d2bc-48d0-9860-15eb9c1424a7","year":2014},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.727069Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:c8f355ae1a39eec466fa27ecb7b6c8516c5c806349611cb036a2171c073d6f73","observation_id":"cbbc6370-7f00-440d-ae10-7b84884e2ec1","resolution":{"observed_at":"2026-08-14T11:41:09.319062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.298192Z","title":"Neural relational inference for interacting systems","venue":null,"work_id":"8fe60e94-d8bd-4444-adfa-270b7ffe0eb1","year":2019},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.731522Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:b72b705e058ad890c1f2f752a0ce858488c80fcb2157c94c92e4b76e77367db7","observation_id":"f04a5fe2-7f37-4101-9fc8-36772c5e2b7a","resolution":{"observed_at":"2026-08-14T11:41:09.302937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.282841Z","title":"Activity forecasting","venue":null,"work_id":"876bead7-ba24-4256-99e1-7120aeb88d4b","year":2012},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.736040Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:1b3d3cf118f2a87f06e1ee5bd331d396e2d1adaddfd0cb2b58c8872bc358ff22","observation_id":"dc58c271-4f94-4ddd-b6d9-c3ed36211ee3","resolution":{"observed_at":"2026-08-14T11:41:09.287578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.267150Z","title":"Learning physical intuition of block towers by example","venue":null,"work_id":"0e8d11cb-cc69-4d90-b19c-1f2f8a550906","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.740289Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:bae302f5bd717e6ba67a0365344c202b2dce462454dfba5fd7fd98cd70ed52a2","observation_id":"e668ca30-43eb-41e5-8cb8-5f3794f31bbc","resolution":{"observed_at":"2026-08-14T11:41:09.272318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.00066","last_updated":"2016-03-31T21:53:32Z","snapshot_observed_at":"2026-08-14T22:03:34.145521Z","submitted_at":"2016-03-31T21:53:32Z","title":"To Fall Or Not To Fall: A Visual Approach to Physical Stability Prediction","version":1},"cited_work":{"arxiv_id":"1604.00066","doi":null,"metadata_source":"pith","pith_arxiv_id":"1604.00066","snapshot_observed_at":"2026-08-14T11:41:08.898354Z","title":"To Fall Or Not To Fall: A Visual Approach to Physical Stability Prediction","venue":"cs.CV","work_id":"ed638ef9-a1a2-46ea-bbad-2b66c1c290d7","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.744919Z"},"links":{"cited_paper":"/paper/1604.00066","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:79eb0acbbda95ffb8be7a1d43766b0fdad1edff2c8b4c2e3c64f2632bdb7eea5","observation_id":"0e66b05f-b071-42c0-bd02-acb35733d55c","resolution":{"observed_at":"2026-08-14T11:41:08.905542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.251916Z","title":"Visual stability prediction and its application to manipulation","venue":null,"work_id":"8f084f07-f192-4f37-9b36-2ea449f6ada2","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.750065Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:5f00c9dd236724424ba97739b32c820d3e5d45d47a2fab184471eea77c6d421f","observation_id":"0a3da397-a6c6-4301-9128-1cb7ff58d83a","resolution":{"observed_at":"2026-08-14T11:41:09.256866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.235489Z","title":"Video frame synthesis using deep voxel ﬂow","venue":null,"work_id":"b71dfd79-5ead-41e5-ab13-531601821bf7","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.754836Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:6505a401c4b6521026712c545a23f8dd6525fbed31b17c28f82aa4e6c9b13bfa","observation_id":"7b27ff61-ccc1-41ee-9cbb-20f16a6a935f","resolution":{"observed_at":"2026-08-14T11:41:09.241463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.218983Z","title":"Deep multi-scale video prediction beyond mean square error","venue":null,"work_id":"3821217d-850e-4458-b834-fb95e15763bf","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.759261Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a829f5e1f22973edbd3466feca681b6db60a757dfb9e575059d0d3e4ec9bf617","observation_id":"4e5e4ee9-7139-4df5-ac14-6b6295e28ecd","resolution":{"observed_at":"2026-08-14T11:41:09.224483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.202543Z","title":"A simple neural network module for relational reason- ing","venue":null,"work_id":"dbfc4979-6a11-4c55-8bb9-f1826e096cf8","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.764135Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:1ec21fbaf69821e653bac1302e7a485560512c2066d6b6281519053ff1acd8c0","observation_id":"9fe37d43-3d71-4ed7-8721-de0f68503dbe","resolution":{"observed_at":"2026-08-14T11:41:09.208037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.185373Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"0969174a-69bb-43cb-856b-e0817eaf4921","year":2012},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.768557Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:4b3ae1dee9ad41328de42342c7defabab9a6c40a6c10d350c1afd5b38b0d99b3","observation_id":"d47e6f3f-6532-4f81-9fe4-6951d61361c3","resolution":{"observed_at":"2026-08-14T11:41:09.190867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.169487Z","title":"Learning spatiotemporal features with 3d convolutional networks","venue":null,"work_id":"b01bce65-445d-4d34-ba3a-6b0296817d47","year":2015},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.773062Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a4cc787fd5261532f0846f737d904bed92230afc3cfb72b1af16161a50dd3c75","observation_id":"19824461-2296-49c4-b92b-d46cf141a3c4","resolution":{"observed_at":"2026-08-14T11:41:09.174675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.153462Z","title":"Mocogan: Decomposing motion and content for video generation","venue":null,"work_id":"6c5f36d5-d566-4dfa-99f9-f1c20d9e54b1","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.777342Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:4197a479fe845c135c58da7cf6224bc10ebcb04220716695d8ada9970642c956","observation_id":"a8ff2012-e278-40d3-8e3d-8895fa586c8f","resolution":{"observed_at":"2026-08-14T11:41:09.158670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.136822Z","title":"Decomposing motion and content for nat- ural video sequence prediction","venue":null,"work_id":"f383a53c-698e-4c88-ac5d-6e39a89766a3","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.781908Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:603514d900f095fac9cd2f8eb81963fa4afa58a899501f57335852f20d998a2d","observation_id":"ebcd98dc-acfd-4562-8f11-178fd5643a59","resolution":{"observed_at":"2026-08-14T11:41:09.141903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.119717Z","title":"Learning to generate long- term future via hierarchical prediction","venue":null,"work_id":"b1b42082-d810-40b1-8ded-d4ed9e59b78e","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.786345Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:eb473851023ecc16b344624403a0cb69911e386339a16d7b2ea75563ec31e2dd","observation_id":"c5fa7ed0-b874-4612-9b71-0333537e53df","resolution":{"observed_at":"2026-08-14T11:41:09.125733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.790690Z","title":"Generating videos with scene dynamics","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.790690Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a05855e89f803db971225aa0da55d38661cda0b0266a4da631892ae04702694f","observation_id":"ea4523cd-00d5-416e-913a-fcf578678bfc","resolution":{"observed_at":"2026-08-14T11:41:08.790690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.092688Z","title":"An uncertain future: Forecasting from static images using variational autoencoders","venue":null,"work_id":"1a85e4ec-1e28-4691-9c50-8cd70831efd6","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.795008Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:695b4be2b3748b348920b7a74f05170bec4c0752f8d10a0c236da2780e22f121","observation_id":"b2080860-02cb-4561-816e-b4fe1e9900d9","resolution":{"observed_at":"2026-08-14T11:41:09.097825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.076743Z","title":"The pose knows: Video forecasting by generating pose futures","venue":null,"work_id":"c8b0ff57-1dd3-4f53-bca2-d5930401a77c","year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.799506Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:92b7fd6789b4f3a1bbd92916c3afce4c53bd18fa07ccc4fe77354f8353830e95","observation_id":"aa36062a-383b-4683-8d94-2097e11cb177","resolution":{"observed_at":"2026-08-14T11:41:09.082157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.059257Z","title":"High-resolution image syn- thesis and semantic manipulation with conditional gans","venue":null,"work_id":"ecad9498-eaf5-4d34-95a5-b6e89fafee54","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.803836Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:1157593220179de76db53bcda3d269820a0ffc2a55e66feb97937c1fc6b3166a","observation_id":"c0207b7e-21b8-41c7-b5f4-53dd2a5fa802","resolution":{"observed_at":"2026-08-14T11:41:09.064848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.01433","last_updated":"2017-06-05T17:38:52Z","snapshot_observed_at":"2026-08-14T20:56:00.692346Z","submitted_at":"2017-06-05T17:38:52Z","title":"Visual Interaction Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.01433","snapshot_observed_at":"2026-08-14T11:41:08.808585Z","title":"Visual in- teraction networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.808585Z"},"links":{"cited_paper":"/paper/1706.01433","citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:27a12b930611e1d0d631a6d55d890fcb9e29fe4063f2d2caf5a81be3fd3796ab","observation_id":"de339c0d-33b9-4749-a53b-7e920bcc151d","resolution":{"observed_at":"2026-08-14T11:41:08.808585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.042974Z","title":"Physics 101: Learning physi- cal object properties from unlabeled videos","venue":null,"work_id":"a9122d20-c492-4f9e-b7a7-7a178a8ad8ec","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.813364Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:72614e0b04334fde4d81d3d5a0658fb66ae9319429729208b0ea62a59ae163d6","observation_id":"696f3eaf-a010-4875-93e8-22856adba5a5","resolution":{"observed_at":"2026-08-14T11:41:09.048313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.027104Z","title":"Visual dynamics: Probabilistic future frame synthesis via cross convolutional networks","venue":null,"work_id":"ab473256-e8a3-4f7a-b2ad-f54a84c0c69e","year":2016},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.817886Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:726574ab35cf9e40e424bdf64c12512e6f0fb43e32dcf62640548a84d3d5d529","observation_id":"0b947c7e-1dba-4cac-82fe-85895d3af029","resolution":{"observed_at":"2026-08-14T11:41:09.032123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:09.011308Z","title":"MT-V AE: learning motion transformations to generate multimodal human dynamics","venue":null,"work_id":"ec5dd6c3-74cb-4eca-9342-be1e98092661","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.822251Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:8cbd7c749f0da1adb658c1cb47bd3881432bac0e3e8bacac21f697a53a68cb7b","observation_id":"fbbee481-d605-4a5c-ab8b-b956ee18fda4","resolution":{"observed_at":"2026-08-14T11:41:09.016278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.995739Z","title":"Interpretable intuitive physics model","venue":null,"work_id":"3f3189e0-c680-4b44-8d14-a34a2928f1ab","year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.826856Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:0bee3cb69854d74a35299d000ce439d1e31f96b7e2d0cd8f41fa11190e4deec4","observation_id":"17a26547-7c12-4b64-a6ee-f011f954208b","resolution":{"observed_at":"2026-08-14T11:41:09.000729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.831383Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.831383Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:503cb5c24e39446b95bc488765416cb3104d8e752bd447bd326cea2003fc5064","observation_id":"c84bd91b-8f56-4e5a-9397-d666b5d06edb","resolution":{"observed_at":"2026-08-14T11:41:08.831383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.970299Z","title":"From actemes to action: A strongly-supervised repre- sentation for detailed action understanding","venue":null,"work_id":"0bd8f089-0b8b-4dae-801b-2ce48dc5a9ad","year":2013},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.836708Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:a6604e82c7ea55000cbc6cc13db0f7f8a6d21fc575d8b66dac3066309f629550","observation_id":"56374c15-fb9c-4800-92b6-110b6ee29019","resolution":{"observed_at":"2026-08-14T11:41:08.975245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T11:41:08.955166Z","title":"|u| =|zt| = 8","venue":null,"work_id":"364811a3-5f02-41e8-846a-ae7cf6c874f9","year":null},"citing_paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-14T11:41:08.841867Z"},"links":{"citing_paper":"/paper/1908.08522"},"observation_digest":"sha256:03593cda0dd0e74a8d3e56abf592dcea452085e1167400337a04fcc701ff38b6","observation_id":"7c626f06-dcfd-4d0b-ad65-4088b0613cc3","resolution":{"observed_at":"2026-08-14T11:41:08.959750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1908.08522","last_updated":"2019-08-22T17:55:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T13:25:25.472043Z","submitted_at":"2019-08-22T17:55:58Z","title":"Compositional Video Prediction"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":2,"verified_fuzzy":37},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:1908.08522."}