{"as_of":"2026-08-20T14:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cfc15199bea1a8579d5557c7827e5e96bf10b4422606153049a620a2881b929","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T16:13:39.486972Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10275/citation-record","integrity":"/paper/2412.10275/integrity","json":"/paper/2412.10275/citation-record.json","paper":"/paper/2412.10275"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.201828Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.201828Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:de06c84c8e8071604a9287b3bd5fff2460cffb467cce0150b6570e6a4da036ad","observation_id":"41bd53e9-af14-4ca0-8799-c9b1f5b018ba","resolution":{"observed_at":"2026-08-11T16:13:38.201828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.206503Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.206503Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:8a022d8fb63179a5bd355a37644b4e5ab0a115e40eff0dd3e3ee0a41795bcf74","observation_id":"d0806ea1-0470-462b-aa39-87d618f7a13e","resolution":{"observed_at":"2026-08-11T16:13:38.206503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.595676Z","title":null,"venue":null,"work_id":"ca21a900-2073-4337-8967-6777478356c8","year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.214318Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:253d3eef2ac1b5208ae5e7c4f367e3593604d7e43b41b2787452bb1b56da76a0","observation_id":"032501b2-1705-45ab-a659-38dec183b9ba","resolution":{"observed_at":"2026-08-11T16:13:40.598569Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-16T15:39:48.920549Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-08-11T16:13:38.218415Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.218415Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:91ba26c7a9e90d8b7f64bd956ddf23b2fc9ab4f45163bb7a3d8174577f23267a","observation_id":"bed25e60-e385-4f13-8e66-1388b7e43082","resolution":{"observed_at":"2026-08-11T16:13:38.218415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06432","last_updated":"2016-03-01T18:54:11Z","snapshot_observed_at":"2026-08-14T22:22:07.331593Z","submitted_at":"2015-11-19T22:46:13Z","title":"Delving Deeper into Convolutional Networks for Learning Video Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06432","snapshot_observed_at":"2026-08-11T16:13:38.222044Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.222044Z"},"links":{"cited_paper":"/paper/1511.06432","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:b622a7b65ee783b3c69853aab4bff3e0e57223a13e4d9de52b6b73937098bf6a","observation_id":"37620af3-d354-412e-adb1-2708470f2580","resolution":{"observed_at":"2026-08-11T16:13:38.222044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.586680Z","title":"W.; Fidler, S.; and Kreis, K","venue":null,"work_id":"4f5edd6b-aac5-4d9f-93ab-efd8b0863609","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.226482Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:b231e33ab18b9cb75ba20a2c2de2b3fec12010d4665a23de724f67ff4672a449","observation_id":"13494d86-6434-4569-8a26-32043ae99817","resolution":{"observed_at":"2026-08-11T16:13:40.589696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.575786Z","title":null,"venue":null,"work_id":"262c0691-aff0-4d86-ba10-f790176f9acc","year":2021},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.231311Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:d19488f93e64188e5a00a528adfa0397df73317e32d70c5d8ae3b0c6c779c1c2","observation_id":"82f3219e-2262-4a71-a642-78e4a1496a71","resolution":{"observed_at":"2026-08-11T16:13:40.579904Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T16:13:38.260334Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.260334Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:6df54ee99ae498209d8aa5404b5cf7f49d9b913be218cd99661e93215784b5a0","observation_id":"81915329-d3f6-488b-bec9-3ca25eb597d9","resolution":{"observed_at":"2026-08-11T16:13:38.260334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.565634Z","title":null,"venue":null,"work_id":"ceb54564-2de6-401c-989f-3661fa984f6c","year":2016},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.266708Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:bb705574d9a04a210e6ba193fe08a58385dc65f66335c3df3710b055c379e8eb","observation_id":"bfafee6b-5c14-4648-b191-cd8a3b165881","resolution":{"observed_at":"2026-08-11T16:13:40.569506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-08-11T16:13:38.276634Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.276634Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:d70fb6998330283770f9109cb137cae759edd49735c1e2cf7eebc72489bf0355","observation_id":"3765fc09-5d84-4cd4-802b-b9c0615bb928","resolution":{"observed_at":"2026-08-11T16:13:38.276634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.555371Z","title":"Y.; and Bell, S","venue":null,"work_id":"8560edae-e434-4255-89e4-0d811ecf1573","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.306474Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:93134291211c8a5e6dd404637e233766bf9d9f7aec4f71823265efc7f0b07322","observation_id":"c33926d6-5ebc-45b6-9ed8-bd0398e368ca","resolution":{"observed_at":"2026-08-11T16:13:40.559004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.545415Z","title":null,"venue":null,"work_id":"2ecb6f0a-b030-43f7-bd7d-11ce08dfd8f7","year":2014},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.343593Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:2d66e58fc33f95e2e27909a8e7ca81373c4f39778d78e6261ec5cd384b94457c","observation_id":"3e8c9758-484b-4d69-b77b-5eee1156406c","resolution":{"observed_at":"2026-08-11T16:13:40.548796Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.535003Z","title":null,"venue":null,"work_id":"43c1b9fb-8bcd-43af-a491-ad8fe427313f","year":2007},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.403850Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:a6fb9b393a55f25792474af561a1c4633ff26bff68b947724a0460bb21e5ea0f","observation_id":"ff35b294-737d-4b55-8a2d-73cb15efdac1","resolution":{"observed_at":"2026-08-11T16:13:40.538407Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14897","last_updated":"2026-04-25T05:18:57Z","snapshot_observed_at":"2026-07-06T15:08:15.836938Z","submitted_at":"2023-03-27T03:12:24Z","title":"Seer: Language Instructed Video Prediction with Latent Diffusion Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14897","snapshot_observed_at":"2026-08-11T16:13:38.407841Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.407841Z"},"links":{"cited_paper":"/paper/2303.14897","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:d9988dc87e9cf1e55a1b5e8a60e59ad126d1b8c2feff3aceb937a420d68fe854","observation_id":"63b6f553-48f3-4979-ae6e-2cc139c0a8e4","resolution":{"observed_at":"2026-08-11T16:13:38.407841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11894","last_updated":"2022-08-06T10:09:47Z","snapshot_observed_at":"2026-08-16T16:50:48.383558Z","submitted_at":"2022-06-23T17:59:33Z","title":"MaskViT: Masked Visual Pre-Training for Video Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11894","snapshot_observed_at":"2026-08-11T16:13:38.411744Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.411744Z"},"links":{"cited_paper":"/paper/2206.11894","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:ea30a802ed626af7ce5a4f260f33c24376bab690b6efcd0ff81a46d91b4d0dec","observation_id":"1210c90c-0858-40cc-9705-710ece8fcd33","resolution":{"observed_at":"2026-08-11T16:13:38.411744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.13221","last_updated":"2023-03-20T17:29:45Z","snapshot_observed_at":"2026-08-17T16:16:01.560363Z","submitted_at":"2022-11-23T18:58:39Z","title":"Latent Video Diffusion Models for High-Fidelity Long Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.13221","snapshot_observed_at":"2026-08-11T16:13:38.415706Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.415706Z"},"links":{"cited_paper":"/paper/2211.13221","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:a468427c7ab53e77c79f64438db0ef5ed2dbd89b3f7274f1f0e71afe3d17a00a","observation_id":"d48ef1df-d632-4b57-bcff-9804a76ada2f","resolution":{"observed_at":"2026-08-11T16:13:38.415706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.419836Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.419836Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:a2b9021864d9b989ebb2f5907c109c3abd36cda55e74dad0db120e89368dae02","observation_id":"bd20cd4e-789b-4af9-a9a0-caa0688f08ee","resolution":{"observed_at":"2026-08-11T16:13:38.419836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-08-18T00:41:06.039123Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-11T16:13:38.423475Z","title":"P.; Poole, B.; Norouzi, M.; Fleet, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.423475Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:ec71f83b76fec9df411d32cd6362d9b03845cf0804446c27a774bd3b7dcd679a","observation_id":"50c5e49c-53f6-45b8-8390-85bfb2a61960","resolution":{"observed_at":"2026-08-11T16:13:38.423475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.427491Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.427491Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:28cfad2a707431f86bfab88f6698577a233123fa37e695e6e3ab69eabfec5bfa","observation_id":"6dc7a1f8-e9e6-4094-a275-0d940fc88d05","resolution":{"observed_at":"2026-08-11T16:13:38.427491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-11T16:13:38.430816Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.430816Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:5d35082e49773f3a338bcc9ccd4c45e7dc8e65e61938dfec5a4adb2e7f75dbf9","observation_id":"5ef4ba16-2714-44a1-a8a8-7dbc24b18f51","resolution":{"observed_at":"2026-08-11T16:13:38.430816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07696","last_updated":"2022-11-14T08:38:19Z","snapshot_observed_at":"2026-08-16T16:52:45.448160Z","submitted_at":"2022-06-15T17:44:47Z","title":"Diffusion Models for Video Prediction and Infilling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07696","snapshot_observed_at":"2026-08-11T16:13:38.434656Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.434656Z"},"links":{"cited_paper":"/paper/2206.07696","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:ca5e9f1ee84694e5fdf1781e974363daad0a363bfffe70e4b7744edb38565c07","observation_id":"7920f658-ba4c-43d9-8562-d337f22898cb","resolution":{"observed_at":"2026-08-11T16:13:38.434656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.513761Z","title":null,"venue":null,"work_id":"6051d96f-d2a6-4542-9a12-0918de334dfc","year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.439030Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:85fe7838b8d88d6cc2b4e84fb7e504650a105f4378fa4e5a506afe610f285cf9","observation_id":"02e5ae71-1ff6-4e3c-9698-b5bef9e91cf7","resolution":{"observed_at":"2026-08-11T16:13:40.516745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.504869Z","title":null,"venue":null,"work_id":"6b71c60e-61fa-4b69-8382-8c752852fc63","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.442565Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:4855cc61707487c968c0aea050c9d60c843d8ffec039d432ce62f328c0c502d6","observation_id":"5bbf7ec5-f451-4086-8582-077adce068e9","resolution":{"observed_at":"2026-08-11T16:13:40.507949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.493747Z","title":null,"venue":null,"work_id":"29418de3-74a4-4a32-858d-df0ae50c47f5","year":2008},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.445847Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:2dd9dbef67d6db6b46ff4f91693ca6eca5e8c341626bb0d36ec7cabd20ce21e5","observation_id":"0e0b7c7b-cb74-4f9e-8583-a2c1cc7a29d5","resolution":{"observed_at":"2026-08-11T16:13:40.498217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-11T16:13:38.549716Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.549716Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:3545403536b86c17f2b6b2fe46347728f71c50743dd583308f1c308efe88c8af","observation_id":"914eafba-fc91-4cff-8789-22e16ca3947d","resolution":{"observed_at":"2026-08-11T16:13:38.549716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10834","last_updated":"2023-11-03T04:28:59Z","snapshot_observed_at":"2026-08-16T15:47:01.149971Z","submitted_at":"2023-03-20T02:40:16Z","title":"Object-Centric Slot Diffusion","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10834","snapshot_observed_at":"2026-08-11T16:13:38.704397Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.704397Z"},"links":{"cited_paper":"/paper/2303.10834","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:0f9336a29dd37481d6d6e6f19b085af7bbeffb838949e11b1fe911fdc9481c74","observation_id":"419de216-d4f4-4cc4-95de-045655e53675","resolution":{"observed_at":"2026-08-11T16:13:38.704397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.734283Z","title":"S.; Henderson, D.; Howard, R","venue":null,"work_id":null,"year":1989},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.734283Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:5a0d9245b533100edf52473700173b33e913c86f943be7ee0d8bbb0306a463a9","observation_id":"e526be9e-0a33-4e24-942b-289ccacdf6a2","resolution":{"observed_at":"2026-08-11T16:13:38.734283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.476546Z","title":"G.; Choi, D","venue":null,"work_id":"a09aaa13-7768-497b-97b2-54399c230a86","year":2021},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.737898Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:9e99c811026a89fd2c421271a827a5155a6344719c5adc73ee0d56ded9730a92","observation_id":"21676f99-3a7b-40a1-a7a6-e52a37a42a5c","resolution":{"observed_at":"2026-08-11T16:13:40.480097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.741768Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.741768Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:449bc8d55fdbb8e35b0d7e32209f6ef457d44c0b2daedeb592ad28ee95783c76","observation_id":"06e38967-120b-4ebf-9afd-33a40a24543f","resolution":{"observed_at":"2026-08-11T16:13:38.741768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.465857Z","title":null,"venue":null,"work_id":"ac8005d7-9bfb-4a15-b216-e8c5d2ef4490","year":2020},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.745633Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:355b9ada250e26e4157c31627b16cda49da11d403ea85f27ad8b460bea238dd6","observation_id":"53b389ab-2936-40a0-bebd-5668fecad0cd","resolution":{"observed_at":"2026-08-11T16:13:40.469375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.456057Z","title":null,"venue":null,"work_id":"73a678d0-21d9-4b33-8261-f8418153bb85","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.748730Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:03953d2f17997f6b0da43c6287548b2390680dbdbfcfdd675787653fac58c0b9","observation_id":"3a711193-c1c8-4591-9488-42c6a40a0b50","resolution":{"observed_at":"2026-08-11T16:13:40.459531Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.445074Z","title":null,"venue":null,"work_id":"b0dc823c-780f-4266-8ec2-4b5fff965521","year":2017},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.752969Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:3651dbbe4b47e1270107bd5ae69326d608ee48a574b08d6f2b81df1b80e3b757","observation_id":"d449a40b-ea48-4b05-8826-f7566d6558f4","resolution":{"observed_at":"2026-08-11T16:13:40.448783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.435289Z","title":"X.; and Min, M","venue":null,"work_id":"2cfd8140-e4ca-4b1a-8af1-31e6272c7575","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.756289Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:38c6c3582e201bacc3499b156ddd7e6bd3ed1656b6d8139b59f77897981cecab","observation_id":"87bb9248-6dcf-42ad-9108-237168bc934b","resolution":{"observed_at":"2026-08-11T16:13:40.438413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.760521Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.760521Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:ff4c57e8e7bc01d91b908dccce4d75953b7072ff33df2ce33df503afc057caa8","observation_id":"bfc8a6a9-3de5-4c6b-b33c-3c96c69f6d74","resolution":{"observed_at":"2026-08-11T16:13:38.760521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.764343Z","title":"W.; Hallacy, C.; Ramesh, A.; Goh, G.; Agarwal, S.; Sastry, G.; Askell, A.; Mishkin, P.; Clark, J.; et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.764343Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:12825b0a9e7831bdc1d97573879cf722d8d674778ed6996ebb84985279b9f173","observation_id":"76003eb4-f2e1-4bbb-a3bd-d1eb26971585","resolution":{"observed_at":"2026-08-11T16:13:38.764343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.414120Z","title":null,"venue":null,"work_id":"c824448a-eefa-4892-bd1f-97d693b2d3bc","year":2025},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.768370Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:272bee8609fedb845911727594872d5c2a852fa3072837bf6dbe6cc6f33eb9d5","observation_id":"ab9b7343-1392-4270-8068-ce4655402cf5","resolution":{"observed_at":"2026-08-11T16:13:40.417732Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.772603Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.772603Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:342d4e954f091d36b535b8669c45318168c5588548db6b561f27b11f1b2ffd39","observation_id":"af631fdc-ad3a-4dbf-802f-7c38487a0f96","resolution":{"observed_at":"2026-08-11T16:13:38.772603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:38.776284Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.776284Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:2da54fbcd5bbfd815fdbefc7d48d49852c5c629cfaa712f41fb2ef5a12095884","observation_id":"11ad2bcb-c361-497b-8c9f-397a6e1ffe3e","resolution":{"observed_at":"2026-08-11T16:13:38.776284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.390885Z","title":null,"venue":null,"work_id":"c5ad22c9-b0dc-4b5b-a3b4-72ea413890b7","year":2017},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.825921Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:d8326e2eee340c5a56777a26a8c39f5d5a94981abbff89f3bc837e5925c7584f","observation_id":"17c06e33-d1c3-4f6d-ab4e-956bff70b88c","resolution":{"observed_at":"2026-08-11T16:13:40.395328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.379960Z","title":null,"venue":null,"work_id":"60f0eedc-da2e-4252-8a91-a740fb6f7c7d","year":2004},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.936459Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:e3993a6ec72ffd8e6dedc296d67b0a53d26626fa31c97d76cffbe6f118597ae5","observation_id":"b66d0018-3d3d-4cda-ba67-97dc42b3c9b0","resolution":{"observed_at":"2026-08-11T16:13:40.383851Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.369300Z","title":null,"venue":null,"work_id":"41ec04c0-031b-421b-84e8-6ce69e38ddd5","year":2015},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.940778Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:116bb4150746d983b5fab936ca9ffc01f66dd86040783cc4b4f7a35c55bf2200","observation_id":"f6840188-3d6c-4667-9b39-34975d52ba8c","resolution":{"observed_at":"2026-08-11T16:13:40.372692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-17T19:17:06.411141Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-11T16:13:38.946370Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.946370Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:0575c6af5f8348a3057e8b7d09db08afd51d6cb26f3be5a7147fc185e9cea715","observation_id":"31ce2b09-603a-4890-8e79-ed0a5ce7f6fa","resolution":{"observed_at":"2026-08-11T16:13:38.946370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-11T16:13:38.950864Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.950864Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:f5129bdca71822b018dbc5b9ce1950bdcfe5e9093bea82303dd43921bde9f3a5","observation_id":"87fa55e5-3d61-455a-ab4b-63651c2bd093","resolution":{"observed_at":"2026-08-11T16:13:38.950864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T16:13:38.956062Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.956062Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:4bee0111ec602d13e53f3b829c58aed2254d8e3fcb82ef45aebe12358ca530d3","observation_id":"faa7123a-7b88-4292-b5f3-3d3f31b83bb5","resolution":{"observed_at":"2026-08-11T16:13:38.956062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02872","last_updated":"2022-10-06T12:43:07Z","snapshot_observed_at":"2026-08-16T16:26:26.588250Z","submitted_at":"2022-10-06T12:43:07Z","title":"Text-driven Video Prediction","version":1},"cited_work":{"arxiv_id":"2210.02872","doi":null,"metadata_source":"pith","pith_arxiv_id":"2210.02872","snapshot_observed_at":"2026-08-11T16:13:39.800095Z","title":"Text-driven Video Prediction","venue":"cs.CV","work_id":"4adf771e-8187-4023-9fb9-f88d1b7e54b6","year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.960603Z"},"links":{"cited_paper":"/paper/2210.02872","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:a5e7e4b9fd56d5919f4089ed1c7368ca6d78b95c053d529b7145dec86536e0e9","observation_id":"a0d358f6-6b1e-4970-8127-d11a26153c26","resolution":{"observed_at":"2026-08-11T16:13:39.860995Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.358626Z","title":null,"venue":null,"work_id":"8713ce57-071d-4dd9-bb98-b78226b786d5","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.965194Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:a5d432ea3938cb8d04d44720c4dc27b07dc471987f7b230b69eb10f59ce9ef41","observation_id":"91884a2e-8fd3-46b0-a258-103884712936","resolution":{"observed_at":"2026-08-11T16:13:40.362666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.347627Z","title":null,"venue":null,"work_id":"70aea714-c5f1-4c3d-83f6-21c31b3d52b6","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.969057Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:d959c0554d4efcd1c7be686d637680c39fd060d669a7ff7ab74494d30f784634","observation_id":"48a28dd4-15d0-4769-99b9-5323cdaaff40","resolution":{"observed_at":"2026-08-11T16:13:40.350598Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11249","last_updated":"2023-10-18T00:02:52Z","snapshot_observed_at":"2026-08-16T15:22:42.636380Z","submitted_at":"2023-06-20T03:02:14Z","title":"OpenSTL: A Comprehensive Benchmark of Spatio-Temporal Predictive Learning","version":2},"cited_work":{"arxiv_id":"2306.11249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.11249","snapshot_observed_at":"2026-08-11T16:13:39.784440Z","title":"OpenSTL: A Comprehensive Benchmark of Spatio-Temporal Predictive Learning","venue":"cs.CV","work_id":"fe7856e4-0312-46f5-9ff5-d8e659308f20","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.973888Z"},"links":{"cited_paper":"/paper/2306.11249","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:58db7b8569d50648eb1bf292003553bcbaeb16ef61178fd49aeed9bcb9c8e2be","observation_id":"f0d9d9a0-5408-4e1e-b7aa-722d4545a323","resolution":{"observed_at":"2026-08-11T16:13:39.788988Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.338990Z","title":null,"venue":null,"work_id":"5254d103-f4e9-43e1-bda5-bbf58393b927","year":2018},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.977836Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:4207df8d33bf3eda83d16e7d69f8f503e7a404f429cfa517a50d9df9101666ed","observation_id":"471ebcbf-34b5-43c2-970e-1449fb275142","resolution":{"observed_at":"2026-08-11T16:13:40.341726Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-18T04:00:09.136122Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-11T16:13:38.982208Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:38.982208Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:204cf204d0da77cb6792aeb8a8bd5c596d78998b3eab937f60cd279426ce9bab","observation_id":"c9e2d959-713c-440f-b4fa-f44e58b5ba14","resolution":{"observed_at":"2026-08-11T16:13:38.982208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.325831Z","title":null,"venue":null,"work_id":"f2372d73-e628-4da7-afce-8db3c5f96daf","year":2017},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.074904Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:99361210111389c6b133fab573d9be47c828784e8f4a92466bcedcad820a4153","observation_id":"7c66f53a-5691-47d6-99ab-660e92d46e3f","resolution":{"observed_at":"2026-08-11T16:13:40.331529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:39.153958Z","title":"N.; Kaiser, .; and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.153958Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:d78266213df3be9d44706b76ab971e98b9aa7fdd4e6eb95a077c56cd89c5b52b","observation_id":"fbd8bf21-53c9-4c8f-83fe-9075c11c163a","resolution":{"observed_at":"2026-08-11T16:13:39.153958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.307383Z","title":null,"venue":null,"work_id":"bd5ed80a-0a57-4937-b58f-ca3022cac6ce","year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.198760Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:f4c8162e30afbf9be7775ce5040a3942082388d253e3e18ce2a44f63f8e091a2","observation_id":"ab989034-eb75-4e25-8a31-38438ed38dca","resolution":{"observed_at":"2026-08-11T16:13:40.311989Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.295337Z","title":null,"venue":null,"work_id":"a895b8fa-8fde-4120-9f03-6b22bc2143e6","year":2016},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.202169Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:c8fbb3541c5de507761924911e9b9b6954b251d25e1f27ba336c583c5615387f","observation_id":"5f6d4630-dcec-43b8-b75e-54b7153304da","resolution":{"observed_at":"2026-08-11T16:13:40.300180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-14T13:59:50.878772Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-11T16:13:39.206454Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.206454Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:f23bac196a4ef2275b8c9c015df3c40f85d7bd82d086e8971201737f9604bb4c","observation_id":"0c80b526-6c9d-4a34-97f5-dbd6d5d5f17b","resolution":{"observed_at":"2026-08-11T16:13:39.206454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05082","last_updated":"2024-06-07T16:56:42Z","snapshot_observed_at":"2026-08-16T13:45:05.342150Z","submitted_at":"2024-06-07T16:56:42Z","title":"CoNo: Consistency Noise Injection for Tuning-free Long Video Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05082","snapshot_observed_at":"2026-08-11T16:13:39.210370Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.210370Z"},"links":{"cited_paper":"/paper/2406.05082","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:64c82c767319000e970070cbd0a283c4386a812b8d4d80b0f536107d571e12c8","observation_id":"33e08baf-7c27-4800-bb44-8c953a4b4d39","resolution":{"observed_at":"2026-08-11T16:13:39.210370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.283234Z","title":"C.; Sheikh, H","venue":null,"work_id":"64e44700-589a-4e88-9ce9-d260b07d6a5e","year":2004},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.214738Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:bf75b223f1ed02f41836bdcaadba9d674e376fec2c7257a275924af0a5a120c7","observation_id":"e276b868-364a-4344-90bf-5c0c3de5f694","resolution":{"observed_at":"2026-08-11T16:13:40.287305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02634","last_updated":"2020-02-10T19:29:56Z","snapshot_observed_at":"2026-08-14T16:19:47.323307Z","submitted_at":"2019-06-06T15:06:21Z","title":"Scaling Autoregressive Video Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02634","snapshot_observed_at":"2026-08-11T16:13:39.217852Z","title":"a ckstr \\","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.217852Z"},"links":{"cited_paper":"/paper/1906.02634","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:aadb969242a0fb291532dea0225c85a327e74192d7dc0bbb5d9776970181b55d","observation_id":"9b268853-d784-4722-a5cb-809d3be2f0ff","resolution":{"observed_at":"2026-08-11T16:13:39.217852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.14806","last_updated":"2021-04-30T07:40:35Z","snapshot_observed_at":"2026-08-16T18:27:58.328538Z","submitted_at":"2021-04-30T07:40:35Z","title":"GODIVA: Generating Open-DomaIn Videos from nAtural Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.14806","snapshot_observed_at":"2026-08-11T16:13:39.221922Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.221922Z"},"links":{"cited_paper":"/paper/2104.14806","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:efb5b43d6a30c3beb6666ca5d6e7a8615337507c8f3a5b740ab68f1aff44f7ff","observation_id":"3a5c7649-2ebf-4c00-a8d9-3aa079a52351","resolution":{"observed_at":"2026-08-11T16:13:39.221922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.265839Z","title":null,"venue":null,"work_id":"d6feba03-2d3a-442d-932c-eac33dfe12a4","year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.279269Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:dc68ba8daf739be17b791115990f19270bfda7c908aab1cef738a8c19bbfc590","observation_id":"4e380ea4-7c47-4819-ac95-ee804b3084b2","resolution":{"observed_at":"2026-08-11T16:13:40.273518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11565","last_updated":"2023-03-17T17:28:04Z","snapshot_observed_at":"2026-08-18T09:44:48.496427Z","submitted_at":"2022-12-22T09:43:36Z","title":"Tune-A-Video: One-Shot Tuning of Image Diffusion Models for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.11565","snapshot_observed_at":"2026-08-11T16:13:39.308355Z","title":"Z.; Ge, Y.; Wang, X.; Lei, W.; Gu, Y.; Hsu, W.; Shan, Y.; Qie, X.; and Shou, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.308355Z"},"links":{"cited_paper":"/paper/2212.11565","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:04728fcb12645a08ce66f0463ed8565fdd1b98bf7fa9488ed8ec8f33d35ae197","observation_id":"ff35d285-17a2-4cfa-a76f-9ea56c5ca072","resolution":{"observed_at":"2026-08-11T16:13:39.308355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12190","last_updated":"2023-11-27T13:36:04Z","snapshot_observed_at":"2026-08-16T14:51:02.499752Z","submitted_at":"2023-10-18T14:42:16Z","title":"DynamiCrafter: Animating Open-domain Images with Video Diffusion Priors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12190","snapshot_observed_at":"2026-08-11T16:13:39.428123Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.428123Z"},"links":{"cited_paper":"/paper/2310.12190","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:c5a004a02b3254acf9b102c01449d4629cd04ffa8b7b1ca2643876ffcd24c6b8","observation_id":"0fa69a51-39a1-402d-b846-bf292d9ca252","resolution":{"observed_at":"2026-08-11T16:13:39.428123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09710","last_updated":"2023-08-18T17:58:44Z","snapshot_observed_at":"2026-08-16T15:07:28.474034Z","submitted_at":"2023-08-18T17:58:44Z","title":"SimDA: Simple Diffusion Adapter for Efficient Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09710","snapshot_observed_at":"2026-08-11T16:13:39.469323Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.469323Z"},"links":{"cited_paper":"/paper/2308.09710","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:fed2551b9f85222b8500ed58b77233a2fdcc4f217a5ec660279f58b49c71cd30","observation_id":"46920155-5784-4286-943e-49c3fa2c3a73","resolution":{"observed_at":"2026-08-11T16:13:39.469323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T16:13:40.170615Z","title":null,"venue":null,"work_id":"a4d625f0-3172-4bdd-97ca-5020a8934702","year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.473781Z"},"links":{"citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:e09abed196c3fce66ef4f6644e8c530ab91b40351dca10aa7910107a6aeb1fa2","observation_id":"e3cc8a29-cb4c-4b18-b314-820eb6d3d266","resolution":{"observed_at":"2026-08-11T16:13:40.224794Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05323","last_updated":"2023-04-04T10:59:43Z","snapshot_observed_at":"2026-08-16T15:49:29.152822Z","submitted_at":"2023-03-09T15:13:51Z","title":"Controllable Video Generation by Learning the Underlying Dynamical System with Neural ODE","version":2},"cited_work":{"arxiv_id":"2303.05323","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.05323","snapshot_observed_at":"2026-08-11T16:13:39.553605Z","title":"Controllable Video Generation by Learning the Underlying Dynamical System with Neural ODE","venue":"cs.CV","work_id":"f6322c9b-8cd2-45c7-a604-6b81299b102c","year":2023},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.477151Z"},"links":{"cited_paper":"/paper/2303.05323","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:9ee666c1a12eba03d216385521f97fb34e2fe76d69494be10215c6272dc2f0b3","observation_id":"0ad5e6a6-5cb7-4561-b940-aa59ef6bb01b","resolution":{"observed_at":"2026-08-11T16:13:39.613241Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09481","last_updated":"2022-12-08T01:18:55Z","snapshot_observed_at":"2026-08-16T17:14:13.000499Z","submitted_at":"2022-03-16T03:52:45Z","title":"Diffusion Probabilistic Modeling for Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09481","snapshot_observed_at":"2026-08-11T16:13:39.481105Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.481105Z"},"links":{"cited_paper":"/paper/2203.09481","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:6c4adec2d5ee96077dc8fd0e66f26ac3da424610b836dca4ded1817e3d2a080f","observation_id":"fb6f6d87-6470-468e-a8a1-70dccb19735a","resolution":{"observed_at":"2026-08-11T16:13:39.481105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-08-16T05:49:16.026825Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-11T16:13:39.486972Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T16:13:39.486972Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2412.10275"},"observation_digest":"sha256:421b81e9d53fc7a173811dc562a0af73231f1604027945b46bf19fa3f5294b87","observation_id":"ec5c05dc-b9c6-40b3-ba4b-556bfe6b3190","resolution":{"observed_at":"2026-08-11T16:13:39.486972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10275","last_updated":"2024-12-16T03:32:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T11:01:00.352739Z","submitted_at":"2024-12-13T16:52:13Z","title":"TIV-Diffusion: Towards Object-Centric Movement for Text-driven Image to Video Generation"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":59,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 0 inbound Pith citation observations for arXiv:2412.10275."}