{"as_of":"2026-08-13T03:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:29317aa8000d08ce2e88941d536c88c1d614ee4d20fcc8ab1dc6ea2c1e903ba2","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:20:36.912049Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:01:12.898019Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T21:09:16.226896Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05848","snapshot_observed_at":"2026-08-07T14:01:12.898019Z","title":"Motionstone: Decoupled motion in- tensity modulation with diffusion transformer for image-to- video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20255","last_updated":"2025-07-07T17:56:30Z","snapshot_observed_at":"2026-08-12T02:55:15.853506Z","submitted_at":"2025-05-26T17:32:10Z","title":"AniCrafter: Customizing Realistic Human-Centric Animation via Avatar-Background Conditioning in Video Diffusion Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:12.898019Z"},"links":{"cited_paper":"/paper/2412.05848","citing_paper":"/paper/2505.20255"},"observation_digest":"sha256:69246983ebe7f22f2e05ab2b56c661d7d7e6c3645416250f2dd16bf7e153d3a3","observation_id":"e1c8c399-d6b0-42f8-ab63-1f5f4fd7713f","resolution":{"observed_at":"2026-08-07T14:01:12.898019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"cited_work":{"arxiv_id":"2412.05848","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05848","snapshot_observed_at":"2026-08-05T21:09:16.226896Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","venue":"cs.CV","work_id":"473fa340-72c8-4c71-9f62-2da1615e5897","year":2024},"citing_paper":{"arxiv_id":"2508.09454","last_updated":"2025-08-13T03:11:28Z","snapshot_observed_at":"2026-08-12T10:53:52.650501Z","submitted_at":"2025-08-13T03:11:28Z","title":"Animate-X++: Universal Character Image Animation with Dynamic Backgrounds","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T21:09:08.118424Z"},"links":{"cited_paper":"/paper/2412.05848","citing_paper":"/paper/2508.09454"},"observation_digest":"sha256:ce83c3118e0d6010bc96f1cde107f83ee438d58f84e36a71ddb22f7e58bafa46","observation_id":"22632463-f4e5-4499-93d4-3dcac8ddc498","resolution":{"observed_at":"2026-08-05T21:09:16.319417Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.05848/citation-record","integrity":"/paper/2412.05848/integrity","json":"/paper/2412.05848/citation-record.json","paper":"/paper/2412.05848"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.745075Z","title":"Frozen in time: A joint video and image encoder for end-to-end retrieval","venue":null,"work_id":"a8693c2c-40c3-40c1-95af-30504c8f7b97","year":2021},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.430982Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:590bfd462b5e6e44e0141f8de1a0092fe5aee1a4f78349c1416cd651cb014d6a","observation_id":"980a0a1a-aca7-4233-bb19-12526938c468","resolution":{"observed_at":"2026-08-11T20:20:37.749812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T20:20:36.436348Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.436348Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:7862e1c65106cabf8fdd7e1e75ef843a52585703c2349af7a44dfad920061ec7","observation_id":"a334d119-9f6d-4022-9229-0a8b19a8ca4f","resolution":{"observed_at":"2026-08-11T20:20:36.436348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.730957Z","title":"Align your latents: High-resolution video synthesis with latent diffusion models","venue":null,"work_id":"c57a9971-7c7b-47b4-8d99-f765336b3af1","year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.441491Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:016ecd7d565da4f29201d8b6301acd0dc4398ed145dea526271eb7e2d578ac5f","observation_id":"78985cf2-7617-477e-a05b-bec2f208bef5","resolution":{"observed_at":"2026-08-11T20:20:37.735375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.716239Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"565d6640-5ef1-4158-a141-2b12a92f4204","year":2021},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.446338Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:fedd7b6bb1702458a7d642b918737e8fb6e73580bd270256d87c32237d37f8c6","observation_id":"0765079d-8002-41c3-a146-d1fb46381960","resolution":{"observed_at":"2026-08-11T20:20:37.720706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.698898Z","title":"Stablevideo: Text-driven consistency-aware diffusion video editing","venue":null,"work_id":"a2a35e67-1513-4acf-bf3e-38717053af69","year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.451031Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:5c5b137a4490e79d38333d51d38c8ddb38727d2da815eda2061f1655d00bda40","observation_id":"6d9176e7-3eea-48fc-9cef-76c1d79f06a5","resolution":{"observed_at":"2026-08-11T20:20:37.704685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.681794Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware dif- fusion","venue":null,"work_id":"8b7bfcb4-ac6e-4ae1-b847-149e3fd329ca","year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.455597Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:e31da20ab71795476f484a3e26e3694345cb78b6d409d1e6722999acc8bcd5c4","observation_id":"d2dd61c4-2b06-4222-9bd4-f1e1530e8722","resolution":{"observed_at":"2026-08-11T20:20:37.687085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-11T20:20:36.460860Z","title":"Kwok, Ping Luo, Huchuan Lu, and Zhenguo Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.460860Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:39c50c47fb0892edde94b8e293a39747e25735ddc3ae937efa1fb6a270032dd4","observation_id":"b6045b52-7b44-4e9c-89b3-035e57e3dba5","resolution":{"observed_at":"2026-08-11T20:20:36.460860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.665667Z","title":"Livephoto: Real image animation with text-guided motion control","venue":null,"work_id":"dddc71cc-7835-44be-a47c-017611b1e08b","year":2025},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.465603Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:bfd3c36601d706eb832f801c566b0691df68f76139d8b68497a7c44c48cd544e","observation_id":"af723145-b00c-4415-ad34-b41a9aa85e6e","resolution":{"observed_at":"2026-08-11T20:20:37.670885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.650653Z","title":"Time flies: Animating a still image with time-lapse video as reference","venue":null,"work_id":"dcce2435-54b0-4071-b617-07680fdc8e87","year":2020},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.470062Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:feb0ecd27dc77223bd1911994ceea4177986439aab53b015a3f9c6cc110f927a","observation_id":"9684d8ae-4941-4d56-a70c-d779c7a2df96","resolution":{"observed_at":"2026-08-11T20:20:37.655383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.635173Z","title":"Animating pictures with stochastic motion textures","venue":null,"work_id":"f01f546a-06f2-40b5-a5a9-761159e7dac5","year":2005},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.474523Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:a3461e389f155d1fe0a23a361067c5cb8685831d606d12795f7d5cb147568b48","observation_id":"75bb9476-a180-4527-acf0-b47e8ff417fa","resolution":{"observed_at":"2026-08-11T20:20:37.640062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.619609Z","title":"Animateanything: Fine-grained open domain image animation with motion guidance","venue":null,"work_id":"8c3f02c4-dac6-4bad-bd7e-25c61587b125","year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.479933Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:485c671dc2f72e0d547abee207a748ac58e0a69a50841516e3fe757e84c9ddc8","observation_id":"7dd910cc-6445-4dfc-b6ee-d588a634bb33","resolution":{"observed_at":"2026-08-11T20:20:37.624782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.484409Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.484409Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:22b0e2553a2911b3b4c055a0476c2c361027294cc3fb8db49bffa8a4a0dd67f9","observation_id":"9428f561-5863-43aa-92a1-eb7d4041f472","resolution":{"observed_at":"2026-08-11T20:20:36.484409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.595604Z","title":"Perceptual quality assessment of smartphone photography","venue":null,"work_id":"e7923f95-362e-48a2-b411-cf29efc440cb","year":null},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.488559Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:98d0b52dbb2599df0fda6ccb7a9fd47ce217245757e3641afe300a039ec1fc33","observation_id":"00872f25-3555-4bf4-9a17-c3350f7733fa","resolution":{"observed_at":"2026-08-11T20:20:37.600126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-08-13T00:10:49.002216Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-08-11T20:20:36.493002Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion trans- formers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.493002Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:415f5afa28ed77aceaccb487b536c6e4c157f7d000fc64d2918040589d2da5fd","observation_id":"8b34c3ec-711c-49a9-bd46-a26009a8df44","resolution":{"observed_at":"2026-08-11T20:20:36.493002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.580469Z","title":"Check locate rectify: A training- free layout calibration system for text-to-image generation","venue":null,"work_id":"9da4f36e-ee6f-4c0f-8255-360e4e0e19c5","year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.497541Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:4e88dd32ae05e4bd9fd547785d088c433715ed241f9236c71abc13b00911747a","observation_id":"37db5820-2d8f-4f00-b4f2-b9d1a74986e6","resolution":{"observed_at":"2026-08-11T20:20:37.585180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-11T20:20:36.501749Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.501749Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:091df4dd98fa66d896af1259f25163bbc398180b71bf21ecd9bc69041cba5f60","observation_id":"e69f99eb-ed2e-4f36-bbb0-280a8498defb","resolution":{"observed_at":"2026-08-11T20:20:36.501749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.506501Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.506501Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:bed04d7d66652088a0b4b91207a987e3c3c399578f6d9c1f09f1483e80762a64","observation_id":"e5f5683c-4583-4461-875b-78e25997b877","resolution":{"observed_at":"2026-08-11T20:20:36.506501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.511450Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.511450Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:0737bfdf26e6e116be26ac9fe5775d1379d936acbaf56aef950bb85f81538962","observation_id":"f085d6af-4283-45cd-8ff9-03d92870e397","resolution":{"observed_at":"2026-08-11T20:20:36.511450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06178","last_updated":"2022-03-17T15:14:37Z","snapshot_observed_at":"2026-08-08T23:32:04.925234Z","submitted_at":"2021-10-12T17:25:07Z","title":"TAda! Temporally-Adaptive Convolutions for Video Understanding","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06178","snapshot_observed_at":"2026-08-11T20:20:36.516428Z","title":"Tada! temporally-adaptive convolutions for video understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.516428Z"},"links":{"cited_paper":"/paper/2110.06178","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:ae44877514e27d8d09af0bc4a6437fafdf3a0d93dfb90dc03b49f321f126d2cb","observation_id":"6e7ca8b5-ea40-41d9-9cfa-1d8e9d0921ab","resolution":{"observed_at":"2026-08-11T20:20:36.516428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.546764Z","title":"Vbench: Comprehensive bench- mark suite for video generative models","venue":null,"work_id":"ef0f4205-ff03-4e3f-84a4-8ac2da4de19d","year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.524905Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:d42ed616ef03e00229971f9f1f211a3c613836b39adfce7028ed966ac908f2a1","observation_id":"d1743d39-13de-4f3c-8012-fc3c4094b78f","resolution":{"observed_at":"2026-08-11T20:20:37.551225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.532434Z","title":"Musiq: Multi-scale image quality transformer","venue":null,"work_id":"1c7a9dd4-1571-45d6-9204-16d4a8bfc94d","year":2021},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.530086Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:32a363614700b13d156825dedf776c7b3a86c130e9ab878ba0f795e485928be5","observation_id":"8f4c6f9b-e355-4ccc-b585-470787608b67","resolution":{"observed_at":"2026-08-11T20:20:37.536914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.02862","last_updated":"2017-08-09T14:59:30Z","snapshot_observed_at":"2026-07-06T05:54:38.912241Z","submitted_at":"2017-08-09T14:59:30Z","title":"WebVision Database: Visual Learning and Understanding from Web Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1708.02862","snapshot_observed_at":"2026-08-11T20:20:36.535446Z","title":"WebVision Database: Visual Learning and Understanding from Web Data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.535446Z"},"links":{"cited_paper":"/paper/1708.02862","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:8ea7c6933b127534655f9f19026aaafc34a434d7797ce5e4a64faaa5091f22cc","observation_id":"0f742f86-0445-4137-b786-be186bdbd0fb","resolution":{"observed_at":"2026-08-11T20:20:36.535446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.518238Z","title":"Amt: All-pairs multi-field transforms for efficient frame interpolation","venue":null,"work_id":"8f620031-f5b9-45b0-ab7d-1597ee9d6327","year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.541042Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:a5d822f390ee68062e59f5cf3b9b26a7fe93305e882cc18f9419785496f493ee","observation_id":"b06a2c8c-1a6b-40d0-96f6-767eca062b0f","resolution":{"observed_at":"2026-08-11T20:20:37.522872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14749","last_updated":"2023-08-28T17:56:22Z","snapshot_observed_at":"2026-08-12T21:44:12.404312Z","submitted_at":"2023-08-28T17:56:22Z","title":"MagicEdit: High-Fidelity and Temporally Coherent Video Editing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14749","snapshot_observed_at":"2026-08-11T20:20:36.545889Z","title":"Magicedit: High-fidelity and temporally 9 coherent video editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.545889Z"},"links":{"cited_paper":"/paper/2308.14749","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:0b455515ee830f097ecc0978f5a2f50538f36f6192dba7632aabf4ce3edde1e9","observation_id":"5235b3aa-d87f-4c22-925e-a05366230818","resolution":{"observed_at":"2026-08-11T20:20:36.545889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.503778Z","title":"Rankiqa: Learning from rankings for no-reference image quality assessment","venue":null,"work_id":"0e0362c7-e757-4baa-8f6e-d0e2040e107e","year":2017},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.551671Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:df01935ef8ff736304ee38b89d9c230646c972a01b430442ecfcb85932ed64ac","observation_id":"cf8f166c-68ef-46fd-b72e-92db163939a8","resolution":{"observed_at":"2026-08-11T20:20:37.508141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15642","last_updated":"2024-07-23T01:35:07Z","snapshot_observed_at":"2026-08-12T23:17:19.128162Z","submitted_at":"2024-07-22T14:00:03Z","title":"Cinemo: Consistent and Controllable Image Animation with Motion Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15642","snapshot_observed_at":"2026-08-11T20:20:36.556813Z","title":"Cinemo: Consistent and controllable image animation with motion diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.556813Z"},"links":{"cited_paper":"/paper/2407.15642","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:2347908568abb9e67176d424f7a60045586e8aa580b24fcf6db758ae5a001310","observation_id":"83ddb5ed-a9ce-4102-9939-417706acd53d","resolution":{"observed_at":"2026-08-11T20:20:36.556813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-11T20:20:36.624161Z","title":"Latte: Latent diffusion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.624161Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:1efe487097b5a9e4d7171a267b9117374367f6cb2d9fcae2d525b9c5d51ae3d7","observation_id":"9614bddf-ab90-4f36-8783-b944b3519fa4","resolution":{"observed_at":"2026-08-11T20:20:36.624161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.692308Z","title":"Controllable animation of fluid elements in still images","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.692308Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:7a042c687a9afc913dbdb3bbddf150295826066c4421c09a27112ab725ca4a2b","observation_id":"0de5f171-5bcc-4013-8f7c-8de387ff6420","resolution":{"observed_at":"2026-08-11T20:20:36.692308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13865","last_updated":"2024-05-22T17:46:08Z","snapshot_observed_at":"2026-08-13T00:01:58.538944Z","submitted_at":"2024-05-22T17:46:08Z","title":"ReVideo: Remake a Video with Motion and Content Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13865","snapshot_observed_at":"2026-08-11T20:20:36.765950Z","title":"Revideo: Remake a video with motion and content control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.765950Z"},"links":{"cited_paper":"/paper/2405.13865","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:8bc6578f80c9a9f2129afae754d9041293b246fe2bf3e413e3a8e84360eee74d","observation_id":"822c1c3b-94c5-4808-89c8-836307a96fc0","resolution":{"observed_at":"2026-08-11T20:20:36.765950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20222","last_updated":"2024-07-11T16:26:03Z","snapshot_observed_at":"2026-08-12T23:54:01.281719Z","submitted_at":"2024-05-30T16:22:22Z","title":"MOFA-Video: Controllable Image Animation via Generative Motion Field Adaptions in Frozen Image-to-Video Diffusion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20222","snapshot_observed_at":"2026-08-11T20:20:36.782193Z","title":"Mofa-video: Controllable image animation via generative motion field adaptions in frozen image-to-video diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.782193Z"},"links":{"cited_paper":"/paper/2405.20222","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:c357246e76eac0f723fdcac1fd70efa34a1f67a02c2fe3cc4e154ec4812578e8","observation_id":"e8cd67a9-0f6b-4e8d-9e83-9bcc01870fde","resolution":{"observed_at":"2026-08-11T20:20:36.782193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.479561Z","title":"Animating pictures of fluid using video examples","venue":null,"work_id":"2c138eaf-1b0f-461a-91fc-6e3cd4552dee","year":2009},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.788237Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:82b2398df7bdc468deff3873ad2eb4fc82ec81d1117012910695c7e806663b16","observation_id":"6ed4f9d4-694f-4f90-9b9f-2f7bf487142d","resolution":{"observed_at":"2026-08-11T20:20:37.484401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.793530Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.793530Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:3a26b4aba6cafb4d2896818096d7d7261a1f1bacf9779994273e66a4d1c41406","observation_id":"895a38e6-8e9a-4299-8934-6041e7e39948","resolution":{"observed_at":"2026-08-11T20:20:36.793530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.454342Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"96ba8747-b063-4337-a56b-e0d640a1a17a","year":2021},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.798873Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:0a6f1e1f13bfebaa24e1225c375636df08a336d23d3c13a8c55bd99a62d72ae3","observation_id":"8b38ab25-68f8-495c-8082-a6258d822db5","resolution":{"observed_at":"2026-08-11T20:20:37.459181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-13T01:09:38.772877Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-11T20:20:36.804152Z","title":"Consisti2v: Enhancing visual consistency for image-to-video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.804152Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:782f395e6c9f63bf2373e6cd229bba48caaa80e47826ef30094c65ed4b04f61a","observation_id":"02b0e638-f71c-48c4-94d1-711af8f7b426","resolution":{"observed_at":"2026-08-11T20:20:36.804152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.439539Z","title":"Image animation with perturbed masks","venue":null,"work_id":"40cce61d-853a-4f08-b42d-ff747f29b218","year":2022},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.809845Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:16ace7bd9a91187686a54370fa16a1917abca98edc52ae973c2c30ea7a0945e4","observation_id":"0b10e7c8-5613-4fa9-9a51-acebb207c7c1","resolution":{"observed_at":"2026-08-11T20:20:37.444203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16476","last_updated":"2024-06-24T09:28:21Z","snapshot_observed_at":"2026-08-12T23:36:18.368540Z","submitted_at":"2024-06-24T09:28:21Z","title":"ResMaster: Mastering High-Resolution Image Generation via Structural and Fine-Grained Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16476","snapshot_observed_at":"2026-08-11T20:20:36.814676Z","title":"Resmaster: Mastering high- resolution image generation via structural and fine-grained guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.814676Z"},"links":{"cited_paper":"/paper/2406.16476","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:3ff8f26f988a0312953c593c93317788c1023baab94a0edb6c121590ed60021a","observation_id":"407a73a3-0285-4eda-9e68-c4a406000b9e","resolution":{"observed_at":"2026-08-11T20:20:36.814676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.819805Z","title":"First order motion model for image animation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.819805Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:f8f6bb6f8ad83c9cc970c4f116a966eefba539c9f1ecf276c177f8054e60d257","observation_id":"e73fc26a-6487-49f0-867c-f5aeef149789","resolution":{"observed_at":"2026-08-11T20:20:36.819805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.414844Z","title":"Motion representations for articulated animation","venue":null,"work_id":"8dcd857d-77bf-4487-8542-1823057ae4ad","year":2021},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.824564Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:e70b99e1496ab731a56d26769fa236a77ed244d19c9983c9dd435f9c938eebf0","observation_id":"88a0139a-db88-423d-ab11-aca855bd38bd","resolution":{"observed_at":"2026-08-11T20:20:37.420030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-11T20:20:36.829424Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.829424Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:5d196cc5ea1ac9a9ded337ddf034d18c2726d07ead8a4b2c329d204f9ac62f3c","observation_id":"1dc508fb-e8e9-4f7b-af0f-2454fb71e3d8","resolution":{"observed_at":"2026-08-11T20:20:36.829424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-12T22:23:58.441398Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-11T20:20:36.834297Z","title":"Animate-x: Universal character image animation with enhanced motion representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.834297Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:95e01f61b29dbe01d8f237927ef94f682bffccdcc0a45adae77cf9d71066958f","observation_id":"2762b3b4-87ca-4c02-b75f-2d07753087c3","resolution":{"observed_at":"2026-08-11T20:20:36.834297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.839940Z","title":"Raft: Recurrent all-pairs field transforms for optical flow","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.839940Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:eb15f8940403d9a8974ccdd6e3ec9498becf9fccd5311f30a7dfd7c4c72fb15c","observation_id":"c1026c99-ecad-4048-8882-3f664bf24a15","resolution":{"observed_at":"2026-08-11T20:20:36.839940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.390392Z","title":"Videocomposer: Compositional video synthesis with motion controllability","venue":null,"work_id":"25742f1f-85b7-467f-98d9-7582423fb2e6","year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.844645Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:5969829e8eb1b61cea6906daa0b6b76fa6e61e45eb0ff49a1dce6949ed443dad","observation_id":"c6b63351-bea6-4c7f-90a7-d59670ae9862","resolution":{"observed_at":"2026-08-11T20:20:37.395386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-08-12T23:51:43.869038Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-11T20:20:36.849444Z","title":"Unianimate: Taming unified video diffusion models for consistent human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.849444Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:782d56a069c270f5aea409e95ebd18904a9974bd0d3b4cd8d0760654ce75caa3","observation_id":"2293d014-ea73-4923-8c4c-6a7355b880fc","resolution":{"observed_at":"2026-08-11T20:20:36.849444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.09043","last_updated":"2022-03-17T02:45:34Z","snapshot_observed_at":"2026-08-11T08:19:57.218427Z","submitted_at":"2022-03-17T02:45:34Z","title":"Latent Image Animator: Learning to Animate Images via Latent Space Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.09043","snapshot_observed_at":"2026-08-11T20:20:36.854413Z","title":"Latent image animator: Learning to ani- mate images via latent space navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.854413Z"},"links":{"cited_paper":"/paper/2203.09043","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:94d56eb408f7424c61e039b97853401ab2d00db7cec79d317934c9822bc4c41d","observation_id":"85f9c955-9f79-4e06-9018-750d17553aab","resolution":{"observed_at":"2026-08-11T20:20:36.854413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15103","last_updated":"2023-09-27T03:51:52Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:52:03Z","title":"LAVIE: High-Quality Video Generation with Cascaded Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15103","snapshot_observed_at":"2026-08-11T20:20:36.859542Z","title":"Lavie: High-quality video generation with cascaded latent diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.859542Z"},"links":{"cited_paper":"/paper/2309.15103","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:457ba00059ac11089b9bb26a695c6a4dbe63129aa6329995673982b666a78ce9","observation_id":"12dcf13d-12f4-40ec-841e-8a3c35ecb70a","resolution":{"observed_at":"2026-08-11T20:20:36.859542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.864422Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.864422Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:9c62e4b0a1c33f807bb06aa503003b6576e4f993cddf679ed4fad155cdac165c","observation_id":"89d36ec6-5321-4ae6-bb04-feb5dba7d748","resolution":{"observed_at":"2026-08-11T20:20:36.864422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.869084Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.869084Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:10d9765f43e21844a4a9f027dd674d790648d2f252a160bec7578196952323f5","observation_id":"12d676eb-19d5-418c-a6c3-9514f9feab9a","resolution":{"observed_at":"2026-08-11T20:20:36.869084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.354652Z","title":"Automatic animation of hair blowing in still portrait photos","venue":null,"work_id":"ee9420bc-cc24-4212-86c8-29a440e2e56d","year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.873823Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:a4068ac98c654fd77e184aef0d474e68dffd693f6cf17cf597dad02dfdc2f3f9","observation_id":"e9235b92-ae44-418c-aad8-f300c26b5402","resolution":{"observed_at":"2026-08-11T20:20:37.359847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.339651Z","title":"Spatialtracker: Tracking any 2d pixels in 3d space","venue":null,"work_id":"241621db-1133-44e9-acc7-0b592aab962f","year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.878490Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:675bbf2c2f49de7540880bfbf62ca31bb6c9c4eb02033ac6643bf18767918686","observation_id":"72089502-01b3-4c53-b271-636a43d486c9","resolution":{"observed_at":"2026-08-11T20:20:37.344564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12389","last_updated":"2024-11-21T20:28:33Z","snapshot_observed_at":"2026-08-13T00:27:11.273432Z","submitted_at":"2024-04-18T17:59:53Z","title":"Moving Object Segmentation: All You Need Is SAM (and Flow)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12389","snapshot_observed_at":"2026-08-11T20:20:36.882576Z","title":"Moving object segmentation: All you need is sam (and flow)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.882576Z"},"links":{"cited_paper":"/paper/2404.12389","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:3b102831aec0946576d3ad325bb5ab40929f341b0bcfff52ed07cbbf7701c7bc","observation_id":"38a3b6cf-4da9-4bb3-8203-6ae15b32910d","resolution":{"observed_at":"2026-08-11T20:20:36.882576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:36.886952Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.886952Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:039eb171eaaca01bbfbd02bc0573d8f0c4fe72f503f4e315c1750950f8a3f2b7","observation_id":"88c34f45-633e-46d5-872d-2a4a9b290d2d","resolution":{"observed_at":"2026-08-11T20:20:36.886952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-11T20:20:36.890791Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.890791Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:15e2b8627b886bc0547bb9f98cdcd44d08099dc14ec1837160656ab8ed0b5a11","observation_id":"f2ad4be9-9cfa-4072-a30b-932c7f84f57e","resolution":{"observed_at":"2026-08-11T20:20:36.890791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-11T20:20:36.895068Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.895068Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:861915a3a1bfe4f79b79e3cfaa659abfeb46b048a2b41cf07aa8c467cb40499b","observation_id":"77c497ee-8225-4536-8cb4-4466ed269763","resolution":{"observed_at":"2026-08-11T20:20:36.895068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.314076Z","title":"Pia: Your personalized image animator via plug-and-play modules in text-to-image models","venue":null,"work_id":"4ad7f681-31e6-4ffd-9c1a-dbcc88472033","year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.899353Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:ebe84aeea22fdd8e09a0e2a5163bbc3fa7f8b0540c2f437d8e17ec367bcec6c0","observation_id":"d13db79d-32f8-4983-9142-91d146723653","resolution":{"observed_at":"2026-08-11T20:20:37.319190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-08-12T23:10:54.142809Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-11T20:20:36.903443Z","title":"Tora: Trajectory-oriented diffu- sion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.903443Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:305a1fced85d7cc28d2d5f378edc906388f50862d46cfbe2bc4f0558f411031e","observation_id":"b885a085-1c37-4a5b-9b23-98a8c9e28fe5","resolution":{"observed_at":"2026-08-11T20:20:36.903443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.299495Z","title":"Thin-plate spline motion model for image animation","venue":null,"work_id":"3d45d059-73a9-499e-bce4-2f0c87260e4c","year":2022},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.907766Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:f018fb37d20ebac4f4d6f74c7900112c71505f75317f608e6f48fcf9363dbf04","observation_id":"d4fdc5bd-f6a1-429b-883b-b3a2fd92f559","resolution":{"observed_at":"2026-08-11T20:20:37.303978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:20:37.282714Z","title":"Camera zooms out. A penguin is dancing","venue":null,"work_id":"5b40a21d-1f05-4b98-8eb2-ad6fff81e735","year":1991},"citing_paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T20:20:36.912049Z"},"links":{"citing_paper":"/paper/2412.05848"},"observation_digest":"sha256:78fc1c86240e75bd2941d6dc6531f1788643509d9e95e3fcbeb0e336045e29a9","observation_id":"76f30291-e566-49fe-b167-24b475a90d78","resolution":{"observed_at":"2026-08-11T20:20:37.289046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.05848","last_updated":"2024-12-08T08:12:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T07:30:41.683191Z","submitted_at":"2024-12-08T08:12:37Z","title":"MotionStone: Decoupled Motion Intensity Modulation with Diffusion Transformer for Image-to-Video Generation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2412.05848."}