{"as_of":"2026-08-13T16:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2d19798dfa8232cb0794291e38696bca50f1277c2f456ba799c755457387a6fb","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T12:04:47.390095Z","state":"measured"},{"denominator":86,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":86,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":30,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:54:12.520467Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T17:18:43.389947Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2503.14505","last_updated":"2026-05-03T19:49:25Z","snapshot_observed_at":"2026-08-06T04:26:20.176735Z","submitted_at":"2025-03-18T17:59:58Z","title":"MusicInfuser: Making Video Diffusion Listen and Dance","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-22T23:28:51.767845Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2503.14505"},"observation_digest":"sha256:5854c9232e93c14fd85499b5f6488e8d37fd30d9cda269b4dce6ec9aabe082a8","observation_id":"3564ce24-f399-4a15-af4e-d0d840e1adc3","resolution":{"observed_at":"2026-05-22T23:32:15.635560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-07T11:54:12.520467Z","title":"Videojam: Joint appearance-motion representations for enhanced motion generation in video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01144","last_updated":"2025-06-04T07:45:25Z","snapshot_observed_at":"2026-08-09T14:05:40.824663Z","submitted_at":"2025-06-01T19:55:33Z","title":"FlowMo: Variance-Based Flow Guidance for Coherent Motion in Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:54:12.520467Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2506.01144"},"observation_digest":"sha256:97330661c8a91402879243079f5db76414b46d8bc84e9c81edc1a6eeb41b0b46","observation_id":"8ba1652b-0765-49c2-8246-f68df6ddb1f5","resolution":{"observed_at":"2026-08-07T11:54:12.520467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-07T11:27:12.386394Z","title":"Videojam: Joint appearance-motion representations for enhanced motion generation in video models.arXiv preprint arXiv:2502.02492,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.02497","last_updated":"2025-06-03T06:25:00Z","snapshot_observed_at":"2026-08-09T05:08:41.895371Z","submitted_at":"2025-06-03T06:25:00Z","title":"LumosFlow: Motion-Guided Long Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T11:27:12.386394Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2506.02497"},"observation_digest":"sha256:b2f85eba254a37a45e6072ca97247ae87f29aa644b7ff1dc7bd31a2dfcaf9fb6","observation_id":"ab1affd8-b904-4a21-afde-00c6dd068898","resolution":{"observed_at":"2026-08-07T11:27:12.386394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-06T23:59:33.701446Z","title":"VideoJAM: Joint appearance-motion representations for enhanced motion generation in video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.15673","last_updated":"2025-06-18T17:56:45Z","snapshot_observed_at":"2026-08-13T07:26:14.327269Z","submitted_at":"2025-06-18T17:56:45Z","title":"UniRelight: Learning Joint Decomposition and Synthesis for Video Relighting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:59:33.701446Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2506.15673"},"observation_digest":"sha256:a58325c0269e47314cbe3d3b1f35616d9d98e4a0d523db1b6223afcb62d25665","observation_id":"f96657f5-9e9c-4fdd-a597-dc00e1d115ed","resolution":{"observed_at":"2026-08-06T23:59:33.701446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-06T13:57:04.394521Z","title":"Videojam: Joint appearance-motion representations for en- hanced motion generation in video models.arXiv preprint arXiv:2502.02492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19924","last_updated":"2025-08-01T12:25:21Z","snapshot_observed_at":"2026-08-12T19:29:28.949735Z","submitted_at":"2025-07-26T12:03:47Z","title":"HumanSAM: Classifying Human-centric Forgery Videos in Human Spatial, Appearance, and Motion Anomaly","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:04.394521Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2507.19924"},"observation_digest":"sha256:6ba0928a033ed4e5f2beacc89cb8cd6739cc7f1080ed296579d43bfbcf306223","observation_id":"0280e3ab-442d-4bc2-b5e5-35c36b402062","resolution":{"observed_at":"2026-08-06T13:57:04.394521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-05T10:52:02.115858Z","title":"VideoJAM: Joint appearance-motion representations for enhanced motion generation in video models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.03680","last_updated":"2025-09-03T19:59:20Z","snapshot_observed_at":"2026-08-09T08:25:50.746510Z","submitted_at":"2025-09-03T19:59:20Z","title":"LuxDiT: Lighting Estimation with Video Diffusion Transformer","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:52:02.115858Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2509.03680"},"observation_digest":"sha256:6d997769b79a0365cf25d54871e29c1de32d5b014ed0e017a73d3d8a434532fb","observation_id":"77f362a1-7732-49d8-b983-322f2ad649a1","resolution":{"observed_at":"2026-08-05T10:52:02.115858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-04T18:58:10.883059Z","title":"arXiv preprint arXiv:2502.02492","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09547","last_updated":"2025-09-11T15:39:27Z","snapshot_observed_at":"2026-08-13T08:12:56.660917Z","submitted_at":"2025-09-11T15:39:27Z","title":"Improving Video Diffusion Transformer Training by Multi-Feature Fusion and Alignment from Self-Supervised Vision Encoders","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T18:58:10.883059Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2509.09547"},"observation_digest":"sha256:3752af7b5681340fd9e5bd9651d4219b7196e380de12368c9349b31bb2994961","observation_id":"38f8dc10-0612-4b39-8cff-48529173ae1b","resolution":{"observed_at":"2026-08-04T18:58:10.883059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2510.02283","last_updated":"2025-10-02T17:55:42Z","snapshot_observed_at":"2026-08-13T04:00:21.942422Z","submitted_at":"2025-10-02T17:55:42Z","title":"Self-Forcing++: Towards Minute-Scale High-Quality Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T22:39:53.995700Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2510.02283"},"observation_digest":"sha256:6e1ebeceec4529ab03c57e78f1d7aadff05a21a2eff964edb5ef8054bee9603f","observation_id":"e2de9bea-2e30-4ed5-b17b-54075e236bf4","resolution":{"observed_at":"2026-05-15T22:39:54.294494Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2512.13030","last_updated":"2025-12-25T08:16:05Z","snapshot_observed_at":"2026-07-06T22:38:59.725645Z","submitted_at":"2025-12-15T06:58:40Z","title":"Motus: A Unified Latent Action World Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-12T18:44:36.636455Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2512.13030"},"observation_digest":"sha256:f387c3a1d6da88cde2586c21cea253a507f77667317433c4d064375a5daa256a","observation_id":"1af90540-05d7-4c30-ad29-e85fa9ad3195","resolution":{"observed_at":"2026-05-12T18:44:36.734675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-03T15:34:54.195615Z","title":"Videojam: Joint appearance-motion representations for en- hanced motion generation in video models.arXiv preprint arXiv:2502.02492, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.16636","last_updated":"2026-07-18T11:24:13Z","snapshot_observed_at":"2026-08-07T17:53:52.987639Z","submitted_at":"2025-12-18T15:10:42Z","title":"REGLUE Your Latents with Global and Local Semantics for Entangled Diffusion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T15:34:54.195615Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2512.16636"},"observation_digest":"sha256:9e86bd3bf728bb0043d3128e8eba24eb377f9c4337574d98b2a32293f4b92e08","observation_id":"0b855597-dbdd-4373-9433-b6114998bd80","resolution":{"observed_at":"2026-08-03T15:34:54.195615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-08-10T21:01:10.829067Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:46c0c7ceacbe93783ffb9183907693ba3795735ac2f7267d3f094d18042956c8","observation_id":"8d6fb0af-9848-4bb3-8cf2-efad3a500ad8","resolution":{"observed_at":"2026-05-16T13:47:57.542476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2601.16933","last_updated":"2026-04-02T21:40:04Z","snapshot_observed_at":"2026-08-12T19:47:29.426887Z","submitted_at":"2026-01-23T17:47:56Z","title":"Reward-Forcing: Autoregressive Video Generation with Reward Feedback","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T11:52:43.943226Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2601.16933"},"observation_digest":"sha256:3231f778f39537d9fabdf0b1be03a85668e69a1919f119b5fa49f100bc8548d4","observation_id":"b241a86c-5a20-4bb5-aeee-dda2a521b46d","resolution":{"observed_at":"2026-05-16T11:52:49.288157Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-03T01:20:04.762038Z","title":"Video- JAM: Joint appearance-motion representations for en- hanced motion generation in video models.arXiv preprint arXiv:2502.02492,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.10104","last_updated":"2026-05-26T06:14:19Z","snapshot_observed_at":"2026-08-13T10:58:17.398345Z","submitted_at":"2026-02-10T18:58:41Z","title":"Olaf-World: Orienting Latent Actions for Video World Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T01:20:04.762038Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2602.10104"},"observation_digest":"sha256:0ddf7ba2c49f407309462f413602809b8b2e9b48febf5d3b2fac2716bb7341ef","observation_id":"a5237902-803f-4c63-88f0-1a1ce5e7505b","resolution":{"observed_at":"2026-08-03T01:20:04.762038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2604.05961","last_updated":"2026-04-07T14:55:10Z","snapshot_observed_at":"2026-08-11T12:35:15.307153Z","submitted_at":"2026-04-07T14:55:10Z","title":"HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T20:22:02.186361Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2604.05961"},"observation_digest":"sha256:947a2f520dc75a3338118ed3020429a891af86125131bb54b82a9fb30167cfd0","observation_id":"feae8ad8-bf67-48e7-881c-dfd64b3de699","resolution":{"observed_at":"2026-05-10T22:00:48.155549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-08-11T10:13:44.152012Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:381ae889b7676a275e1515a2031d383603e48cc5a5e9e429a26e11ff96c1c180","observation_id":"7e30ce3f-34d1-4348-b70f-8a9c59eec9d9","resolution":{"observed_at":"2026-05-11T12:41:04.207907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2605.04515","last_updated":"2026-05-06T05:48:56Z","snapshot_observed_at":"2026-08-13T13:57:39.628935Z","submitted_at":"2026-05-06T05:48:56Z","title":"From Priors to Perception: Grounding Video-LLMs in Physical Reality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-08T17:41:23.233366Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2605.04515"},"observation_digest":"sha256:ff2fabfeabc8e5f8e2d20470e9299b1f9a876bb25da3b5bbd0b70df491430782","observation_id":"6109990c-7d5a-48fa-9cb1-1a0c1e99444d","resolution":{"observed_at":"2026-05-11T17:21:08.267707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2605.12587","last_updated":"2026-05-12T17:59:27Z","snapshot_observed_at":"2026-08-13T07:47:23.900604Z","submitted_at":"2026-05-12T17:59:27Z","title":"TrackCraft3R: Repurposing Video Diffusion Transformers for Dense 3D Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-14T21:28:12.151547Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2605.12587"},"observation_digest":"sha256:5a66168f477e1d8173e4c18d61e92de929176df11bfca8e6e3dd403d26c0ba3d","observation_id":"17d67360-8438-420c-bfa0-88bde63bf99f","resolution":{"observed_at":"2026-05-14T21:29:28.858619Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2605.14269","last_updated":"2026-05-14T02:12:13Z","snapshot_observed_at":"2026-08-12T21:12:55.835748Z","submitted_at":"2026-05-14T02:12:13Z","title":"PhyMotion: Structured 3D Motion Reward for Physics-Grounded Human Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:49:21.291716Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2605.14269"},"observation_digest":"sha256:5603608332a13a0e0d0b6ce29ab8e950d3c352f4533b66f7ce118c6fd301a135","observation_id":"df95399c-099d-4deb-a662-963f0d237a07","resolution":{"observed_at":"2026-05-15T02:49:41.385833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2605.23178","last_updated":"2026-05-22T02:56:34Z","snapshot_observed_at":"2026-08-01T22:25:10.209018Z","submitted_at":"2026-05-22T02:56:34Z","title":"Composing People Together: Iterative Pose-Image Generation for Multi-Person Interaction Scenes","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-25T05:07:14.227821Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2605.23178"},"observation_digest":"sha256:0ff854907f52e5b9663111fbd2fe339aa2422843d568de831b93d3965d1e2cd0","observation_id":"85714818-bb9f-4531-ab90-c05f19eef78c","resolution":{"observed_at":"2026-05-25T05:10:22.241236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2605.23878","last_updated":"2026-05-22T17:34:42Z","snapshot_observed_at":"2026-08-11T16:57:51.696511Z","submitted_at":"2026-05-22T17:34:42Z","title":"LaMo: Self-Supervised Latent Motion Priors for Physical Realism in Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T04:42:32.717968Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2605.23878"},"observation_digest":"sha256:155674e72d8cce28a2e8818279597d9f1e14b6cc05f166b133740cb287d51596","observation_id":"e1b303de-5490-4d8a-8431-4d70e41e240a","resolution":{"observed_at":"2026-05-25T04:45:20.469846Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2605.24962","last_updated":"2026-05-24T09:28:05Z","snapshot_observed_at":"2026-08-02T19:14:30.533296Z","submitted_at":"2026-05-24T09:28:05Z","title":"Tempered Self-Similarity Alignment for Physically Plausible Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T11:39:06.597513Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2605.24962"},"observation_digest":"sha256:b87dba54e52ce387a34ad95df8299725b2ee63263cfc03dabe2700bd8c9c01bf","observation_id":"6fbf81cd-6226-4dbd-bf60-a242f417d914","resolution":{"observed_at":"2026-06-30T11:44:38.411893Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2606.00499","last_updated":"2026-05-30T03:13:00Z","snapshot_observed_at":"2026-08-09T10:23:42.127989Z","submitted_at":"2026-05-30T03:13:00Z","title":"OptiWorld: Optimal Control for Video World Generation under Physical Constraints","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T19:02:51.848742Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2606.00499"},"observation_digest":"sha256:8d8ae1eadfcfa9eacf40c29b6e42f7ae7a93bb84f132891dc5c75d718155833d","observation_id":"5e1d9312-98de-4133-b35b-3fab77002416","resolution":{"observed_at":"2026-06-28T19:32:35.541970Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2606.02441","last_updated":"2026-06-01T16:12:18Z","snapshot_observed_at":"2026-08-08T05:56:53.706139Z","submitted_at":"2026-06-01T16:12:18Z","title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:22.778550Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2606.02441"},"observation_digest":"sha256:f2f96363b7582cac83a34e9686e27cc7f098c00bfa02c9d9aa37a9ac418832d4","observation_id":"96b52b38-a148-4b51-af97-2297a40c1add","resolution":{"observed_at":"2026-07-01T22:26:17.508999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2606.11969","last_updated":"2026-06-10T11:49:54Z","snapshot_observed_at":"2026-07-06T23:50:58.297354Z","submitted_at":"2026-06-10T11:49:54Z","title":"SpecLoR: Spectral Lookahead Rectification for Motion-Coherent Text-to-Video Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-27T10:00:35.608696Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2606.11969"},"observation_digest":"sha256:393e3620cec6e73737dbc7297891e64fb741f9de918d6663c0f77478fa053cea","observation_id":"2a65feb2-1926-42da-ad60-7c563ff866e8","resolution":{"observed_at":"2026-07-03T10:27:56.807908Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2606.15015","last_updated":"2026-06-18T06:53:24Z","snapshot_observed_at":"2026-07-06T23:52:28.557859Z","submitted_at":"2026-06-12T23:24:41Z","title":"NEXUS: Neural Energy Fields for Physically Consistent Contact-Rich 3D Object Dynamics","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-27T04:25:27.067362Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2606.15015"},"observation_digest":"sha256:8e7a2f814e37fcac963f8e3833c2d90db56a2d16a56aa7fe755888418385f9bf","observation_id":"5d54411b-d156-4d00-9759-015cd3cdd3d0","resolution":{"observed_at":"2026-07-03T17:18:43.391827Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":"2502.02492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-03T17:18:43.389947Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":"d22ef704-e6df-4caf-a9b3-f220ad768f8b","year":2025},"citing_paper":{"arxiv_id":"2606.29095","last_updated":"2026-06-27T21:23:40Z","snapshot_observed_at":"2026-08-05T10:31:17.568825Z","submitted_at":"2026-06-27T21:23:40Z","title":"HorizonRelight: Relighting Long-horizon Videos Consistently via Diffusion Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T09:24:04.427234Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2606.29095"},"observation_digest":"sha256:67f61f7807ae8459959f7de3ca3ea8f5d0b2d04994b5ffa96533dc786f134b5a","observation_id":"480316a2-93a5-4890-b86b-3749654d193a","resolution":{"observed_at":"2026-06-30T09:24:32.115411Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-13T01:59:43.167178Z","title":"arXiv preprint arXiv:2502.02492 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T01:59:43.167178Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:418c232a83098ac562ec21bdb62ad184cf7b5f908e4b39f5584ce6272e5878d4","observation_id":"2dc13058-177f-4fdd-9c28-8145f41e7066","resolution":{"observed_at":"2026-07-13T01:59:43.167178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-07-14T15:10:13.757131Z","title":"arXiv preprint arXiv:2502.02492 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T15:10:13.757131Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:f21344fd548bd9a297a700e849ed77af2a4995a345b5f524bf0862b349d49498","observation_id":"eb4a1a26-ee33-49dc-a82f-f77a0ff436c8","resolution":{"observed_at":"2026-07-14T15:10:13.757131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-02T07:35:22.332436Z","title":"arXiv preprint arXiv:2502.02492 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09581","last_updated":"2026-07-17T08:46:32Z","snapshot_observed_at":"2026-08-03T17:36:21.028438Z","submitted_at":"2026-07-10T16:30:29Z","title":"Wan-Dancer: A Hierarchical Framework for Minute-scale Coherent Music-to-Dance Generation","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T07:35:22.332436Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2607.09581"},"observation_digest":"sha256:02cdb3ca526093d8612048d6615c1e8014a0c011bd71c7f2999b1edbe42dc856","observation_id":"819d11f0-4f0b-48fd-a282-f70213438dfb","resolution":{"observed_at":"2026-08-02T07:35:22.332436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02492","snapshot_observed_at":"2026-08-06T11:59:28.004817Z","title":"arXiv preprint arXiv:2502.02492 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04996","last_updated":"2026-08-05T16:04:23Z","snapshot_observed_at":"2026-08-12T02:03:36.464752Z","submitted_at":"2026-08-05T16:04:23Z","title":"DreamWAM: Beyond RGB Future Prediction for World Action Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:59:28.004817Z"},"links":{"cited_paper":"/paper/2502.02492","citing_paper":"/paper/2608.04996"},"observation_digest":"sha256:df477407b972933131cf265e918d40a3c5aa630ff5afc13791ed106661919680","observation_id":"be199bd7-a337-4f11-a865-fa77c59a3271","resolution":{"observed_at":"2026-08-06T11:59:28.004817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.02492/citation-record","integrity":"/paper/2502.02492/integrity","json":"/paper/2502.02492/citation-record.json","paper":"/paper/2502.02492"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:46.955949Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:46.955949Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:d1e45c0516cb276a636619557886faea5c9946f1b771a3324398aa65d7dd784a","observation_id":"bb2fc609-8a88-4ff2-8ce5-9f40dc1f3ad7","resolution":{"observed_at":"2026-08-09T12:04:46.955949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:46.965726Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:46.965726Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:07d70ac689fd16f58eb39f20556d1657b40430d19b20d674f19995d06945a748","observation_id":"3b54b379-bdad-499d-bb19-005e50082bb9","resolution":{"observed_at":"2026-08-09T12:04:46.965726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08477","last_updated":"2023-04-18T03:27:52Z","snapshot_observed_at":"2026-08-13T12:00:44.249968Z","submitted_at":"2023-04-17T17:57:06Z","title":"Latent-Shift: Latent Diffusion with Temporal Shift for Efficient Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08477","snapshot_observed_at":"2026-08-09T12:04:46.973669Z","title":"Latent-Shift : Latent diffusion with temporal shift for efficient text-to-video generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:46.973669Z"},"links":{"cited_paper":"/paper/2304.08477","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:f2d162d9941e87460005dd6987703395d46e604986c809eb1db34f0b2d3b8f40","observation_id":"b3fd3627-3c77-41da-982a-ef8173818147","resolution":{"observed_at":"2026-08-09T12:04:46.973669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-13T04:36:44.594755Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-09T12:04:46.982926Z","title":"Lumiere: A space-time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:46.982926Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:058815e39e6740815b7da5d30c44d6f3117b175178dea6bedf691fb25a653c4b","observation_id":"20ae7674-3293-4492-952c-a667b5745596","resolution":{"observed_at":"2026-08-09T12:04:46.982926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.724451Z","title":"FLUX , 2024","venue":null,"work_id":"1b5871fa-efbc-40d2-9476-5ac3de6d2616","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:46.990934Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:4240f070678dbdc0eac2ef936b3af93a12512e64ff886560368331f702c7eadb","observation_id":"6fc56778-e1f4-4097-9f39-c269b6c784d0","resolution":{"observed_at":"2026-08-09T12:04:48.731711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-09T12:04:46.998289Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:46.998289Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:1092bf5ea5b79d7301db6908fe6cd7ab21ef7e7a7332e79336d826956bfc2c25","observation_id":"0e6ff5d8-b059-49b1-841d-617ded0a920d","resolution":{"observed_at":"2026-08-09T12:04:46.998289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.699688Z","title":"W., Fidler, S., and Kreis, K","venue":null,"work_id":"cb041518-87f9-40e7-92e3-2e423d3fa9ef","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.005852Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:5e87b529914771c738b3a574a54ea7bc76ef0c84a44028f3720a586ca9dd0156","observation_id":"1e97bc72-4b71-4d3e-8980-5c0f012ab992","resolution":{"observed_at":"2026-08-09T12:04:48.705637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.679696Z","title":null,"venue":null,"work_id":"e63222e2-619d-414a-90c8-71c55b061692","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.012846Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:b6268ad417f613358901bebfb447a858c54bfde1c7fdc155bdb3e20b80c2898a","observation_id":"e9bce902-5ef0-48d9-a70a-da36699859a4","resolution":{"observed_at":"2026-08-09T12:04:48.685580Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:47.020437Z","title":"Video generation models as world simulators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.020437Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:d4e9a34ee341279815c559f8f10ba0d9d1f68b9d1239d6da18d76300446f5c81","observation_id":"00c48ed4-15f6-4282-a5d7-53efe0339952","resolution":{"observed_at":"2026-08-09T12:04:47.020437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.647070Z","title":"The hidden language of diffusion models","venue":null,"work_id":"5703f6cd-c1ba-4733-9d32-ef2cfeebf853","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.031598Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:e1e21c082ab4778194413d4d2d9395cb6c4c6db94524903a62f3a29570ce7779","observation_id":"b11d7e93-109e-4b49-823f-d1063822c9a0","resolution":{"observed_at":"2026-08-09T12:04:48.652827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08674","last_updated":"2024-07-11T17:06:53Z","snapshot_observed_at":"2026-08-13T11:17:53.242157Z","submitted_at":"2024-07-11T17:06:53Z","title":"Still-Moving: Customized Video Generation without Customized Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08674","snapshot_observed_at":"2026-08-09T12:04:47.038836Z","title":"Still-moving: Customized video generation without customized video data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.038836Z"},"links":{"cited_paper":"/paper/2407.08674","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:57406a41b690f0e678d2ffa28fb7257f2a5cc28511f771c2f076b13f54c5ba02","observation_id":"c8df70af-e99a-4a45-b005-41b3576f1b01","resolution":{"observed_at":"2026-08-09T12:04:47.038836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05922","last_updated":"2024-02-29T21:06:58Z","snapshot_observed_at":"2026-08-13T05:53:39.537622Z","submitted_at":"2023-10-09T17:59:53Z","title":"FLATTEN: optical FLow-guided ATTENtion for consistent text-to-video editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05922","snapshot_observed_at":"2026-08-09T12:04:47.045946Z","title":"Flatten: optical flow-guided attention for consistent text-to-video editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.045946Z"},"links":{"cited_paper":"/paper/2310.05922","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:b1e754393945927749fec567b0332032cb574481b24ed39dcf7ae9372981074b","observation_id":"c7b0eaa4-99aa-4dd1-b524-df3d3eb0f7d8","resolution":{"observed_at":"2026-08-09T12:04:47.045946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-13T10:03:45.960823Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-09T12:04:47.053445Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.053445Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:5d36dcf8fa24e90fed7751391e51042927a6d1e392f5693be168b244f4404e73","observation_id":"9b813077-7f04-4bf5-b216-b3b651c9f26a","resolution":{"observed_at":"2026-08-09T12:04:47.053445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.05233","snapshot_observed_at":"2026-08-09T12:04:47.062406Z","title":"and Nichol, A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.062406Z"},"links":{"cited_paper":"/paper/2105.05233","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:4515a75a5b3f2dee448b99e285018cd2fa1b28611a060ac59bc21dbb9d2427a4","observation_id":"c92ee6ee-8c57-42d4-b1f2-2cdbaca38738","resolution":{"observed_at":"2026-08-09T12:04:47.062406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.01618","last_updated":"2022-08-02T17:50:36Z","snapshot_observed_at":"2026-08-02T23:40:32.342515Z","submitted_at":"2022-08-02T17:50:36Z","title":"An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.01618","snapshot_observed_at":"2026-08-09T12:04:47.069229Z","title":"H., Chechik, G., and Cohen-Or, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.069229Z"},"links":{"cited_paper":"/paper/2208.01618","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:6af15c776d10e37ff9448703c7e6d8b0b1a1c026db2006ec4441a3b3cdb662c6","observation_id":"a9690037-55bb-4b8e-8a0a-34d7ee51fc23","resolution":{"observed_at":"2026-08-09T12:04:47.069229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.627910Z","title":"Motion prompting: Controlling video generation with motion trajectories, 2024","venue":null,"work_id":"f73f6b20-1f65-4685-aeba-77e4c3df94ee","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.076608Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:06f2c1b53d923a9d622ad8b3ebbe4383e9a5fa0f04f666d03a84a4da90731027","observation_id":"5802ce2b-5c00-4135-aaa4-ef23014dfc7a","resolution":{"observed_at":"2026-08-09T12:04:48.634312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.608682Z","title":null,"venue":null,"work_id":"5c042337-db8e-4567-9158-53d57132b87b","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.082935Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:55a7bd72c736b1c2d58b09011fcaecddf15c726cfd0301fa21a84c1e1e15776b","observation_id":"462eb414-94be-4d97-a5f6-0265445f844f","resolution":{"observed_at":"2026-08-09T12:04:48.614770Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.587245Z","title":"S., Shah, A., Yin, X., Parikh, D., and Misra, I","venue":null,"work_id":"605b5a05-7964-463d-aa58-261136ed35d6","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.089154Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:24cdf51aae7b78e20d832b3f7bfda71813dc80e8cfb17bf23ffe1791adf92fbf","observation_id":"0410430b-8358-4279-bfd1-a170355415da","resolution":{"observed_at":"2026-08-09T12:04:48.593746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-08-12T14:50:50.360929Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-09T12:04:47.102846Z","title":"AnimateDiff : Animate your personalized text-to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.102846Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:48a0865db81c43fdab847c5108a9ab8beae3f83ee9ebec34e779dab370350dd4","observation_id":"c19d4bc7-9270-48c2-b27d-4dd49618a665","resolution":{"observed_at":"2026-08-09T12:04:47.102846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00103","last_updated":"2024-12-30T19:00:25Z","snapshot_observed_at":"2026-07-06T20:14:54.297131Z","submitted_at":"2024-12-30T19:00:25Z","title":"LTX-Video: Realtime Video Latent Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00103","snapshot_observed_at":"2026-08-09T12:04:47.109845Z","title":"Ltx-video: Realtime video latent diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.109845Z"},"links":{"cited_paper":"/paper/2501.00103","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:7c7854d66f160943420da1acec3126c571ea935e2f5889c6ca7eb184363954e6","observation_id":"be521d57-e6eb-4338-be8a-ce4316659fd5","resolution":{"observed_at":"2026-08-09T12:04:47.109845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-12T19:28:23.372660Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-09T12:04:47.117338Z","title":"and Salimans, T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.117338Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:4ed5a00a8d8b3b1f28619b6d85403ec9804e704ab2125d1445f8732ce9ba4864","observation_id":"886536c6-0bdb-44ae-9568-19d34c0669f9","resolution":{"observed_at":"2026-08-09T12:04:47.117338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:47.124758Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.124758Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:cd542d0c9579d1dc71d75eb80f87446d356dfcaef22a945cc0a64746573e7615","observation_id":"0f8b8cf5-c4e6-4738-ab4c-f8674d54989d","resolution":{"observed_at":"2026-08-09T12:04:47.124758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-09T12:04:47.137721Z","title":"P., Poole, B., Norouzi, M., Fleet, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.137721Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:44b040eb344411387ff8f342705344177caf12474801b10492ba7f97aa0e7212","observation_id":"0fc08a37-7298-4ac8-a968-fc873aaa90a3","resolution":{"observed_at":"2026-08-09T12:04:47.137721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15868","last_updated":"2022-05-29T19:02:15Z","snapshot_observed_at":"2026-08-12T19:21:15.526321Z","submitted_at":"2022-05-29T19:02:15Z","title":"CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15868","snapshot_observed_at":"2026-08-09T12:04:47.144778Z","title":"Cogvideo: Large-scale pretraining for text-to-video generation via transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.144778Z"},"links":{"cited_paper":"/paper/2205.15868","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:0544c76cc32af83c0c7f6f9ec74bc570ffb7429756828e42611424f452337b75","observation_id":"b0b13fc9-5d76-49f8-b1d9-fdcd9f4291c7","resolution":{"observed_at":"2026-08-09T12:04:47.144778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.530527Z","title":"VBench : Comprehensive benchmark suite for video generative models","venue":null,"work_id":"cbb82067-58c8-402d-b2fa-b7b1bea5d9ee","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.151679Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:612784d0aa321bf356e0cdc1aadfd671e23778a4deae79d5735e41138ea9893f","observation_id":"c31c91d1-ba7b-480c-947c-a1554dde9248","resolution":{"observed_at":"2026-08-09T12:04:48.537112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.508326Z","title":"Pyramidal flow matching for efficient video generative modeling, 2024 a","venue":null,"work_id":"22410279-9e6c-44fe-a942-f501f90a2fb8","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.157464Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:d87959fa3e6269761ecd56db2c5b64b59455f4586ac8947417036c4eba815f3d","observation_id":"09de8e98-60fe-4c79-b13a-4608e640291c","resolution":{"observed_at":"2026-08-09T12:04:48.517911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.487740Z","title":"Video-lavit: Unified video-language pre-training with decoupled visual-motional tokenization","venue":null,"work_id":"38af7011-34ab-4533-9edb-6c101ba56985","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.163568Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:bd98940f4a7964c38bad9c4c26f52076818169ddec89a0d7c9e9e029d27f272b","observation_id":"7c0fc3d1-122b-444c-a288-31572fa68350","resolution":{"observed_at":"2026-08-09T12:04:48.493106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.468298Z","title":"How far is video generation from world model: A physical law perspective, 2024","venue":null,"work_id":"bb54ac23-51ca-4ebc-9b9d-04e93e5c5e16","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.170092Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:aa69b565f21389958d88a43ab9a8d319c13bf56a972e1427bae440386dd338ea","observation_id":"e4639c7f-dfac-475d-9c2e-ab49c6876d3a","resolution":{"observed_at":"2026-08-09T12:04:48.474814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.446359Z","title":"Kling AI , 2024","venue":null,"work_id":"b24e08d5-b1fd-4593-b65a-c5475ac917bd","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.182859Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:861fdba1ce0e7bbf4f688d8808e063dc15801605d65fcb4056f6e5b491753e07","observation_id":"053c16d2-de68-4394-8ecb-67bed69fee26","resolution":{"observed_at":"2026-08-09T12:04:48.452135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.427007Z","title":null,"venue":null,"work_id":"b2dde203-a77d-4d91-80e8-3cb03ac220b0","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.189116Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:b31f308b50587ca963784cd8a7e3cd0184c92b2998586e82c1e5af64a9e67448","observation_id":"8905310e-95d7-464a-896a-19c5a7fbfadc","resolution":{"observed_at":"2026-08-09T12:04:48.433408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01714","last_updated":"2023-01-17T17:08:51Z","snapshot_observed_at":"2026-08-13T15:30:23.443579Z","submitted_at":"2022-06-03T17:47:04Z","title":"Compositional Visual Generation with Composable Diffusion Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01714","snapshot_observed_at":"2026-08-09T12:04:47.195759Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.195759Z"},"links":{"cited_paper":"/paper/2206.01714","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:a363e80362b5106da694d164e0f49c939ff5a8debe45a7d5c4d606e98f82d8b2","observation_id":"2987bede-615a-42d4-961b-8fbf7cedf034","resolution":{"observed_at":"2026-08-09T12:04:47.195759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.402555Z","title":"Physgen: Rigid-body physics-grounded image-to-video generation","venue":null,"work_id":"c0d8f89b-0bc6-4e1b-a088-4c1435c6cfca","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.202883Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:a18a925990fa3c113a01147d6243f662bb7d8acb9840996679a97ad6307c944b","observation_id":"38d61803-4c6c-487b-81f4-5287cdb3ea3c","resolution":{"observed_at":"2026-08-09T12:04:48.410728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08579","last_updated":"2024-03-15T02:02:21Z","snapshot_observed_at":"2026-08-13T05:50:23.555710Z","submitted_at":"2023-10-12T17:59:34Z","title":"HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08579","snapshot_observed_at":"2026-08-09T12:04:47.210037Z","title":"Hyperhuman: Hyper-realistic human generation with latent structural diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.210037Z"},"links":{"cited_paper":"/paper/2310.08579","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:0e37f73a451ec7f6a0cff498c37ee11fe03ba77d4801a55997ab1e7a458b92f2","observation_id":"9ffc3dfe-8fb2-4db8-86d8-2563d60760aa","resolution":{"observed_at":"2026-08-09T12:04:47.210037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.379832Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models, 2024 b","venue":null,"work_id":"f18811b8-29c1-479d-81d4-8a64f73e5380","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.217395Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:ecaca1852dd91321103a2a34a119a560abc4c05c794968924223c00c0aa2393b","observation_id":"8a81af78-bd11-479b-8c02-c890c89495bb","resolution":{"observed_at":"2026-08-09T12:04:48.387761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.356381Z","title":"K., Lewis, J","venue":null,"work_id":"5cb700af-478f-4e3f-89f2-36f5289d0323","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.224980Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:db516f76897ec611aa934266c1e823338a9e47bec3b3f0bc730165f85df50428","observation_id":"6cf3b0bc-69a1-4c8f-b36e-cdb42c97fcdb","resolution":{"observed_at":"2026-08-09T12:04:48.362582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.324167Z","title":"SDEdit : Guided image synthesis and editing with stochastic differential equations","venue":null,"work_id":"474a18c8-71da-4e13-913b-78132189f16c","year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.231751Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:887ed81d87c832f61b1835b5182f28cb88ab9611dfeb87ba09e7aaed3d1bc13e","observation_id":"3284c59f-af94-4184-ab4a-99fdd23085b9","resolution":{"observed_at":"2026-08-09T12:04:48.338774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.297937Z","title":"Motioncraft: Physics-based zero-shot video generation","venue":null,"work_id":"6ea95bf8-f638-4990-a80b-0f238e4ed993","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.239604Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:bc754631a52970556e125937860e73a7b7ade9651aea81a9a3c3eaea1c9f9b22","observation_id":"15175173-fb54-4991-95fd-78223bc2ae7e","resolution":{"observed_at":"2026-08-09T12:04:48.304086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.276651Z","title":"Dall-E 3 , 2024","venue":null,"work_id":"4df05c80-14ef-448c-811f-61e75095762e","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.248404Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:8f546ada88bca9536e9ee3bf394d140d2f5c7e365273a3f37c3f08991db3040d","observation_id":"b42784c2-2786-44d7-8846-830f7ee23092","resolution":{"observed_at":"2026-08-09T12:04:48.282485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.254953Z","title":"and Xie, S","venue":null,"work_id":"03f36eb8-75ee-4457-81a8-11326649e127","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.258880Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:a2e7c3214e8f81aaa07d1b3307a2ddfabf2ce87b1d566daf6d31c46226aac889","observation_id":"6837dce2-b85b-4ccc-99a3-f563cb951282","resolution":{"observed_at":"2026-08-09T12:04:48.261801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.231560Z","title":"K., Zhang, P., Vajda, P., Duval, Q., Girdhar, R., Sumbaly, R., Rambhatla, S","venue":null,"work_id":"25576574-2f31-4eb2-b6e1-a94485fa3c56","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.267406Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:53ab157df24ade26aec7b940852e1a93f3b79e1ecdaa17088a5b6b07d0309408","observation_id":"6a24c95c-e5d0-48b4-9362-644121881fda","resolution":{"observed_at":"2026-08-09T12:04:48.238350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.212262Z","title":"Hierarchical spatio-temporal decoupling for text-to-video generation, 2023","venue":null,"work_id":"4f4a55f1-ab7f-418a-8bc2-b4eb0332f9f6","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.277593Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:822fd5f8ea900481033d74cf5aadaf4bf867670f29414a2667e00003a4fd993e","observation_id":"95fc7424-e68e-4e7b-ae4d-9a6ddb5f337d","resolution":{"observed_at":"2026-08-09T12:04:48.218282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:47.285025Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.285025Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:30c05ef9f65c4c25b0917a356dbdc1b2fd223ef983dba8f359307e42c38a8733","observation_id":"d528d5f8-aa23-4da5-bab4-9eaedcc3b43d","resolution":{"observed_at":"2026-08-09T12:04:47.285025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.178501Z","title":"Enhancing motion in text-to-video generation with decomposed encoding and conditioning, 2024","venue":null,"work_id":"8e7af50f-2c19-4e89-831d-06cc53859ee9","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.292878Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:09dbaacd4164819958cdcfb2d761e328da4bf9f191066414e4be34b816a1c52a","observation_id":"185e09bf-0d55-4417-8560-1237961dad62","resolution":{"observed_at":"2026-08-09T12:04:48.184817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.159521Z","title":"DreamBooth : Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":"1815aa68-03a0-4cac-8d41-11642d416204","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.299580Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:6f72df1d96c5e0418a47d524e1de9654f42816209422efec2def1702d268543c","observation_id":"faf01b81-852b-4b01-9ed1-9ee4d869b5a8","resolution":{"observed_at":"2026-08-09T12:04:48.165218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.140895Z","title":"Gen-3 Alpha , 2024","venue":null,"work_id":"1a0965d9-56b4-4712-9374-0b823bf50f25","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.307142Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:9c6e9cb9c31d84e60aa1b7272aef2b9b22d8b7e9b4abf0b90abd52291dfd3eac","observation_id":"6d07b195-a7f5-4c05-a50b-6954504c5d32","resolution":{"observed_at":"2026-08-09T12:04:48.145960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i5.28277","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Decouple content and motion for conditional image-to-video generation","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"d22ea2fb-2172-407a-a900-74566108f162","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.313539Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:2e2282a3c3ad3e1a6547cd7548ca3d753d753475e684c0cf87ab64c7740d40f1","observation_id":"c07ad25f-1522-46f4-b83b-7d1a27265bff","resolution":{"observed_at":"2026-08-09T12:04:47.449872Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.119941Z","title":"C., See, S., Qin, H., Dai, J., and Li, H","venue":null,"work_id":"a1fde258-a899-45fc-81c4-d76b63c4954e","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.320663Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:95c14eaa4015a61e69e26f36bf4d0e0a65b9fb1f002d9acc2daaf546b54db345","observation_id":"8f39b790-6f7a-422b-8b89-4ebaf84d6829","resolution":{"observed_at":"2026-08-09T12:04:48.126001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.100938Z","title":"Make-A-Video : Text-to-video generation without text-video data","venue":null,"work_id":"ea8e6593-1f78-42e4-b87c-73b81f0a997e","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.327444Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:9db5108e43a31ccb05ff35123ad2fe600ec8e9061ee7b68fca75b121bf9f3c32","observation_id":"2f689545-a1a7-49e8-9b73-7538fd782d5e","resolution":{"observed_at":"2026-08-09T12:04:48.107102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05131","last_updated":"2023-02-28T17:20:36Z","snapshot_observed_at":"2026-08-13T15:46:52.114825Z","submitted_at":"2022-05-10T19:32:20Z","title":"UL2: Unifying Language Learning Paradigms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05131","snapshot_observed_at":"2026-08-09T12:04:47.336723Z","title":"Q., Garcia, X., Wei, J., Wang, X., Chung, H","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.336723Z"},"links":{"cited_paper":"/paper/2205.05131","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:0cdccac76df0c4bb70de14022c635c209f643592e756e8d101f3967d03d93fdd","observation_id":"1727dd0f-d530-4044-8fe9-fed7c92c0a7f","resolution":{"observed_at":"2026-08-09T12:04:47.336723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.082735Z","title":"and Deng, J","venue":null,"work_id":"24f5dea0-a41c-44fb-9c54-b0e555031736","year":2020},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.344122Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:4453b2abb70d1faf5cfe652035d2b6895ac44affcfa13a850dc2343be1c6a723","observation_id":"c1a8b496-3a6c-42aa-8748-c751e71c2ecf","resolution":{"observed_at":"2026-08-09T12:04:48.087835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.065379Z","title":"MoCoGAN : Decomposing motion and content for video generation","venue":null,"work_id":"66cd5f6f-bab0-4687-b4ca-44748a4fbbc1","year":2018},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.350819Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:bb2e5e4c2b1336b5d135747baca2db1f169c670ad6c36c22ae094026948d15ae","observation_id":"5f4f0caa-2d7f-4bc1-bdb7-33721262f9c5","resolution":{"observed_at":"2026-08-09T12:04:48.070826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-10T01:52:30.999213Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-09T12:04:47.359552Z","title":"ModelScope text-to-video technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.359552Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:102be3f2b504eae75015566a2fe9b6ece8b748ce14c22a103523615e6538ee4b","observation_id":"d3275e23-66b0-4ff6-8e8b-84d242941f6c","resolution":{"observed_at":"2026-08-09T12:04:47.359552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.042521Z","title":"Motif: Making text count in image animation with motion focal loss, 2024","venue":null,"work_id":"8e156b13-52e0-44a0-999f-2500642753fc","year":2024},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.368235Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:208b1cea5178a2e50832abf6edc789ce0a8febe1de8b646d37906a337b98016c","observation_id":"013abcbc-723c-424e-b43b-44ae7e72fdce","resolution":{"observed_at":"2026-08-09T12:04:48.049634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:48.021268Z","title":"Z., Ge, Y., Wang, X., Lei, S","venue":null,"work_id":"3f2be0e2-b92d-4111-9378-d89f5e4dd6f9","year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.375593Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:2a0e798f2f49ccccbb405c18634cc3d17e48c4aa1c08232cd354ecdef34031e8","observation_id":"7394f5d3-49a2-497e-aff7-3604e1924e09","resolution":{"observed_at":"2026-08-09T12:04:48.027826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-09T12:04:47.381741Z","title":"E., Huang, P.-Y., Howes, R., Sharma, V., Li, S.-W., Ghosh, G., Zettlemoyer, L., and Feichtenhofer, C","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.381741Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:0f291834da6954a5fa8b497a874960ba2e6e783f6108b25ad8f5c100a2bc66f8","observation_id":"3104c1c0-3a9a-4f8d-905e-c33383543a60","resolution":{"observed_at":"2026-08-09T12:04:47.381741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T12:04:47.998918Z","title":"ByT5 : Towards a token-free future with pre-trained byte-to-byte models","venue":null,"work_id":"1ccdd0a4-42f1-4ff9-9e08-bd74500caf6c","year":2022},"citing_paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-09T12:04:47.390095Z"},"links":{"citing_paper":"/paper/2502.02492"},"observation_digest":"sha256:11b22508ebece3b2c8d7d867bec9a2b2b14ad995e171087343fca39165895c37","observation_id":"da6c45d6-f6a4-4101-912f-577d24941d56","resolution":{"observed_at":"2026-08-09T12:04:48.007015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.02492","last_updated":"2025-05-26T13:56:07Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T19:22:13.983936Z","submitted_at":"2025-02-04T17:07:10Z","title":"VideoJAM: Joint Appearance-Motion Representations for Enhanced Motion Generation in Video Models"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 30 inbound Pith citation observations for arXiv:2502.02492."}