{"as_of":"2026-08-05T19:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:be76ba2631d8b87e0363a6c211d9a8859a320c9ef111da472ab123e875bd0e8a","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T15:44:22.210969Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04653/citation-record","integrity":"/paper/2607.04653/integrity","json":"/paper/2607.04653/citation-record.json","paper":"/paper/2607.04653"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:74bd99a9907590926a89350d0cbefc935c7d5ea37720f12db9fbc29a6087df50","observation_id":"ada1fea7-e61a-4f8a-a560-68dd81f6e637","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:5d759348ee3671f233b1ac2f55d99b8714871f517f987da61c26d972fab3693c","observation_id":"54ec2e56-e4d5-43f1-8ef1-362116af8d38","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Bansal, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:7bb25b9581334cf879c0050d5c007de185418316be45121d1cbc82a4d0836444","observation_id":"cfc299ef-5036-42c6-bd46-6c3149b2484a","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Bansal, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:3ecef7becbf56d0eaf277c33627e7c37cfc84222b49a76c9b7a890a178f80d39","observation_id":"a5762389-97ad-4505-b1b6-065f9bd23b23","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Bar-Tal, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:17363eb796bea429226b9ce107dd44a756c5bcfd4ada8bbf29f0364c286d11c5","observation_id":"b70d1d2f-e58e-4635-ac32-c1f985951772","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Blattmann, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:06a022cd05aaba5c449e4f2c8672e8490289ae0b2c28ec3659a9f7e14f0783cb","observation_id":"99eebefa-18db-4177-b20a-f6435231aba9","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Blattmann, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:e9ba612d84858ea44b6692a383c86c9dd4af7c8391628d8fd6ea5eb72bf69acf","observation_id":"04b0a714-e6d7-46d6-90a0-5ad8939948f1","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Carion, L","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:52e765876d0223deaf7260aca064dff1f58250935536fc8efdd9769699561e23","observation_id":"00822fb2-541a-4908-bccd-1086ee2b8b0b","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Chefer, U","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:8eb7dbe6fc97fa38923ef1e1f83d39269fe4569fccea7812eb207c658528eb09","observation_id":"ab5639db-b443-4887-abd3-d926ecd4dd82","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:f62390444ee6a64e7df5d0fea24d950c014a9f0940e5e2b30ff7c9b13b146f88","observation_id":"a78b62ac-cda4-4fd4-88bb-2dffbce55803","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.13154","last_updated":"2025-08-18T17:59:55Z","snapshot_observed_at":"2026-08-05T19:05:58.130153Z","submitted_at":"2025-08-18T17:59:55Z","title":"4DNeX: Feed-Forward 4D Generative Modeling Made Easy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.13154","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2508.13154","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:6ab1f1f8cdc2d512d89e872e350d6698e33883693f739ef1fc77b53a6c729ac1","observation_id":"d53fd167-0a14-4b90-8bda-ec30895f7aaa","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14169","last_updated":"2025-03-02T08:09:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:59:53Z","title":"Autoregressive Video Generation without Vector Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14169","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2412.14169","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:6884fdaebe79b7dd443b7fb239e8b358ea829d9fcadac3ac4f04dd7bf6a0226f","observation_id":"1c05b8ef-2299-482d-bd1b-e20af8af78c4","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:de0305a7bde078d437a94e9caab1ce90ba4f057bfccb4cf3bba634eba6b57446","observation_id":"bfdc8e3b-737d-41b4-96fd-ef86f367c809","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:ef4f9e2fe8b7d32702b153b0d72ac61bd782f8c299250db8e8e3575b7e4b998c","observation_id":"fb04519f-7816-4402-a88e-eed49295fdd6","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:f3f53a7e9808e7d986835418dc1cb90d3e68fc7a717da5d0919d1d8b32f603b1","observation_id":"d3a16d59-13fd-4f4e-8706-0c54ee1138f3","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Ho and T","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:bd3d313a7856fd088bc00a422047b711c3be0bdba5f1084cea803efecd6171c1","observation_id":"64d7a955-3c46-484e-a9f8-ea480421073a","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03458","last_updated":"2022-06-22T20:22:29Z","snapshot_observed_at":"2026-07-06T12:57:51.108636Z","submitted_at":"2022-04-07T14:08:02Z","title":"Video Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03458","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2204.03458","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:869d4435f5057610121c030816bd70f5bc9fb77e5e3af711382c727881cef419","observation_id":"e8d97aeb-43de-49ef-b86c-b727757bd084","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:b9a543a6f4aa31a5ae01f4e91285a3796f3168ce9d91297ab097de500a39372a","observation_id":"1155384a-3526-42a5-ad69-f285cc5091d2","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Huang, Y","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:dc3abd13fda895b1736d9fabb975047cedcb104fd6d74c1eefac8540b7515ee1","observation_id":"340a2c45-cbf6-4dd2-89af-8f70bbaa9455","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Huang, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:2dd8391cdbec36c257178de6a7e71deeba4c20cce0451c3f2163e036be7e8a50","observation_id":"773c5cc9-78b7-475c-aadb-fb3cf478ae77","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:3b52e4609d35023fa23a231619f2ffd5cd67f1cd3541d32ddcc321778b54e509","observation_id":"e0f59501-c98e-43fc-a87d-552675db88f1","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Karras, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:e01e003191ba221af50690443802867a3b31e5b6aa605026022b1d0cab816fb6","observation_id":"a6d75e15-b3ad-4ffc-b890-cde2de325222","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:c78c70b6b01992ed9b12171d3ff81c712e8783c90e9f80ccf3994069cd7fae17","observation_id":"0858ab41-3b08-463b-b531-3ecbbdcd1093","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:52ec4b857c39de668a62833e5c29f7e63be631839a8db8c247d95a9183c3a214","observation_id":"3aac3edf-2356-4e02-8fbc-131764494162","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Lipman, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:b93c5b00b6c96bb87ac282c570400b4a9ea4577d9fabeb61292f2a08888c9369","observation_id":"1e97ecef-ad08-4527-bf1f-464be5b22e89","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:335f09f5de2072b8f42c99ea8f68231315c3ee4cc2ce463ad18331684f94df34","observation_id":"7415a29f-73f6-4bef-b5c8-99211c5ec6a5","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:47886b4f6b30a2f589092c0ae59215dd2c3f7e925e46e942aa02e25ed59f1f37","observation_id":"22375cb1-2c1f-4212-ba14-a5c283b31c22","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Long, Y .-C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:8fcea65ce94aed02220709b706c5c6ca8aadb1561d8c0cee5c1e4c4624e99af5","observation_id":"b05ee205-0565-45fc-bb36-b64a860c92f7","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:6a68bc323783aefbf62737d41636af0d9a3ef5699b64a2cbe11d8a6cedff4343","observation_id":"8a882dd4-3be7-4131-a874-1182ad851332","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:62cd5919382bbd8dec7f66d3fb9246f696f721f38504ea1a7dde0a01c454fd09","observation_id":"457f77ff-4a8d-48f3-ae7d-5a78b02a422a","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:cc1976a3cf5fa6654ffc7731a9d25bc117fee5d33fbff6e2a0a9f9288dba0036","observation_id":"8b6fa119-8f32-432b-91ed-eb5a028b1470","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Motamed, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:ad469c882178be20bcdd4f55e2f6d0b19cd065cd73ad0c9a1d0141feea4f6b7f","observation_id":"35afc950-5ffa-4143-abe2-e0af652eea74","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:dd7c3766c8dc12216dda120144f89994464ea4f053e2c5d7d45b79727f3df942","observation_id":"5c0b205e-7313-4fd0-bc6d-52a1ca2628f9","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Rombach, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:a9d058c83e07686a1992f899e11ab927b6c9234465c0ddc7abfcebd16be6ed80","observation_id":"f8a5d775-8088-4105-8dba-1aee779036a7","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Singer, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:60aab4ee335b334682e8021511c69c538e151f09b55b31953e0abc16f1821fd2","observation_id":"768da2cd-e5e8-436a-9018-e2c0818fa403","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Teed and J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:1aae67c93355bcfd192bd427032530c77d4410ed58aca39ec0fad1375f259fa5","observation_id":"a77e8402-0176-4d76-83b1-d6bfcbf62864","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:6afe3b11ba93fe2a7f1b0dcbbdd300599ab72f03c6c3858e233724eb457a0a4a","observation_id":"5aec5d28-8c18-45f9-8371-261dd590862b","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:6c2b84eb00b6c55e3b6fb2264deabdfd2eaf0b925f3b71b84727b73878802484","observation_id":"9b2d2631-36c4-4d52-8e9f-6edade3b1691","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:10020c573bfc2af739bef084a57824f324813ce29e98f3039cbb3acf0a47ad35","observation_id":"1e75cbee-5c04-455c-9331-041663879ddc","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:4d81935046d7048e89c9fda213512300087d441fa09c9ee70cbd9aac1ac14c4a","observation_id":"ab92e407-c932-49ed-98c6-9f37b46ef1b7","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:d17a98b46ddffafb7360c207c8801b3200212070ec6640fa3e394c70fc0ef4d9","observation_id":"5720eb93-b3f2-4bee-95ca-5f935e2713a1","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:b0fe570835ce3061063b214e43fa7e55ec3dce23f385576ef700bfefdbd88a86","observation_id":"1d7e52e5-803b-4d3f-befe-605e2969a50d","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23656","last_updated":"2025-05-29T17:06:44Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T17:06:44Z","title":"VideoREPA: Learning Physics for Video Generation through Relational Alignment with Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23656","snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Limitations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"cited_paper":"/paper/2505.23656","citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:3c064eb5971941a37ee1aabab6b53332efb18a6b4dd2cfacfc866083ac407c1a","observation_id":"6d6d83d4-61b0-4f0e-a988-27a6bc4da859","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T15:44:22.210969Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T15:44:22.210969Z"},"links":{"citing_paper":"/paper/2607.04653"},"observation_digest":"sha256:aea1bd2ffb51b286f1cee53d4c4186b4716572d387675f4dda61c1f97a566516","observation_id":"8a780c2c-0983-4ed2-b995-bfd73adfeb9f","resolution":{"observed_at":"2026-07-11T15:44:22.210969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04653","last_updated":"2026-07-08T03:47:34Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-11T23:18:20.115584Z","submitted_at":"2026-07-06T04:18:28Z","title":"Enhancing Video Physical Consistency via Role-aware Joint Training and Modality-decoupled Denoising"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2607.04653."}