{"as_of":"2026-08-10T09:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c5835c4b3bda5e9ec0bbe55030dfde9a0901b54868b7c29d54e40332db28610","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T21:16:16.877500Z","state":"measured"},{"denominator":93,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":93,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:27:36.393512Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:27:09.332551Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-07T04:27:36.393512Z","title":"Humandit: Pose-guided diffusion transformer for long-form human motion video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.10568","last_updated":"2025-08-27T03:34:57Z","snapshot_observed_at":"2026-08-08T16:12:04.523586Z","submitted_at":"2025-06-12T10:58:23Z","title":"DreamActor-H1: High-Fidelity Human-Product Demonstration Video Generation via Motion-designed Diffusion Transformers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:27:36.393512Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2506.10568"},"observation_digest":"sha256:dd97ec433aca60359f10eb299d2874a70203aeec9ce1dd661ece20eaf1c3c86f","observation_id":"07cca7ad-aab0-4be6-895e-9914d2213c04","resolution":{"observed_at":"2026-08-07T04:27:36.393512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-07T00:40:57.359048Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation.arXiv preprint arXiv:2502.04847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12847","last_updated":"2025-06-15T13:41:43Z","snapshot_observed_at":"2026-08-09T19:19:49.020759Z","submitted_at":"2025-06-15T13:41:43Z","title":"iDiT-HOI: Inpainting-based Hand Object Interaction Reenactment via Video Diffusion Transformer","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:40:57.359048Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2506.12847"},"observation_digest":"sha256:90a6b04fae4433b93db48d25091c1368a6b8c9db666c184cb84b9d86f9658a81","observation_id":"7ac5ae84-74b1-4c0d-8aae-4c50a97ad4c1","resolution":{"observed_at":"2026-08-07T00:40:57.359048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-07T00:13:04.478492Z","title":"Humandit: Pose-guided diffusion transformer for long-form human motion video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17301","last_updated":"2025-07-02T16:33:38Z","snapshot_observed_at":"2026-08-09T00:39:19.023690Z","submitted_at":"2025-06-17T22:06:20Z","title":"FramePrompt: In-context Controllable Animation with Zero Structural Changes","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:04.478492Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2506.17301"},"observation_digest":"sha256:72044c520eb1c067c591f4afd2ea59da2a1c35f460ec8f919d94718b1c6f6777","observation_id":"c953dc74-b63c-44c1-9bdf-5a01e206b2bc","resolution":{"observed_at":"2026-08-07T00:13:04.478492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-05T22:13:13.531008Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07409","last_updated":"2025-08-10T16:15:04Z","snapshot_observed_at":"2026-08-09T13:58:05.198574Z","submitted_at":"2025-08-10T16:15:04Z","title":"CharacterShot: Controllable and Consistent 4D Character Animation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:13:13.531008Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2508.07409"},"observation_digest":"sha256:7cff0a32e1ae261402e8d819b8c1bdd27159119817294f1af96312a76f3e9a60","observation_id":"864de853-98ee-47f8-9c56-56039a9a2dc7","resolution":{"observed_at":"2026-08-05T22:13:13.531008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-08-05T15:19:37.115944Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.20210","last_updated":"2025-08-27T18:36:30Z","snapshot_observed_at":"2026-08-09T16:12:19.928163Z","submitted_at":"2025-08-27T18:36:30Z","title":"InfinityHuman: Towards Long-Term Audio-Driven Human","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:37.115944Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2508.20210"},"observation_digest":"sha256:22297880f7f62da1a674b88a210922209f68cd618646d1523c87a22d60e6bc6a","observation_id":"2a2ed21f-c783-4b36-8408-d28c9f114b26","resolution":{"observed_at":"2026-08-05T15:19:37.115944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2511.22940","last_updated":"2026-05-19T15:28:34Z","snapshot_observed_at":"2026-08-02T05:15:20.627790Z","submitted_at":"2025-11-28T07:30:10Z","title":"One-to-All Animation: Alignment-Free Character Animation and Image Pose Transfer","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T18:25:22.486891Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2511.22940"},"observation_digest":"sha256:9ae2d75a281e584806d79834ffdbf70315f194eec3c05bf8d4e5b508c06ce413","observation_id":"230ce555-70fb-495c-a420-ec49c1992237","resolution":{"observed_at":"2026-05-21T18:25:28.387712Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-07-06T22:41:48.115083Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:74b3c779f256dca9fbe6b2967d62fc74cbb905c9d8e810a3b639ea5cdb6087b8","observation_id":"27613b73-29e8-4d03-b74f-6f1dc30001e1","resolution":{"observed_at":"2026-05-16T13:47:57.469405Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-13T22:49:03.259461Z","title":"arXiv preprint arXiv:2502.04847 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.17975","last_updated":"2026-06-28T11:09:46Z","snapshot_observed_at":"2026-08-09T19:20:25.467076Z","submitted_at":"2026-03-18T17:39:05Z","title":"AHOY! Animatable Humans under Occlusion from YouTube Videos with Gaussian Splatting and Video Diffusion Priors","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T22:49:03.259461Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2603.17975"},"observation_digest":"sha256:4dabd15e33d6075139194c7e49f1df5501434e8879ce23aa7d3cb054550ac054","observation_id":"67e18852-6877-4312-8590-388f7765649b","resolution":{"observed_at":"2026-07-13T22:49:03.259461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:fd192bdf0b346c73e600e5c51d1eea107e84416703afc4e16595689f724f80a9","observation_id":"d78da58c-5a2f-425c-a00f-78ab574cdf1f","resolution":{"observed_at":"2026-05-11T11:11:00.606070Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2604.21776","last_updated":"2026-04-24T04:18:46Z","snapshot_observed_at":"2026-07-06T23:08:19.446684Z","submitted_at":"2026-04-23T15:32:56Z","title":"Reshoot-Anything: A Self-Supervised Model for In-the-Wild Video Reshooting","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-09T23:00:45.496971Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2604.21776"},"observation_digest":"sha256:052fe083e541ac4935624713a5e95023006887c9a581b6ef10bd4097865d7d52","observation_id":"a587e507-2fe7-47b8-a21b-f4ce67d6f45c","resolution":{"observed_at":"2026-05-09T23:04:17.902718Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2605.15042","last_updated":"2026-05-14T16:36:34Z","snapshot_observed_at":"2026-07-06T23:26:23.179482Z","submitted_at":"2026-05-14T16:36:34Z","title":"EverAnimate: Minute-Scale Human Animation via Latent Flow Restoration","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:21:58.123630Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2605.15042"},"observation_digest":"sha256:f59f886c9740352921f341246218c32ff117582d470980e7a68449f7b7832da0","observation_id":"6dfe205b-da8b-4496-a966-c1f14f0859a3","resolution":{"observed_at":"2026-06-30T21:25:04.928437Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2605.17248","last_updated":"2026-05-17T04:10:55Z","snapshot_observed_at":"2026-08-02T22:41:54.302633Z","submitted_at":"2026-05-17T04:10:55Z","title":"Image-to-Video Diffusion: From Foundations to Open Frontiers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-20T15:06:02.084336Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2605.17248"},"observation_digest":"sha256:3ca027dd596084f6186b21a45de3cc375bed1d10422aeef7ab1bc2eb4b965075","observation_id":"5881a7e2-485c-4bac-a8df-f1ade38fdddb","resolution":{"observed_at":"2026-05-20T15:08:25.067557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2606.02000","last_updated":"2026-06-01T09:56:48Z","snapshot_observed_at":"2026-08-06T00:33:39.995914Z","submitted_at":"2026-06-01T09:56:48Z","title":"Towards 3D-Aware Video Diffusion Models: Render-Free Human Motion Control with Mesh Tokenization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T15:02:10.901341Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2606.02000"},"observation_digest":"sha256:6a2bb3c8ae4dc6f72a6bee818d4ba04fcf8daf9e35b90393bbf50aa6b8f0d0c6","observation_id":"7d27c7c8-caf6-4dfc-b1e9-bc628558a0d5","resolution":{"observed_at":"2026-07-01T22:46:19.837955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2606.06903","last_updated":"2026-06-05T04:39:46Z","snapshot_observed_at":"2026-08-10T00:09:42.544772Z","submitted_at":"2026-06-05T04:39:46Z","title":"Beyond Skeletons: Learning Animation Directly from Driving Videos with Same2X Training Strategy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T22:41:06.600948Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2606.06903"},"observation_digest":"sha256:83f73392163b2eb46923d5c14590bd09e573a98e7ecde882e134f3a2e65221d5","observation_id":"2ac62087-02d9-4145-92ab-920eeae36bf1","resolution":{"observed_at":"2026-07-02T16:27:09.334025Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":"2502.04847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-02T16:27:09.332551Z","title":"Humandit: Pose-guided diffusion transformer for long- form human motion video generation","venue":null,"work_id":"f79a82ad-b302-40d3-bc68-724b8d3220d9","year":2025},"citing_paper":{"arxiv_id":"2606.29020","last_updated":"2026-06-27T17:38:21Z","snapshot_observed_at":"2026-07-07T00:03:02.476882Z","submitted_at":"2026-06-27T17:38:21Z","title":"Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T09:19:50.748415Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2606.29020"},"observation_digest":"sha256:47ebb6954244ea55683c0363b043313c94fab3d1e667b6907e6f182273bf6db9","observation_id":"7dadeb01-d7c9-4a57-a229-86b334d4821b","resolution":{"observed_at":"2026-06-30T09:24:32.499642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04847","snapshot_observed_at":"2026-07-31T23:01:24.315729Z","title":"Hu- mandit: Pose-guided diffusion transformer for long-form hu- man motion video generation.ArXiv, abs/2502.04847, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24124","last_updated":"2026-07-27T08:06:29Z","snapshot_observed_at":"2026-08-09T20:21:30.165455Z","submitted_at":"2026-07-27T08:06:29Z","title":"ViDS: Video Diffusion Shader using 3D Face Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T23:01:24.315729Z"},"links":{"cited_paper":"/paper/2502.04847","citing_paper":"/paper/2607.24124"},"observation_digest":"sha256:fb95aa5a71d74f1c424a8be357d1b037e1a2e06c69bcaa80baae1d45ad7fc0bf","observation_id":"34bcd504-bca9-4d4c-92d5-282b38a8f4ba","resolution":{"observed_at":"2026-07-31T23:01:24.315729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04847/citation-record","integrity":"/paper/2502.04847/integrity","json":"/paper/2502.04847/citation-record.json","paper":"/paper/2502.04847"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.198626Z","title":"Conditional gan with discrimi- native filter generation for text-to-video synthesis","venue":null,"work_id":"80a3d123-2989-4ce2-8a7d-ebc272ef5c43","year":2019},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.390131Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:8739804f9f9fd7d6d581f244cdc5e9bda5cbf86f05986b5d6c838fba234f4915","observation_id":"0834b76e-0f24-4c5b-ae55-287b2553c5bc","resolution":{"observed_at":"2026-08-08T21:16:18.203410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.396032Z","title":"Multidiffusion: Fusing diffusion paths for controlled image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.396032Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:3bec06e19385de933ab51d8abcbe31305b4bbd029cfffff24c22c6f7a5ec03d0","observation_id":"2c869da1-5d43-4b8a-8e5e-ae3029a27fd7","resolution":{"observed_at":"2026-08-08T21:16:16.396032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.12945","last_updated":"2024-02-05T16:36:30Z","snapshot_observed_at":"2026-08-08T15:14:24.281572Z","submitted_at":"2024-01-23T18:05:25Z","title":"Lumiere: A Space-Time Diffusion Model for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.12945","snapshot_observed_at":"2026-08-08T21:16:16.401695Z","title":"Lumiere: A space- time diffusion model for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.401695Z"},"links":{"cited_paper":"/paper/2401.12945","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:b61859ee841f38234cb7acb9fdb2b947e06c2ef6028170934367f5093380c374","observation_id":"efeb2e9a-f12b-4b51-8b1b-bc4548846815","resolution":{"observed_at":"2026-08-08T21:16:16.401695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.173256Z","title":null,"venue":null,"work_id":"202086e9-69cc-456c-a40c-c34d1c1ed595","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.406915Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:441b69ad9cbcfd3ac7abb748f326fd8d0a107e3c4fd2780d7bf0b179951ec2a8","observation_id":"5e867c90-832c-4d76-b588-9e933755b13a","resolution":{"observed_at":"2026-08-08T21:16:18.177660Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-08T21:16:16.411483Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.411483Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:dab3f695c1c4d52c058b6ec3bc5f4d48790c84f42a57805b5165d70b4fbe6cbb","observation_id":"3d33765d-5839-4cce-859a-b6d478ef8e19","resolution":{"observed_at":"2026-08-08T21:16:16.411483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.158579Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"da6cee20-2fbc-4b15-b09d-4aadc76f12e6","year":2017},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.416429Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:baf0d7028876f749e47a34417d1ee1c0ac6e938aab27ce4ab9be762051c48e2f","observation_id":"2f672520-901d-472b-8d6f-af74cccc060a","resolution":{"observed_at":"2026-08-08T21:16:18.163718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.144261Z","title":"Everybody dance now","venue":null,"work_id":"8453c6f2-2ad6-4437-834b-df58b0320014","year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.421709Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:b7972af9751ef9078496c87c5d228833daf55f10a41dc870988deabae2003b90","observation_id":"c498ad1a-e33d-4853-abbe-c37987dc16f6","resolution":{"observed_at":"2026-08-08T21:16:18.148978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-01T16:10:16.293275Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-08T21:16:16.428062Z","title":"Magicdance: Realistic human dance video gen- eration with motions & facial expressions transfer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.428062Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:ea93a7fd6eb38ab76b717461ed4d9c42cdc1e1c3b7adc76680886e420c0f0eb9","observation_id":"a7639469-4c26-4c8b-91b4-555d6c4612f2","resolution":{"observed_at":"2026-08-08T21:16:16.428062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.128225Z","title":"Long video generation with time-agnostic vqgan and time- sensitive transformer","venue":null,"work_id":"4c198bce-7e6e-45c0-a417-c094efcd2a38","year":2022},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.433617Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:d8ecb1d9eb4e50790f00331449a76b822750fc715f4c82af1fe564431520efa1","observation_id":"aa6ddcd7-b2fa-40d7-b52b-ca67bd2e72b4","resolution":{"observed_at":"2026-08-08T21:16:18.134097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.113474Z","title":"Learning individual styles of conversational gesture","venue":null,"work_id":"e512416e-3bc5-4be3-844a-502306a0eda9","year":2019},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.438120Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:f37171f3cbf80b00aea2d340cfe1cb2f6ce087baefbd106ccd29e53daa2bfa35","observation_id":"eca8bde4-c838-4f29-a199-83c04fef5c19","resolution":{"observed_at":"2026-08-08T21:16:18.118288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.442724Z","title":"Generative adversarial nets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.442724Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:cb2eefaccd992cb3a476c1bd01a7b3e054e4d35fffb4389309cc4637a5a3a3a2","observation_id":"c20ca445-e2d8-46ea-8f40-bb6342833873","resolution":{"observed_at":"2026-08-08T21:16:16.442724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.089492Z","title":"Talk-act: Enhance textural- awareness for 2d speaking avatar reenactment with diffusion model","venue":null,"work_id":"8526cac5-0471-4b60-aae9-4d5fe464c155","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.447391Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:8c9f86ad8978f4d050b49f5111fe7c92d7ccf62f99a103cfd2d1207c4257e0ca","observation_id":"98ede29c-9ae8-4ec6-b8a0-7e943aa7e93e","resolution":{"observed_at":"2026-08-08T21:16:18.094178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-08T21:16:16.452043Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.452043Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:6ffd5e54fa36c85eab2deb5d5d7d3288b38bf2cc6130ff2ad008dcfb8d88d0da","observation_id":"16d9b75e-2cd6-48fd-aa2c-d6c220f1d6c3","resolution":{"observed_at":"2026-08-08T21:16:16.452043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.074378Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"609d48df-559f-468a-8e13-9d0a7176d33f","year":2016},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.456898Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:f21a53b8c3c271d88acb42dfe0ed2b9ff7e3c4c4d127fa49d5eaadddc417bae0","observation_id":"3431fe6f-626a-4d1c-b21e-0696711b0326","resolution":{"observed_at":"2026-08-08T21:16:18.079523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.461518Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.461518Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:4d73fc60d5b2d8e0729283cc64936d269a054fdbad08ad373a6db67c7860eff8","observation_id":"fc46ad49-c553-4da6-9e06-a105509aa82e","resolution":{"observed_at":"2026-08-08T21:16:16.461518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.466599Z","title":"Denoising dif- fusion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.466599Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:69e55a4c3dc0b05d904c7b803a3a8f5fd614a943086b9cc159a9226cab4f9ccf","observation_id":"ea606338-560e-4248-b141-d20c78b9cf6a","resolution":{"observed_at":"2026-08-08T21:16:16.466599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.039803Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":"45e61b33-3847-4044-a7dd-578e02c13f44","year":2010},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.471480Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:163fda84c363bf8155b5f3381153c7e46b4ef50136f4e0c5fa76673a325ba1d9","observation_id":"18a105c2-6925-4da7-8873-a1211c7f9486","resolution":{"observed_at":"2026-08-08T21:16:18.045336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.023934Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"847a747c-ed8c-4c3a-9f00-816466e33eac","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.476156Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:4ba98b7bfcb47b46a47ec5c64e7a4b70e2e06cdc6585b357738ba9dfc121938f","observation_id":"549d5fbc-a99c-45ff-8cbd-55a3a9cd6411","resolution":{"observed_at":"2026-08-08T21:16:18.028672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:18.008491Z","title":"Learning high fidelity depths of dressed humans by watching social media dance videos","venue":null,"work_id":"3f16a436-9ef3-4b5e-b0bf-b7ce5d480986","year":2021},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.480789Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:c5d3f0b69bb69b7c76ecda2e3670c7e4c81810630a7644983212d34d3a5ad98a","observation_id":"f203d0e7-d3a2-49ec-b015-f4888087e0f0","resolution":{"observed_at":"2026-08-08T21:16:18.013348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.993505Z","title":"Ultralyt- ics yolo","venue":null,"work_id":"ea8fc89c-5d41-44d2-a722-1970fe7a531a","year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.485493Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:c653bf16c448fb116024879c1c065971eb237f2d57207f3dede981fb5116a571","observation_id":"fbe126c7-0ba4-47d9-a498-0c300d1eed96","resolution":{"observed_at":"2026-08-08T21:16:17.997949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.07635","last_updated":"2024-10-01T13:15:53Z","snapshot_observed_at":"2026-08-05T15:59:10.206778Z","submitted_at":"2023-07-14T21:13:04Z","title":"CoTracker: It is Better to Track Together","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.07635","snapshot_observed_at":"2026-08-08T21:16:16.490082Z","title":"Co- tracker: It is better to track together","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.490082Z"},"links":{"cited_paper":"/paper/2307.07635","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:e5a138aa4a9044c8dcc1d0a6140baeaeff1b443625651c2c9e465a6d6ad71815","observation_id":"b8c3bbd4-7563-4444-9d6f-4d9273549119","resolution":{"observed_at":"2026-08-08T21:16:16.490082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12569","last_updated":"2024-08-27T02:31:42Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:37:27Z","title":"Sapiens: Foundation for Human Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12569","snapshot_observed_at":"2026-08-08T21:16:16.496425Z","title":"Sapiens: Foundation for human vision mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.496425Z"},"links":{"cited_paper":"/paper/2408.12569","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:0c4426d2dedcc4c5175df706b2ea689f68eb4f42a760af91ea991b1b8c71e6df","observation_id":"caa24bc2-58d8-48b4-b717-e5cceb5bdbca","resolution":{"observed_at":"2026-08-08T21:16:16.496425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-08T21:16:16.502978Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.502978Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:76ec97276a7ea169730d3d11eba33b337a2c9c2a7ecc2413a27190cc6efd633c","observation_id":"606a2cb4-fb2a-4153-a29e-930d68f22793","resolution":{"observed_at":"2026-08-08T21:16:16.502978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.13120","last_updated":"2022-05-21T06:03:54Z","snapshot_observed_at":"2026-08-10T08:46:54.273161Z","submitted_at":"2021-05-26T13:40:58Z","title":"Sequence Parallelism: Long Sequence Training from System Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.13120","snapshot_observed_at":"2026-08-08T21:16:16.508011Z","title":"Sequence parallelism: Long se- quence training from system perspective","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.508011Z"},"links":{"cited_paper":"/paper/2105.13120","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:527e86704f8c852a57e0415194fb0c154b1f765c0a5c436ab1bad8ab5f919f11","observation_id":"9e654174-9035-441a-afb5-2289664958c6","resolution":{"observed_at":"2026-08-08T21:16:16.508011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.978918Z","title":"Speech2video synthesis with 3d skeleton regularization and expressive body poses","venue":null,"work_id":"546c5688-a8f7-48e8-919a-249467b8d2b8","year":2020},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.513558Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:93cb167d56e50eb4ae449f45e834e3327ebe673c65149be39289cd210fc2e089","observation_id":"38b59f59-1114-4173-b6b6-5c56b655cdb6","resolution":{"observed_at":"2026-08-08T21:16:17.983827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01876","last_updated":"2025-04-05T05:31:38Z","snapshot_observed_at":"2026-08-09T18:52:43.975597Z","submitted_at":"2024-09-03T13:19:31Z","title":"CyberHost: Taming Audio-driven Avatar Diffusion Model with Region Codebook Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01876","snapshot_observed_at":"2026-08-08T21:16:16.518388Z","title":"Cyberhost: Taming audio- driven avatar diffusion model with region codebook atten- tion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.518388Z"},"links":{"cited_paper":"/paper/2409.01876","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:cb7772ea368dadf3b008cc4d5af7fe908d5204814b295eca74c3c6e7b7536d4a","observation_id":"95f0d104-63d7-4cfe-b340-b57b9e71ad3d","resolution":{"observed_at":"2026-08-08T21:16:16.518388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04221","last_updated":"2024-10-05T16:30:46Z","snapshot_observed_at":"2026-07-06T19:28:26.436468Z","submitted_at":"2024-10-05T16:30:46Z","title":"TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04221","snapshot_observed_at":"2026-08-08T21:16:16.523335Z","title":"Tango: Co-speech gesture video reenactment with hi- erarchical audio motion embedding and diffusion interpola- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.523335Z"},"links":{"cited_paper":"/paper/2410.04221","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:d9243bbbd146e46f12220e805850a41cddf06f215a33d94820840f7f9b0f8503","observation_id":"eb1ee01c-a96d-4f98-97e6-e1d5a1088a54","resolution":{"observed_at":"2026-08-08T21:16:16.523335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.964428Z","title":"Multi-task deep model with margin ranking loss for lung nodule analysis.IEEE transactions on medical imaging, 39(3):718–728, 2019","venue":null,"work_id":"6a663ef9-e930-46c0-9620-b67866e71e02","year":2019},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.528457Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:14f899e601f0cf4c600cc59b7673dc6a14123ce08d2c3202d1d6e3ab134e274e","observation_id":"89a2f01c-ce7b-454c-96ea-dbb90475d0cf","resolution":{"observed_at":"2026-08-08T21:16:17.969500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.533470Z","title":"Smpl: A skinned multi- person linear model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.533470Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:9d0c9a33e400d472b066c63144a5376fe30e577e52dd95bd9a3505d2ad4164e1","observation_id":"c5a8a129-ed4e-4935-b30d-d81f3f6f7038","resolution":{"observed_at":"2026-08-08T21:16:16.533470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.941819Z","title":"Handrefiner: Refining malformed hands in generated images by diffusion-based conditional inpainting","venue":null,"work_id":"a645227a-0852-4841-97c1-fe71a5ca13e5","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.537970Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:4d41c0ddeb6f3f3357c48035f3aa648cb58a9984b66de8035870cde67a7397ca","observation_id":"52b64872-ff26-4240-b71f-97b34095901c","resolution":{"observed_at":"2026-08-08T21:16:17.946311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.542698Z","title":"Nerf: Representing scenes as neural radiance fields for view syn- thesis","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.542698Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:1a6d2edefdb4ea52b8c99f4e23d61cabbbbbd15010d1baf1ef941cddb50eacc5","observation_id":"5aa0e527-979d-4b22-b76c-0616eaee2232","resolution":{"observed_at":"2026-08-08T21:16:16.542698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.916137Z","title":"Moore-animateanyone","venue":null,"work_id":"46d4bd42-3daf-444a-8fcf-43b749deb8f7","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.547379Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:be90f7e73eb57e4c0d8f5bca155f09818a5f9d16c590f1f7eb93b5395c4d48fa","observation_id":"2496d139-34fc-46a5-b581-446bd63ead28","resolution":{"observed_at":"2026-08-08T21:16:17.921316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.900544Z","title":"Conditional image-to-video gener- ation with latent flow diffusion models","venue":null,"work_id":"f4c1cb04-4cbf-4cb9-97c0-384845e16c42","year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.552150Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:4b044c2cd0b434359b695bbe85aa7e4bd496538bc93f2404f4e6b2145beb4736","observation_id":"233041cb-075e-4173-9bfa-5f6ccd144ef5","resolution":{"observed_at":"2026-08-08T21:16:17.905179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.884455Z","title":"Sora: Creating video from text","venue":null,"work_id":"b192d2d0-c6b5-4307-a3b9-e5cbc26de3f0","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.557548Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:45eccd7d37fcafab0b495b2a0bd686459e4e3335c453720017f3f1f6acf02197","observation_id":"9f915bc5-4a7f-44ad-8975-4549ea24517f","resolution":{"observed_at":"2026-08-08T21:16:17.889890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.869250Z","title":"Paddleocr","venue":null,"work_id":"f51680b9-6433-45bb-957d-2c73bca1889d","year":2021},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.563034Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:f14ee81f7076db070330c1db2e17db21e4568117c64935ae1047e2be8c2b63be","observation_id":"88ea8bda-db1c-48b2-aef0-7a104e4ea5a4","resolution":{"observed_at":"2026-08-08T21:16:17.873815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.854722Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":"6061e548-27ae-46d6-b574-a88b4e5aecc9","year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.567873Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:2a115b20bfa09b3bee31048bf12caf64f80a189e4d5d34337c74b863620b18d9","observation_id":"adfd2fdb-0242-4786-a0fa-7f47f3d2fe36","resolution":{"observed_at":"2026-08-08T21:16:17.859729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.839852Z","title":"Deep spatial transformation for pose-guided person image generation and animation","venue":null,"work_id":"5fbce649-4c2c-432d-b0d6-56536c1842bb","year":2020},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.572483Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:6c9eea7170dc0e3068400968797bdad3438c3eaedbe4d0eaa1811cabcb16b12d","observation_id":"09d26619-aab7-4ffd-8d26-9fda7e80d414","resolution":{"observed_at":"2026-08-08T21:16:17.844555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.577335Z","title":"High-resolution image syn- thesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.577335Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:07e75c21b0628a78ce6b2205a78a21b94488be87d79f877b8cd04e96cb98c75c","observation_id":"24224dcf-4068-418c-8e1a-117086c20b20","resolution":{"observed_at":"2026-08-08T21:16:16.577335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.582200Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.582200Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:d6f0b9cd2a03fcdf217781946dc8c596842a3677c21576285d97db9f629b6d78","observation_id":"33fb1b53-ee0f-4e6e-80e6-e70dbbb0045c","resolution":{"observed_at":"2026-08-08T21:16:16.582200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.805551Z","title":"Human4dit: 360-degree human video gen- eration with 4d diffusion transformer","venue":null,"work_id":"2f5bd78b-8921-4799-a6b2-b29bd0524788","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.586781Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:1489bb977b127070416ac4e7266a73d75df67258cab0627627a411957bd743f6","observation_id":"a1c91d50-98b4-44bd-86c0-0c9c894cd653","resolution":{"observed_at":"2026-08-08T21:16:17.810583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.789554Z","title":"Animating arbitrary objects via deep motion transfer","venue":null,"work_id":"5f33f4ef-fdcb-4fc4-8e6e-b908f54c8559","year":2019},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.591807Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:9aa663fa9b29115f6a17cba287c3438a9fa988940544314e9c3941b2403b8c28","observation_id":"9dd8795f-b24a-43b9-9fe1-47d12aaaec3b","resolution":{"observed_at":"2026-08-08T21:16:17.795373Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.774160Z","title":"Motion representations for ar- ticulated animation","venue":null,"work_id":"a135e64e-f084-482e-9f52-9a6cb6ff1f00","year":2021},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.596535Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:c9160486fa83a653cbe1d110879d5f4149220f2471eac2c35d3b31ac53d87be8","observation_id":"172ff92d-adf6-4301-98bc-71555fc6afc7","resolution":{"observed_at":"2026-08-08T21:16:17.778921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-08T21:16:16.602005Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.602005Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:17d84803560da1881a645521b8743f7a67a27d5038341d467f71628747a9ac9a","observation_id":"2103c47e-0a16-4176-b17b-25aa5352f454","resolution":{"observed_at":"2026-08-08T21:16:16.602005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-08T21:16:16.607106Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.607106Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:36062a0d11489aa83194ca7a7f5d20925f2da810ee65fe510fd3e79f48db2df4","observation_id":"d98cf96c-4cc7-44fa-92d9-a43133b90b35","resolution":{"observed_at":"2026-08-08T21:16:16.607106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.611957Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.611957Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:66acf71bc6a9f4adc4d3fdee61e96b1fcc81c58aa4a8b850be03662efebcdfac","observation_id":"6e965526-5176-4704-94f5-9d875645fc68","resolution":{"observed_at":"2026-08-08T21:16:16.611957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06525","snapshot_observed_at":"2026-08-08T21:16:16.617683Z","title":"Autoregressive model beats diffusion: Llama for scalable image generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.617683Z"},"links":{"cited_paper":"/paper/2406.06525","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:651b699a6ef555683cf178053a0378f207b7e4cd9c15eedf809993c7b5ded546","observation_id":"782dfa92-6bcd-488e-b40c-904810c8543a","resolution":{"observed_at":"2026-08-08T21:16:16.617683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-07T06:22:46.243818Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-08T21:16:16.622832Z","title":"Animate-x: Universal character image ani- mation with enhanced motion representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.622832Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:58800e463d6a533a3ae7af65a33baaf4ede6ba13bfa9faa32744487a600a3759","observation_id":"7baf9bc0-3533-4b64-9ab5-cce85c8a5e5e","resolution":{"observed_at":"2026-08-08T21:16:16.622832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-07-06T07:19:11.957225Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-08T21:16:16.628222Z","title":"To- wards accurate generative models of video: A new metric & challenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.628222Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:eed41dee14b3bf5fce2ffbb0c456bf7ba8e2ef31e9e45b88629b9c7a98719fd3","observation_id":"373bfee0-0b59-44d6-aee2-a60a77e9bf8d","resolution":{"observed_at":"2026-08-08T21:16:16.628222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.751195Z","title":"Attention is all you need","venue":null,"work_id":"87b4d318-1287-4a99-9166-fbb788d45851","year":2017},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.633095Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:2ec4544811a5504b9e271c5258e20ee5f7a854528a32ae11c8d2e96eecd4d397","observation_id":"9072b334-5323-40ea-89c2-7011a2b3a55d","resolution":{"observed_at":"2026-08-08T21:16:17.755583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.736974Z","title":"Generating videos with scene dynamics","venue":null,"work_id":"0fdeae62-2d8e-4512-989a-afdff95f9c4e","year":2016},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.637631Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:27ad3f5ebc3fe3dfee9b71df81cb2286f3a2ed0bb2ee460995aaab2484ae58bc","observation_id":"9d46e001-4bc7-480c-8ff6-046dcf66f649","resolution":{"observed_at":"2026-08-08T21:16:17.741557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03018","last_updated":"2024-09-16T16:02:34Z","snapshot_observed_at":"2026-07-06T16:57:21.997777Z","submitted_at":"2023-12-05T03:16:31Z","title":"DreamVideo: High-Fidelity Image-to-Video Generation with Image Retention and Text Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03018","snapshot_observed_at":"2026-08-08T21:16:16.642095Z","title":"Dreamvideo: High-fidelity image-to- video generation with image retention and text guidance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.642095Z"},"links":{"cited_paper":"/paper/2312.03018","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:8a1df4c6f9390872ecc4adb4fd83a6a7ac1df729d0c7201046c4856e4f774de9","observation_id":"dd1837a2-7651-4dd2-ab15-f431a74f2edb","resolution":{"observed_at":"2026-08-08T21:16:16.642095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.721584Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"86d66f4a-bd0c-4097-9c26-d734b7304f34","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.647776Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:ac3dc25dd4cc425c4d3fd9b349baa939e640ee14f3241f348c1f2a5fe1535276","observation_id":"c50bc728-9176-4194-9a9e-54e4ec6930aa","resolution":{"observed_at":"2026-08-08T21:16:17.726467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.705512Z","title":"One-shot free-view neural talking-head synthesis for video conferenc- ing","venue":null,"work_id":"281adfd4-db6f-4b62-ae8a-961f97badbbc","year":2021},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.652251Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:00a4e3f91733e0d69f48efd640a5f3b2c4a230dadeb98ea3c24cc22c897fed1f","observation_id":"2fb4275f-5ada-40e4-a547-0ca1db18da9e","resolution":{"observed_at":"2026-08-08T21:16:17.711730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-08-10T09:11:13.539365Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-08T21:16:16.657225Z","title":"Unianimate: Taming unified video diffusion mod- els for consistent human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.657225Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:362b8bcb171d5b8f996391fd5237e3c6d7d7f8177e12e9a410e2e0dbaff8089f","observation_id":"416fd5ef-2c35-41e3-8b4a-535d8e32da04","resolution":{"observed_at":"2026-08-08T21:16:16.657225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.661873Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.661873Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:1180dd48264098b0028bf64b5a9ed1af56f2e4d10d32379ae06a175521c8a39e","observation_id":"e575bc99-aac1-4a4c-944b-0434b22fc388","resolution":{"observed_at":"2026-08-08T21:16:16.661873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.680280Z","title":"Hu- mannerf: Free-viewpoint rendering of moving people from monocular video","venue":null,"work_id":"3ede10cf-9800-4548-8c5e-b08f92216bbb","year":2022},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.666305Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:b734d88a73563a2dd5c5c958bf2cc47d7db9e147238a574ba3413c641152c07a","observation_id":"24e9cf9d-bea3-4070-953d-868b2bae6971","resolution":{"observed_at":"2026-08-08T21:16:17.685282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-08T21:16:16.670898Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.670898Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:25c8f2eef57decc3eaaa6e6679c431ef69ed8ea5a3162273b7ef732c069d5ae0","observation_id":"2f038d34-90d9-498f-a2e1-6fd9ad51f590","resolution":{"observed_at":"2026-08-08T21:16:16.670898Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.663733Z","title":"Msr-vtt: A large video description dataset for bridging video and language","venue":null,"work_id":"05a2ceae-1a8c-46d2-8dad-23379061bd75","year":2016},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.675811Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:a45a2fec6db0e501a8b8a1a813612a0ae4058a50b693e5271fb1f018fb20e2ea","observation_id":"a55463b4-cb3a-4126-83c6-86b4632aa584","resolution":{"observed_at":"2026-08-08T21:16:17.668483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.680352Z","title":"Easyanimate: A high-performance long video generation method based on transformer architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.680352Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:0bf3de15cbf0eb10c6e5ff951d920c2a8a9bbeef25a86cdbe1826890b25fc1d6","observation_id":"de0f70ff-e413-4a15-94a6-c9c1cc532d16","resolution":{"observed_at":"2026-08-08T21:16:16.680352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.648047Z","title":"Magicanimate: Temporally consistent human image animation using diffusion model","venue":null,"work_id":"ae99bcf1-29a9-4c0b-bbfb-e56a3e3aad36","year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.685334Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:d80e491c9f0a02b7621239e7ed551864e4e4b4b2e2e46779073ac1f4f6b7a8da","observation_id":"ac3f24bd-effe-46ad-a0a0-0c2e50252347","resolution":{"observed_at":"2026-08-08T21:16:17.653090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03035","last_updated":"2025-03-01T09:24:04Z","snapshot_observed_at":"2026-07-06T18:25:44.620682Z","submitted_at":"2024-06-05T08:03:18Z","title":"Towards Multiple Character Image Animation Through Enhancing Implicit Decoupling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03035","snapshot_observed_at":"2026-08-08T21:16:16.689671Z","title":"Follow-your-pose v2: Multiple-condition guided character image animation for stable pose control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.689671Z"},"links":{"cited_paper":"/paper/2406.03035","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:a9f9a4979b648ac7fe9fa3267aa0b5f197e7c48449dddb4fc7ddfe795c2397ae","observation_id":"e3cb2976-eb72-4c37-9028-95cd3dc88840","resolution":{"observed_at":"2026-08-08T21:16:16.689671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.632500Z","title":"Showmaker: Creating high-fidelity 2d human video via fine-grained diffusion mod- eling","venue":null,"work_id":"112d774f-9679-4ef6-96cc-c0b83f643f00","year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.695401Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:e44d5e2c1e15f9f6a202d3cb0304b0640b9925d67db69956867fb29fbd07af07","observation_id":"555e26cb-a4ef-4315-815e-6292691ca29c","resolution":{"observed_at":"2026-08-08T21:16:17.637641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.617255Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":"b2803deb-91c6-4b06-be97-d1ca10a2c407","year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.700622Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:daad2e29084a9729c4e949df5fd1593d25516e1c13c4c8ee80d4824abdd77fbc","observation_id":"5fff86d7-cb6c-44db-a67d-26601bd47015","resolution":{"observed_at":"2026-08-08T21:16:17.622111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-08T21:16:16.705812Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.705812Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:d2cd4e39d9c5d4b454d6625200ea6daee6df0bfb87fd01b9955a761c84440f19","observation_id":"18f37ecd-5158-45f5-9842-0e1ff2df2a33","resolution":{"observed_at":"2026-08-08T21:16:16.705812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.13430","last_updated":"2023-01-31T05:56:06Z","snapshot_observed_at":"2026-08-09T23:54:04.613599Z","submitted_at":"2023-01-31T05:56:06Z","title":"GeneFace: Generalized and High-Fidelity Audio-Driven 3D Talking Face Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.13430","snapshot_observed_at":"2026-08-08T21:16:16.710740Z","title":"Geneface: Generalized and high- fidelity audio-driven 3d talking face synthesis.arXiv preprint arXiv:2301.13430, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.710740Z"},"links":{"cited_paper":"/paper/2301.13430","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:a749584b605f59048d9e57ec495e5ce617958fa6e8126d83ead237966cc35e21","observation_id":"fc77aae5-26e4-4c1b-b632-b2b5a52ef798","resolution":{"observed_at":"2026-08-08T21:16:16.710740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.601355Z","title":"Make pixels dance: High- dynamic video generation","venue":null,"work_id":"a702d425-7ea8-4567-9741-b59ddec6b068","year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.715531Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:9e934c67a7d5c1e949938a51c724d1ec6704a5175868378f7a1c64071babeca0","observation_id":"fad4119a-6fa2-4c5e-957a-98147c8bfe6d","resolution":{"observed_at":"2026-08-08T21:16:17.606749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.720041Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.720041Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:0ae806012a02790776638d3741225ceb0d69a91d13b232eb89e66ee424666b4d","observation_id":"cd43f7a3-c811-407c-b541-57871757afc1","resolution":{"observed_at":"2026-08-08T21:16:16.720041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:16.834912Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.834912Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:a60b1a65f1cd5ed3d5b835078a87c7b773e47ffe67734fb212bee60c1a4f9147","observation_id":"61ab8a81-7c20-4c62-86c6-16f684085ff2","resolution":{"observed_at":"2026-08-08T21:16:16.834912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-09T19:19:40.842650Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-08T21:16:16.839806Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.839806Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:6cb2d6fecf846aefe4c080b837c46dd033592afb288ab9b71601cc9bbaf2074e","observation_id":"21d3a4cb-102b-424d-a8fc-06c0e4785f05","resolution":{"observed_at":"2026-08-08T21:16:16.839806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21705","last_updated":"2025-03-14T03:03:31Z","snapshot_observed_at":"2026-08-09T21:44:46.398850Z","submitted_at":"2024-07-31T15:53:20Z","title":"Tora: Trajectory-oriented Diffusion Transformer for Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21705","snapshot_observed_at":"2026-08-08T21:16:16.844580Z","title":"Tora: Trajectory-oriented diffu- sion transformer for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.844580Z"},"links":{"cited_paper":"/paper/2407.21705","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:fe6644605cc9220c81e06cfd5759fd0ed8baf5b3d19efa38d8d248b184469f1b","observation_id":"105b8940-7c80-4d26-a950-286a12b94711","resolution":{"observed_at":"2026-08-08T21:16:16.844580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11018","last_updated":"2023-05-11T11:23:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-20T16:40:31Z","title":"MagicVideo: Efficient Video Generation With Latent Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11018","snapshot_observed_at":"2026-08-08T21:16:16.849374Z","title":"Magicvideo: Efficient video generation with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.849374Z"},"links":{"cited_paper":"/paper/2211.11018","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:564a853a6e7d1bb0384e5bc3e215856dc260808e5014f8a32149a1e6d6855e7b","observation_id":"175a91c8-fe74-4340-9fdc-bbb350425cac","resolution":{"observed_at":"2026-08-08T21:16:16.849374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06202","last_updated":"2024-09-10T04:14:11Z","snapshot_observed_at":"2026-08-09T19:37:05.617876Z","submitted_at":"2024-09-10T04:14:11Z","title":"RealisDance: Equip controllable character animation with realistic hands","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06202","snapshot_observed_at":"2026-08-08T21:16:16.854235Z","title":"Realisdance: Equip controllable character anima- tion with realistic hands","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.854235Z"},"links":{"cited_paper":"/paper/2409.06202","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:c47ad5b35358a5b8db44f6a6d65d1edc30cbe764d1912e9b464211a6dc7243de","observation_id":"480f3328-3a0e-45b0-b6cf-a78765179e6a","resolution":{"observed_at":"2026-08-08T21:16:16.854235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14781","last_updated":"2024-06-01T08:27:23Z","snapshot_observed_at":"2026-07-06T17:48:41.389936Z","submitted_at":"2024-03-21T18:52:58Z","title":"Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14781","snapshot_observed_at":"2026-08-08T21:16:16.858895Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.858895Z"},"links":{"cited_paper":"/paper/2403.14781","citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:66501626b750114a74559506a501c93706748b3fee5c90db4758fbc1274158aa","observation_id":"16637732-4e53-428d-81ef-8d4ac8e1e2b4","resolution":{"observed_at":"2026-08-08T21:16:16.858895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.549336Z","title":"Sapiens [22] is employed to obtain pose keypoints, providing robust human pose detection for each frame","venue":null,"work_id":"407a132b-d6b8-4737-bf92-0c097f0ebde6","year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.868609Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:4d025ce9259dc7365e1dea2dd0139c757db2d044079c0844d1bda8f03a4c9ca8","observation_id":"cf959b04-8e84-4ff4-bc71-8419ed68adbf","resolution":{"observed_at":"2026-08-08T21:16:17.555041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.533077Z","title":null,"venue":null,"work_id":"baa62285-3f0e-4c17-85c4-b3a7b2943e62","year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.873147Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:42e9ba680211928a681bbd336f46dac7f97a469d439515fddb6c029bfaa086a4","observation_id":"bdb5b3d6-f602-403e-8425-878904bb3167","resolution":{"observed_at":"2026-08-08T21:16:17.537946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.515410Z","title":"PaddleOCR [35] is used to identify and mark text regions in each frame, mitigating the potential interference of text artifacts with the generated data","venue":null,"work_id":"1caa3fdd-e186-4ebd-ba25-dc576dbae786","year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.877500Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:c08881f1b825bcdc183cefb2470edd2ee2d8994a6d1aa8036a6bf018db30111e","observation_id":"e3058091-ac8c-49d6-977b-1dfa8a8c378a","resolution":{"observed_at":"2026-08-08T21:16:17.522331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T21:16:17.566240Z","title":"More Details for Data Collection A.1","venue":null,"work_id":"9f0e6f54-bd13-4690-91dd-165c5203149a","year":null},"citing_paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation","version":5},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T21:16:16.863814Z"},"links":{"citing_paper":"/paper/2502.04847"},"observation_digest":"sha256:d9676dbf19b2b6643f0a9e8681c8b50173cedb5dbf9949c62478595a952796f3","observation_id":"1259710e-9eec-40fe-a124-9612c5edb2d9","resolution":{"observed_at":"2026-08-08T21:16:17.571500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04847","last_updated":"2025-08-04T07:36:34Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T19:20:02.276094Z","submitted_at":"2025-02-07T11:36:36Z","title":"HumanDiT: Pose-Guided Diffusion Transformer for Long-form Human Motion Video Generation"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 16 inbound Pith citation observations for arXiv:2502.04847."}