{"as_of":"2026-08-10T05:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:963669e9cdbed005b8470b535578789989939e0b66019f70e4144cc467c8e1c4","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T10:16:25.195091Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.00299/citation-record","integrity":"/paper/2508.00299/integrity","json":"/paper/2508.00299/citation-record.json","paper":"/paper/2508.00299"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.178268Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":"5d3d5cdc-3e41-4e06-a64d-d430a74197fa","year":2020},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.899974Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:1f78cd1fde95e2257f737e5dbd228d7bcfd4c7ddea45e63909524aa798ba8c66","observation_id":"f1709da7-3301-4bd1-9047-90e206426fb2","resolution":{"observed_at":"2026-08-06T10:16:26.185487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.158931Z","title":"Realtime multi-person 2d pose estimation using part affinity fields","venue":null,"work_id":"9cf5fd61-d53c-4396-af65-44d1a16ffa72","year":2017},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.906469Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:1f829abb87dabed74aa542adc8d8b60d6cee81bc8b7d3fdc442d24a53c03a8a1","observation_id":"344670a6-f5c9-433e-b2d2-1274f5d0436c","resolution":{"observed_at":"2026-08-06T10:16:26.164549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12052","last_updated":"2024-05-05T05:07:34Z","snapshot_observed_at":"2026-08-01T16:10:16.293275Z","submitted_at":"2023-11-18T10:22:44Z","title":"MagicPose: Realistic Human Poses and Facial Expressions Retargeting with Identity-aware Diffusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12052","snapshot_observed_at":"2026-08-06T10:16:24.912356Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.912356Z"},"links":{"cited_paper":"/paper/2311.12052","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:f238a8c612427064e1379af80bd56eb01f47d54d580d5819d12d25087505130d","observation_id":"2d753344-c695-471f-a7e5-00e479dbfade","resolution":{"observed_at":"2026-08-06T10:16:24.912356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.130717Z","title":"Structure and content-guided video synthesis with diffusion models","venue":null,"work_id":"7d7588f2-ad43-4d34-9e27-74fe88c12962","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.919206Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:998983555e9b48510d8b5efd080019a6fa9ade98a03eba52857a7faeb1778b8c","observation_id":"3b5b99bc-8835-4833-955b-e8aa173fa971","resolution":{"observed_at":"2026-08-06T10:16:26.137906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14475","last_updated":"2025-07-25T02:48:16Z","snapshot_observed_at":"2026-07-06T18:18:34.617427Z","submitted_at":"2024-05-23T12:04:51Z","title":"MagicDrive3D: Controllable 3D Generation for Any-View Rendering in Street Scenes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14475","snapshot_observed_at":"2026-08-06T10:16:24.928194Z","title":"Magicdrive3d: Controllable 3d genera- tion for any-view rendering in street scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.928194Z"},"links":{"cited_paper":"/paper/2405.14475","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:866054ea2bac5a5c79dc8e1075ba76bd3e8d1a81ef33361163d6eff0ea24360b","observation_id":"e04cbcc0-5027-43ca-b8dc-f6f4fa088e25","resolution":{"observed_at":"2026-08-06T10:16:24.928194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17398","last_updated":"2024-10-28T05:53:17Z","snapshot_observed_at":"2026-08-07T02:31:28.236732Z","submitted_at":"2024-05-27T17:49:15Z","title":"Vista: A Generalizable Driving World Model with High Fidelity and Versatile Controllability","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17398","snapshot_observed_at":"2026-08-06T10:16:24.935021Z","title":"Vista: A generalizable driving world model with high fidelity and versatile controllability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.935021Z"},"links":{"cited_paper":"/paper/2405.17398","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:b48eab654a223479a2367eed78b54714f7874131faa303368cf6680dec008637","observation_id":"a0b0984a-ad08-4229-97c8-ea0ac9aa733f","resolution":{"observed_at":"2026-08-06T10:16:24.935021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.101675Z","title":"8 Densepose: Dense human pose estimation in the wild","venue":null,"work_id":"850afea3-84f0-4de8-a48e-a72863a99027","year":2018},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.945679Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:8170d5bab4323e4fe62586a712c6d0200374ba5b511ca1775b1939548e19629a","observation_id":"646d4b11-bdc7-44b7-92ab-4b3199161c35","resolution":{"observed_at":"2026-08-06T10:16:26.109398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04725","last_updated":"2024-02-08T18:08:57Z","snapshot_observed_at":"2026-07-06T15:52:13.602170Z","submitted_at":"2023-07-10T17:34:16Z","title":"AnimateDiff: Animate Your Personalized Text-to-Image Diffusion Models without Specific Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04725","snapshot_observed_at":"2026-08-06T10:16:24.951761Z","title":"Animatediff: Animate your personalized text- to-image diffusion models without specific tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.951761Z"},"links":{"cited_paper":"/paper/2307.04725","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:1d049e7a50421fda76abf7d3d51d6499fd79e4122fe92cc90775a95efa1c7fe0","observation_id":"9c1c7d5b-4774-4b90-9fd9-d732087ce681","resolution":{"observed_at":"2026-08-06T10:16:24.951761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.077489Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":"999e15c5-f1b0-442e-9e58-e85492443895","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.961062Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:fa1c37ab7bd0c699153916039d32f8b0596b11976e6271630369797c726aff2b","observation_id":"2c446e23-4e59-48f8-9921-2e145ef193f8","resolution":{"observed_at":"2026-08-06T10:16:26.086274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.050407Z","title":"Composer: creative and controllable im- age synthesis with composable conditions","venue":null,"work_id":"2e4ee8d0-c9b7-4f89-8eb6-aacbed64cd1b","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.967038Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:98685b7f3e08e3e2103c32123f32c6f6b3f11cf2aed728bfafc96cdac46f82c8","observation_id":"0c54ec4b-1903-412c-a5c1-c33ef59082f3","resolution":{"observed_at":"2026-08-06T10:16:26.061135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:26.017148Z","title":"Text2performer: Text- driven human video generation","venue":null,"work_id":"7596f143-3e22-419f-b6c1-a792f5592036","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.973620Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:11bf63a3b28f50106a5f66e0f544ab6e2dfef1f002c3ef72672f1e8731e593cb","observation_id":"7f3ebcc3-659e-4b6d-8079-f3139bf4e40c","resolution":{"observed_at":"2026-08-06T10:16:26.026724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.992027Z","title":"Dreampose: Fashion image-to-video synthesis via stable diffusion","venue":null,"work_id":"6240b754-af3d-4afc-a40b-083bea0489b2","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.980160Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:6d698a3e002843b570db7fe036bbd0d4c50a1bda1687644da04e2471a5d696db","observation_id":"c05a73ef-79e9-4afe-b590-977e1d27adf9","resolution":{"observed_at":"2026-08-06T10:16:26.000347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:24.985880Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.985880Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:a08e497811b205680cf0d09851b9bbb567b74f603409d91a3625c5923ed4a2fe","observation_id":"d265aa3a-7c9f-443e-bc05-d5566f713e7d","resolution":{"observed_at":"2026-08-06T10:16:24.985880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.954679Z","title":"Text2video-zero: Text- to-image diffusion models are zero-shot video generators","venue":null,"work_id":"136a4438-5997-4a35-bc41-d78d32c67e30","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:24.996857Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:65844a2081ed32dfb342818a74b81085fba57ea1e89cd86a0cb7ef51e670cce4","observation_id":"c68de3f0-fb6f-45ef-a711-eccf83756222","resolution":{"observed_at":"2026-08-06T10:16:25.962621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-06T10:16:25.003240Z","title":"Hunyuanvideo: A systematic framework for large video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.003240Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:71489483bb893b489bf049bbb0eb8e94c5d48cd9c2b1dd15d967924dbb8a8cbb","observation_id":"c43b8eca-1d7c-4971-9c64-66c158d3560c","resolution":{"observed_at":"2026-08-06T10:16:25.003240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.932212Z","title":"Smpl: a skinned multi- person linear model","venue":null,"work_id":"ee6ad110-30be-4bc0-8cdb-1c0ca9bc727f","year":2015},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.009837Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:253e0ff77b6d59631483a9d8cbe16f3eb018e9192d2395b83a2d1724ffffd83d","observation_id":"15f9c03f-ab2a-4c2c-ae1d-1ac1c14c2c01","resolution":{"observed_at":"2026-08-06T10:16:25.939959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.015386Z","title":"Follow your pose: Pose- guided text-to-video generation using pose-free videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.015386Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:d9a4106af3a68c44cb6b61a2765a5de32e50757dd22df53df0349c9431ac215f","observation_id":"4a51c89b-3c3c-4abe-912a-984fc405fb81","resolution":{"observed_at":"2026-08-06T10:16:25.015386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.021308Z","title":"T2i-adapter: Learning adapters to dig out more controllable ability for text-to-image diffusion models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.021308Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:d9dc39ed79056bdfd861d87a06411f8b2bdb2d14f5a5ae42d15dc70beadf90bd","observation_id":"9f3c09a6-a6c0-4a6b-800d-c5d6c0ec6e26","resolution":{"observed_at":"2026-08-06T10:16:25.021308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.860008Z","title":"Recondreamer: Crafting world models for driving scene reconstruction via online restora- tion","venue":null,"work_id":"27a5c61a-4a50-486c-90b0-32c2fcb7fd5c","year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.027525Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:c10f0077f6309c1cac0259d2d079cc23b5f27292f3e9c1814edafd1cb11e9e29","observation_id":"f916f8f5-d6ec-4e8a-b33d-e1c2f0da9113","resolution":{"observed_at":"2026-08-06T10:16:25.867244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-07T12:21:17.790675Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10741","snapshot_observed_at":"2026-08-06T10:16:25.034289Z","title":"Glide: Towards photorealistic image generation and editing with text-guided diffusion models.arXiv preprint arXiv:2112.10741, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.034289Z"},"links":{"cited_paper":"/paper/2112.10741","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:6ffe3ddb3ca22f608bded8de6e5a15dbe3340437847764309ff07cad5c3e7562","observation_id":"33b947be-c410-403d-837c-2cdb30db6f0f","resolution":{"observed_at":"2026-08-06T10:16:25.034289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.040307Z","title":"Fatezero: Fus- ing attentions for zero-shot text-based video editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.040307Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:bfc68f02c1d4a4ad86457eee5c4db2309d24d127588d085df6aa38748678af19","observation_id":"a6d1d0ac-9b70-40a4-991e-452020146a0f","resolution":{"observed_at":"2026-08-06T10:16:25.040307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.046103Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.046103Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:04a35256f9ff6664c86e454024b06dd64d56f4970ecd61a554fe305ba895ac83","observation_id":"3ed40cfc-7d3f-4c3b-b90b-28feca6f9edb","resolution":{"observed_at":"2026-08-06T10:16:25.046103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.053151Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.053151Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:fcb774d501b0080ddf41f14378c0742521383a9876e59312f8e4f0f49e10e9b2","observation_id":"7629ee3c-368d-4faa-9ed2-17d8b213c0bb","resolution":{"observed_at":"2026-08-06T10:16:25.053151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.060499Z","title":"Photorealistic text-to-image diffusion models with deep language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.060499Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:3cd8505f13a8b01509a2fb2cbff9db7442b73e3691919efba875298804e0a494","observation_id":"293dd31f-36d3-4237-bb29-df108da3dcd8","resolution":{"observed_at":"2026-08-06T10:16:25.060499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14792","last_updated":"2022-09-29T13:59:46Z","snapshot_observed_at":"2026-07-06T13:57:47.051387Z","submitted_at":"2022-09-29T13:59:46Z","title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14792","snapshot_observed_at":"2026-08-06T10:16:25.068937Z","title":"Make-a-video: Text-to-video generation without text-video data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.068937Z"},"links":{"cited_paper":"/paper/2209.14792","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:0ce9c2159c94210cf73b1446c46cfa494c7b0b547ff72fbc2213e3cb6a7f6f6e","observation_id":"79e179b4-eba7-4aab-b0c2-e0f7eafe47ac","resolution":{"observed_at":"2026-08-06T10:16:25.068937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.077011Z","title":"Object- stitch: Object compositing with diffusion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.077011Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:33584013da5ebee8b16d8dbf16adf5ff6c0e7e685838a6e0049a27ad9a6d3f93","observation_id":"1c489a80-86e5-4ab7-ac51-649b990bb574","resolution":{"observed_at":"2026-08-06T10:16:25.077011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-06T10:16:25.086406Z","title":"Wan: Open and advanced large-scale video generative models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.086406Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:7e69a2c7defd199dc8e4fbbf72c659c151e4ca971b670280108e0691a236ec76","observation_id":"6529f11c-d287-4fac-953b-5ba1e316d623","resolution":{"observed_at":"2026-08-06T10:16:25.086406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.748554Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"fe237182-5112-44a5-8d8e-c9f8edec93a9","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.093477Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:a86713b0b3379e03e1f3b8a4efe66d36b83d1776803c6906c4c2a01db21e1dd7","observation_id":"278b15de-6716-47bc-9cec-64043197d453","resolution":{"observed_at":"2026-08-06T10:16:25.754803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01188","last_updated":"2024-06-03T10:51:10Z","snapshot_observed_at":"2026-07-06T18:24:17.711867Z","submitted_at":"2024-06-03T10:51:10Z","title":"UniAnimate: Taming Unified Video Diffusion Models for Consistent Human Image Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01188","snapshot_observed_at":"2026-08-06T10:16:25.100015Z","title":"Unianimate: Taming unified video diffusion mod- els for consistent human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.100015Z"},"links":{"cited_paper":"/paper/2406.01188","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:7ce8cf9216acfb31946f04e7f252bbcd41b5247fd2dfa86850de5afd4e1120fe","observation_id":"4a87a7df-35ec-44e2-aade-c41a4a05309e","resolution":{"observed_at":"2026-08-06T10:16:25.100015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.719192Z","title":"Drivedreamer: Towards real-world- drive world models for autonomous driving","venue":null,"work_id":"d12c5d8a-1e91-4c0f-9182-69f1c68d2a64","year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.107949Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:f830e42e4930f38f56ff40cf81fbd224392dbe3f2a36cf09057bfa4c28105ce0","observation_id":"7c0d608a-10e5-46ef-bb4f-cd2c987a75c7","resolution":{"observed_at":"2026-08-06T10:16:25.729069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.695150Z","title":"Panacea: Panoramic and controllable video generation for autonomous driving","venue":null,"work_id":"c24542ed-1fd4-4547-b794-3d96c2f7a7eb","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.115568Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:b782efde269c967791158702cb21d2d5d2b81f034325a4e66d04020b826ba536","observation_id":"ba92fa14-71e3-428c-b3de-32b6294b2deb","resolution":{"observed_at":"2026-08-06T10:16:25.703052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.669152Z","title":"Tune-a-video: One-shot tuning of image diffusion models for text-to-video generation","venue":null,"work_id":"f2547699-a5d6-45c0-bdea-866675f7b553","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.121320Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:db91562605c8993d984f689eee9f5a60bee95994639593feae3ba2445ed92859","observation_id":"dc2bce14-12f2-4c6e-92cf-7911afe5a1cc","resolution":{"observed_at":"2026-08-06T10:16:25.675918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.647518Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":"07e989f3-0865-4412-9386-af7472d4bb9d","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.127100Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:85671c31d701eb261b40e3f8ae37994d675afa694e8a7307f021430bae489377","observation_id":"94803cd8-7bf2-4624-9192-3ae2a51a657e","resolution":{"observed_at":"2026-08-06T10:16:25.655331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.628209Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":"674d529b-8390-47c0-a128-d67bf89a23c1","year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.132995Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:0a4402a66ed97bde089baad027781c064f4c56abf78f41ece038d12b6f18344c","observation_id":"96b44558-ee8b-4255-a4c8-8a9aadabf8c6","resolution":{"observed_at":"2026-08-06T10:16:25.633887Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06072","last_updated":"2025-03-26T08:33:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-12T11:47:11Z","title":"CogVideoX: Text-to-Video Diffusion Models with An Expert Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.06072","snapshot_observed_at":"2026-08-06T10:16:25.143215Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.143215Z"},"links":{"cited_paper":"/paper/2408.06072","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:03df5abdb24e35fff9d714a9ea119fdc5f245824a3a924a661094a1bd8ec4807","observation_id":"5e7b4c7b-6062-441a-a41a-df15c7f93c68","resolution":{"observed_at":"2026-08-06T10:16:25.143215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06721","last_updated":"2023-08-13T08:34:51Z","snapshot_observed_at":"2026-07-06T16:05:39.158819Z","submitted_at":"2023-08-13T08:34:51Z","title":"IP-Adapter: Text Compatible Image Prompt Adapter for Text-to-Image Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06721","snapshot_observed_at":"2026-08-06T10:16:25.151569Z","title":"Ip- adapter: Text compatible image prompt adapter for text-to- image diffusion models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.151569Z"},"links":{"cited_paper":"/paper/2308.06721","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:b75d4c38fdc1f4399c3b75494abd59dd11b9b7f649733ae0c8b08128269fe40b","observation_id":"0d1e3167-947e-4909-94d5-33eb166a5415","resolution":{"observed_at":"2026-08-06T10:16:25.151569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.160399Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.160399Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:bfe22ac2d9b5a9de1e8d33642114df82e8b089c2a9d52477529a3b9d30bf291f","observation_id":"cbd7a803-d5ef-44d0-8883-ed06cf4491b6","resolution":{"observed_at":"2026-08-06T10:16:25.160399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-09T19:19:40.842650Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-06T10:16:25.167688Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.167688Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:159dadfaa0dcbc04fb53a971ddf3cc59b62e476bcc28a4934c8269259cf39e31","observation_id":"b41ac559-04a8-4c33-b39c-e14d02517e70","resolution":{"observed_at":"2026-08-06T10:16:25.167688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.594722Z","title":"Drivedreamer4d: World models are effective data machines for 4d driving scene rep- resentation","venue":null,"work_id":"e25fc5fe-acbf-4583-88e7-60607c909455","year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.174086Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:f089677b547564fbe040b63761884aaf49f9ee48539e89d0586694156b69b525","observation_id":"81c170be-a10b-40bd-b804-9404866298e7","resolution":{"observed_at":"2026-08-06T10:16:25.602121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.574923Z","title":"Drivedreamer-2: Llm-enhanced world models for diverse driving video generation","venue":null,"work_id":"31557ea2-b033-44b3-afdb-be37b7464427","year":2025},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.182522Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:7958b98411a6fc4df16f41835cdda2c50939cbab79b4aa4b55def52dd265b8e7","observation_id":"5e484dbd-cf9a-43d9-a7ef-b36e74bcbdc8","resolution":{"observed_at":"2026-08-06T10:16:25.581456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.20404","last_updated":"2024-12-29T08:52:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-29T08:52:49Z","title":"Open-Sora: Democratizing Efficient Video Production for All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.20404","snapshot_observed_at":"2026-08-06T10:16:25.189045Z","title":"Open-sora: Democratizing efficient video production for all","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.189045Z"},"links":{"cited_paper":"/paper/2412.20404","citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:c2f31c39291711dfb21ac286aca3373c2383f9e959fade724672120aef32f9dd","observation_id":"1441e9cf-66fc-4c77-bae3-035f902a7308","resolution":{"observed_at":"2026-08-06T10:16:25.189045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T10:16:25.548711Z","title":"Champ: Controllable and consistent human image an- imation with 3d parametric guidance","venue":null,"work_id":"f8bdfe34-e34c-4fe9-8d1e-48804943872c","year":2024},"citing_paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T10:16:25.195091Z"},"links":{"citing_paper":"/paper/2508.00299"},"observation_digest":"sha256:8205ba173092c0c9cd34c3f13b755569de1fd1eec03b27b6cf757f135fb2476a","observation_id":"302a763e-381b-46db-917f-d4535f5dba29","resolution":{"observed_at":"2026-08-06T10:16:25.559561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.00299","last_updated":"2025-08-01T03:56:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T08:32:56.738579Z","submitted_at":"2025-08-01T03:56:57Z","title":"Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2508.00299."}