{"as_of":"2026-08-10T00:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e4988c4a2ae21b308b43ffcf17c57134726bd26e6d4a2191f291cc96677001ea","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:23:12.762375Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.00334/citation-record","integrity":"/paper/2507.00334/integrity","json":"/paper/2507.00334/citation-record.json","paper":"/paper/2507.00334"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:13.059967Z","title":"Fouhey, Ivan Laptev, Josef Sivic, Abhinav Gupta, and Alexei A","venue":null,"work_id":"1ab3fab5-9928-4860-985f-23e5d5d37c12","year":2012},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.687060Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:587e4d6e91fd56b58c4560189a47a2496d2fd6ce5a3b3f90111f7c42e59f9ca7","observation_id":"d2c00502-cd33-45ef-9bfe-2ffe5bd25e96","resolution":{"observed_at":"2026-08-06T21:23:13.063341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10474","last_updated":"2024-03-26T01:11:52Z","snapshot_observed_at":"2026-07-06T15:28:53.270447Z","submitted_at":"2023-05-17T17:59:16Z","title":"Preserve Your Own Correlation: A Noise Prior for Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10474","snapshot_observed_at":"2026-08-06T21:23:12.697903Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.697903Z"},"links":{"cited_paper":"/paper/2305.10474","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:4902cc6ebb95d0d7bba3598dd0649bb9cedefb140ea6edd5db92914295afd843","observation_id":"49c61981-868b-4297-82cc-18e96dff7a58","resolution":{"observed_at":"2026-08-06T21:23:12.697903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06145","last_updated":"2025-02-10T04:20:11Z","snapshot_observed_at":"2026-08-09T19:19:20.156034Z","submitted_at":"2025-02-10T04:20:11Z","title":"Animate Anyone 2: High-Fidelity Character Image Animation with Environment Affordance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06145","snapshot_observed_at":"2026-08-06T21:23:12.708601Z","title":"Animate anyone 2: High-fidelity character image animation with environment affordance.arXiv preprint arXiv:2502.06145,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.708601Z"},"links":{"cited_paper":"/paper/2502.06145","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:4ddadd2f21bab9408746a865972545c1fafc31f5e8e32794d097b7b495696d52","observation_id":"c25ede42-3767-4ac1-8629-05fa90181633","resolution":{"observed_at":"2026-08-06T21:23:12.708601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08333","last_updated":"2025-08-11T11:45:30Z","snapshot_observed_at":"2026-08-06T18:36:43.603092Z","submitted_at":"2025-01-14T18:59:59Z","title":"DAViD: Modeling Dynamic Affordance of 3D Objects Using Pre-trained Video Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08333","snapshot_observed_at":"2026-08-06T21:23:12.712364Z","title":"David: Modeling dynamic affordance of 3d objects using pre-trained video diffusion models, 2025.https://arxiv.org/abs/2501.08333","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.712364Z"},"links":{"cited_paper":"/paper/2501.08333","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:27fd06a1a52d07832c7393f3041b969716ac7721e0171380dc4daaaf66b3c5c3","observation_id":"f64611c1-989b-4065-a6af-33dbb54fbe1c","resolution":{"observed_at":"2026-08-06T21:23:12.712364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-06T21:23:12.721211Z","title":"14 Shilong Liu, Zhaoyang Zeng, Tianhe Ren, Feng Li, Hao Zhang, Jie Yang, Chunyuan Li, Jianwei Yang, Hang Su, Jun Zhu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.721211Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:f2e5b6231409bd204efa3efbb8a4e4e7b366293725c3bdfcb0a3d37a07df93f4","observation_id":"62a50608-7b31-4e50-a1fd-98ee4c5747bd","resolution":{"observed_at":"2026-08-06T21:23:12.721211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14579","last_updated":"2024-09-26T16:25:33Z","snapshot_observed_at":"2026-08-07T23:56:50.273792Z","submitted_at":"2023-12-22T10:15:15Z","title":"Synthesizing Environment-Specific People in Photographs","version":2},"cited_work":{"arxiv_id":"2312.14579","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.14579","snapshot_observed_at":"2026-08-06T21:23:12.937606Z","title":"Synthesizing Environment-Specific People in Photographs","venue":"cs.CV","work_id":"c2886246-ba37-4166-948c-ba5441297d5d","year":2023},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.728400Z"},"links":{"cited_paper":"/paper/2312.14579","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:3997c90544fd47a3da655a664b94ffaccd8e54bd4eb4d74f2ce12c2bb6b6fc9f","observation_id":"257b1446-f133-4fbe-9d3a-a6d3b4b6b768","resolution":{"observed_at":"2026-08-06T21:23:12.941665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-06T21:23:12.731808Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.731808Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:a75d3aff15fbe1b74eb8e56fab182390448046b7bbcc84f4b26bbe314052198c","observation_id":"93484021-023b-4bf8-b5db-e9eec2f6ad75","resolution":{"observed_at":"2026-08-06T21:23:12.731808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04324","last_updated":"2024-07-01T03:57:55Z","snapshot_observed_at":"2026-08-04T02:26:31.748049Z","submitted_at":"2024-02-06T19:08:18Z","title":"ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04324","snapshot_observed_at":"2026-08-06T21:23:12.735107Z","title":"Weiming Ren, Harry Yang, Ge Zhang, Cong Wei, Xinrun Du, Stephen Huang, and Wenhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.735107Z"},"links":{"cited_paper":"/paper/2402.04324","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:4779e0878aab964443e9637260b18acfe7c9132dcd0a9690e18d65cb8651a8c1","observation_id":"a2aed091-cead-4adc-91d6-3e620802ca67","resolution":{"observed_at":"2026-08-06T21:23:12.735107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10958","last_updated":"2024-07-15T17:55:09Z","snapshot_observed_at":"2026-07-06T18:46:39.497352Z","submitted_at":"2024-07-15T17:55:09Z","title":"InVi: Object Insertion In Videos Using Off-the-Shelf Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10958","snapshot_observed_at":"2026-08-06T21:23:12.738455Z","title":"Nirat Saini, Navaneeth Bodla, Ashish Shrivastava, Avinash Ravichandran, Xiao Zhang, Abhinav Shrivastava, and Bharat Singh","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.738455Z"},"links":{"cited_paper":"/paper/2407.10958","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:fcc47261be8a4d778ab122763a06e5d20f1eb826f0c34e240afe33987cbd78ba","observation_id":"94434dd0-0ad6-458c-94ec-7aad763aed84","resolution":{"observed_at":"2026-08-06T21:23:12.738455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:12.741893Z","title":"Uriel Singer, Adam Polyak, Thomas Hayes, Xi Yin, Jie An, Songyang Zhang, Qiyuan Hu, Harry Yang, Oron Ashual, Oran Gafni, Devi Parikh, Sonal Gupta, and Yaniv Taigman","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.741893Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:a8fe1318d372d3ed78a766e1643c340129045b3217d94ba4b951a5eb0ca6a15f","observation_id":"75d06842-c7b2-4987-8b31-20e8e90525cf","resolution":{"observed_at":"2026-08-06T21:23:12.741893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05131","last_updated":"2023-02-28T17:20:36Z","snapshot_observed_at":"2026-08-08T23:22:00.655876Z","submitted_at":"2022-05-10T19:32:20Z","title":"UL2: Unifying Language Learning Paradigms","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05131","snapshot_observed_at":"2026-08-06T21:23:12.745181Z","title":"Tran, Xavier Garcia, Jason Wei, Xuezhi Wang, Hyung Won Chung, Siamak Shakeri, Dara Bahri, Tal Schuster, Huaixiu Steven Zheng, Denny Zhou, Neil Houlsby, and Donald Metzler","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.745181Z"},"links":{"cited_paper":"/paper/2205.05131","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:6540a51e4a7a838b26d84bdd6d957b1b33cfa12c27c22b4f88f91e07b429ad4e","observation_id":"4d6b4ed2-1c92-4488-b1ec-a1dd95fee2c0","resolution":{"observed_at":"2026-08-06T21:23:12.745181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01430","last_updated":"2023-09-04T08:26:47Z","snapshot_observed_at":"2026-08-02T15:35:11.118369Z","submitted_at":"2023-09-04T08:26:47Z","title":"DAT++: Spatially Dynamic Vision Transformer with Deformable Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01430","snapshot_observed_at":"2026-08-06T21:23:12.752065Z","title":"Dat++: Spatially dynamic vision transformer with deformable attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.752065Z"},"links":{"cited_paper":"/paper/2309.01430","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:4ba643a8531743b44b2d47a7ad9a919467a99a486966bb5d0869fedbef038122","observation_id":"0ab42c9e-6dae-4de6-bf30-21f072092da2","resolution":{"observed_at":"2026-08-06T21:23:12.752065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01502","last_updated":"2024-09-02T23:59:01Z","snapshot_observed_at":"2026-07-06T19:09:27.758765Z","submitted_at":"2024-09-02T23:59:01Z","title":"AMG: Avatar Motion Guided Video Generation","version":1},"cited_work":{"arxiv_id":"2409.01502","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01502","snapshot_observed_at":"2026-08-06T21:23:12.810405Z","title":"AMG: Avatar Motion Guided Video Generation","venue":"cs.CV","work_id":"30c201c4-dd1a-42d9-9159-ba0a36e740b9","year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.756044Z"},"links":{"cited_paper":"/paper/2409.01502","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:37d5e3b9d9bc0c73eed2e7cf51f78054569e59d071bcb26dbb60a7117e9de83d","observation_id":"9cea3e29-550c-4d6b-8a8e-b62f6ee3c1b6","resolution":{"observed_at":"2026-08-06T21:23:12.814830Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10982","last_updated":"2023-11-18T06:25:58Z","snapshot_observed_at":"2026-07-06T16:49:21.314063Z","submitted_at":"2023-11-18T06:25:58Z","title":"Make Pixels Dance: High-Dynamic Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10982","snapshot_observed_at":"2026-08-06T21:23:12.759230Z","title":"Make pixels dance: High-dynamic video generation.arXiv:2311.10982,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.759230Z"},"links":{"cited_paper":"/paper/2311.10982","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:ec3a3cd971732398ea4e15c898873ae3db241440d622f2adfbb815cbfff402ba","observation_id":"afc3823d-ff8f-4963-a9ce-6039fa11997e","resolution":{"observed_at":"2026-08-06T21:23:12.759230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:13.050604Z","title":"Shenhao Zhu, Junming Leo Chen, Zuozhuo Dai, Yinghui Xu, Xun Cao, Yao Yao, Hao Zhu, and Siyu Zhu","venue":null,"work_id":"e76ea08e-afd3-4d3c-9d0c-d384072642d5","year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.762375Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:0e5d8ef7ab6fdd93afa7863f8025555c98ef6747d43d43994ee9fdacdc713968","observation_id":"ceb6a3c0-c822-45b2-a3fc-e5bdec43865e","resolution":{"observed_at":"2026-08-06T21:23:13.054043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14468","last_updated":"2024-11-03T21:16:54Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T15:15:00Z","title":"AnyV2V: A Tuning-Free Framework For Any Video-to-Video Editing Tasks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14468","snapshot_observed_at":"2026-08-06T21:23:12.716870Z","title":"Max Ku, Cong Wei, Weiming Ren, Harry Yang, and Wenhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.716870Z"},"links":{"cited_paper":"/paper/2403.14468","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:62514768b234c472422812c663ad49d265f4a7d70d8dda6bef79a031a71b8bfd","observation_id":"e35b201a-a990-4add-a86a-7cc744d679ba","resolution":{"observed_at":"2026-08-06T21:23:12.716870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06662","last_updated":"2023-12-11T18:59:57Z","snapshot_observed_at":"2026-08-07T19:06:02.627634Z","submitted_at":"2023-12-11T18:59:57Z","title":"Photorealistic Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06662","snapshot_observed_at":"2026-08-06T21:23:12.701371Z","title":"Photorealistic video generation with diffusion models, 2023.https://arxiv.org/abs/2312.06662","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.701371Z"},"links":{"cited_paper":"/paper/2312.06662","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:49c1367055572036af1df29159853c3f2b4d66fe96e11d2c7f777f876f722b2a","observation_id":"1909a206-97fe-472a-ac8f-167bc2ca06ff","resolution":{"observed_at":"2026-08-06T21:23:12.701371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T21:23:12.690412Z","title":"ISBN 978-3-642-33783-3","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.690412Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:f91671c05b06c86db05bf0064a2638c6884fb5dd6e30db911f81f4bef4872b28","observation_id":"620ed033-fd70-4614-88da-2ba92398777f","resolution":{"observed_at":"2026-08-06T21:23:12.690412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.06571","last_updated":"2023-08-12T13:53:10Z","snapshot_observed_at":"2026-08-07T17:54:54.749604Z","submitted_at":"2023-08-12T13:53:10Z","title":"ModelScope Text-to-Video Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.06571","snapshot_observed_at":"2026-08-06T21:23:12.748660Z","title":"Modelscope text-to-video technical report, 2023a.https://arxiv.org/abs/2308.06571","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.748660Z"},"links":{"cited_paper":"/paper/2308.06571","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:dd7fbc7cf84ecd284e25dfeadeb3f15e8254118a0744afeb60ec1b7ae231e674","observation_id":"b7dd9eae-fa44-4463-9bda-7f23d84e4b93","resolution":{"observed_at":"2026-08-06T21:23:12.748660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15807","last_updated":"2023-09-27T17:30:19Z","snapshot_observed_at":"2026-08-02T11:54:13.342379Z","submitted_at":"2023-09-27T17:30:19Z","title":"Emu: Enhancing Image Generation Models Using Photogenic Needles in a Haystack","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15807","snapshot_observed_at":"2026-08-06T21:23:12.682484Z","title":"Emu: Enhancing image generation models using photogenic needles in a haystack","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.682484Z"},"links":{"cited_paper":"/paper/2309.15807","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:062092372efdd38e9f8611df4a28295a77a39b59263226b26e5c89cc5ccdece6","observation_id":"74a42b92-080c-404c-a25d-ed8b1516d290","resolution":{"observed_at":"2026-08-06T21:23:12.682484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T21:23:12.693914Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.693914Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:c22cf282b2c876a9b2fc0d985e68abff83b426aa2abc4d6a323a497cbf8b38dd","observation_id":"980abd31-064a-4b46-bc7d-3dfcd4079937","resolution":{"observed_at":"2026-08-06T21:23:12.693914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03048","last_updated":"2025-05-01T09:40:21Z","snapshot_observed_at":"2026-08-02T13:01:06.918463Z","submitted_at":"2024-01-05T19:55:15Z","title":"Latte: Latent Diffusion Transformer for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03048","snapshot_observed_at":"2026-08-06T21:23:12.725035Z","title":"Latte: Latent diffusion transformer for video generation.arXiv preprint arXiv:2401.03048,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.725035Z"},"links":{"cited_paper":"/paper/2401.03048","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:27f48819738e8a8352e15e47158090ae4e775f0a03de229e3f39dbc250498a48","observation_id":"8d11e3cc-a032-4197-bf32-4e8ae0c94b9a","resolution":{"observed_at":"2026-08-06T21:23:12.725035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02303","last_updated":"2022-10-05T14:41:38Z","snapshot_observed_at":"2026-07-06T13:59:57.800591Z","submitted_at":"2022-10-05T14:41:38Z","title":"Imagen Video: High Definition Video Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02303","snapshot_observed_at":"2026-08-06T21:23:12.705127Z","title":"Kingma, Ben Poole, Mohammad Norouzi, David J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.705127Z"},"links":{"cited_paper":"/paper/2210.02303","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:5126415d7e26c38b24b096ef0949a1815c8d0f26197b2f4f11f434f98362b715","observation_id":"3dbc78da-5f3a-41b8-b3be-4d77d77789c1","resolution":{"observed_at":"2026-08-06T21:23:12.705127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07507","last_updated":"2025-06-03T00:03:07Z","snapshot_observed_at":"2026-08-08T12:26:21.521950Z","submitted_at":"2024-06-11T17:41:26Z","title":"Flow map matching with stochastic interpolants: A mathematical framework for consistency models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07507","snapshot_observed_at":"2026-08-06T21:23:12.674110Z","title":"Boffi, Michael S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.674110Z"},"links":{"cited_paper":"/paper/2406.07507","citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:49b9910b6b6b2e3e6207c82dd289132c72c15118f8027e5648b41568798da67c","observation_id":"ffc8f9e7-cb9e-492a-af0e-0bccb47cd800","resolution":{"observed_at":"2026-08-06T21:23:12.674110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:13.069571Z","title":null,"venue":null,"work_id":"54a1c673-d310-42f7-affb-a99d6be0a915","year":2025},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.669420Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:1163bb032f26fd91f5b4734b78de54abdb3da63bb49aa1ebaa086076be5a7a6f","observation_id":"38463b39-f0da-4dd0-bc6e-d479b6d341fd","resolution":{"observed_at":"2026-08-06T21:23:13.072739Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3715140.https://doi.org/10.1145/3715140","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:23:12.787109Z","title":"doi: 10.1145/3715140.https://doi.org/10.1145/3715140","venue":null,"work_id":"be16e1cd-5525-46c9-8c55-8ecdbee8b0b8","year":null},"citing_paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T21:23:12.678507Z"},"links":{"citing_paper":"/paper/2507.00334"},"observation_digest":"sha256:90c0433442c2dd191d84ee3051a0a5121aacf5d12ebb10bab524b3110d4fac28","observation_id":"c9db72b1-ff8b-4e03-9fa0-216c54c3cc74","resolution":{"observed_at":"2026-08-06T21:23:12.791955Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.00334","last_updated":"2025-07-01T00:21:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:57:01.785760Z","submitted_at":"2025-07-01T00:21:24Z","title":"Populate-A-Scene: Affordance-Aware Human Video Generation"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2507.00334."}