{"as_of":"2026-08-11T18:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e5a4b7128e439b539b6d20c6c7456ef0250fb80b0ad031e4d816373856edafbe","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:35:30.373373Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":25,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:04:14.380575Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T21:10:09.676485Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-11T13:07:35.192618Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:7735e8aeef68f5fed0eefe0967d5fcee9c6372d30cf177d4e7e46724eac080cd","observation_id":"cc157498-875d-48b4-a842-beae10033b8d","resolution":{"observed_at":"2026-05-17T01:03:15.211260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2512.00336","last_updated":"2026-04-19T08:45:11Z","snapshot_observed_at":"2026-08-11T04:59:34.986282Z","submitted_at":"2025-11-29T05:59:38Z","title":"MVAD: A Benchmark Dataset for Multimodal AI-Generated Video-Audio Detection","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T03:48:26.807495Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2512.00336"},"observation_digest":"sha256:85b3fe01ad8949749f728ae0154919edfa65d4c506f31eba1d57ac2bfee28789","observation_id":"b2177093-0791-4c79-9f92-221d3a59a587","resolution":{"observed_at":"2026-05-17T03:48:58.476215Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-08-11T05:36:46.515417Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T19:43:37.604351Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:2d5decfa878d08be941e353f8c997ffd2d6028fbb2833f34295a2648a3d3cb4e","observation_id":"d19122a2-98f1-43bd-a2c9-84765f842cc7","resolution":{"observed_at":"2026-05-16T19:48:21.907924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2512.23994","last_updated":"2026-05-18T09:30:21Z","snapshot_observed_at":"2026-08-11T05:36:46.515417Z","submitted_at":"2025-12-30T05:22:31Z","title":"PhyAVBench: A Challenging Audio Physics-Sensitivity Benchmark for Physically Grounded Text-to-Audio-Video Generation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-21T16:10:31.015783Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2512.23994"},"observation_digest":"sha256:574f1a76b411b3baa8f6dd477aef95d144f985f3696fb0b8716559068a1dca56","observation_id":"f09ff69a-813c-46be-8db5-611a115730d0","resolution":{"observed_at":"2026-05-21T16:14:15.230425Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-08-10T21:01:10.829067Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:864e3563c9a23e9cec95fe4da9090b775aabe833c6c690f470c9351cfa5e8212","observation_id":"c43748d0-94d2-4373-8142-ea99c47050ad","resolution":{"observed_at":"2026-05-16T13:47:57.511227Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-03T00:11:10.037400Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning.arXiv preprint arXiv:2509.08519, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.12304","last_updated":"2026-07-23T11:24:08Z","snapshot_observed_at":"2026-08-03T00:11:08.466564Z","submitted_at":"2026-02-12T03:25:41Z","title":"OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model","version":5},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T00:11:10.037400Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2602.12304"},"observation_digest":"sha256:bdcc6e06b429caa46cc70515bcc1cacf5653832465b220ca8aa5c153fbc8955e","observation_id":"7617bc1d-d26a-4f65-90f6-a0409ef9d3ad","resolution":{"observed_at":"2026-08-03T00:11:10.037400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-15T13:51:30.008232Z","title":"arXiv preprint arXiv:2509.08519 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.06445","last_updated":"2026-07-08T07:22:50Z","snapshot_observed_at":"2026-08-10T15:56:12.567330Z","submitted_at":"2026-03-06T16:37:15Z","title":"What if? Emulative Simulation with World Models for Situated Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-15T13:51:30.008232Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2603.06445"},"observation_digest":"sha256:cf680e78e07720cbca81f3c94648974144b0cd7770fb26c4bdfa57fbec6d92e9","observation_id":"64187c61-3b4e-499a-ae99-90f38bc8c8d4","resolution":{"observed_at":"2026-07-15T13:51:30.008232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-04T05:51:18.110781Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14686","last_updated":"2026-08-01T10:55:14Z","snapshot_observed_at":"2026-08-08T18:49:03.912210Z","submitted_at":"2026-03-16T00:43:38Z","title":"MVHOI: Bridge Multi-view Condition to Complex Human-Object Interaction Video Reenactment via 3D Foundation Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T05:51:18.110781Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2603.14686"},"observation_digest":"sha256:1aa8176a067e9f479a0000839889d9db170a72e07de3a4d3629565bfb7a1dcfd","observation_id":"e55e8956-b8f0-4f28-8a80-3d82ee835944","resolution":{"observed_at":"2026-08-04T05:51:18.110781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2604.11804","last_updated":"2026-04-17T08:08:09Z","snapshot_observed_at":"2026-08-06T16:53:42.723002Z","submitted_at":"2026-04-13T17:59:12Z","title":"OmniShow: Unifying Multimodal Conditions for Human-Object Interaction Video Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T15:09:02.727887Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2604.11804"},"observation_digest":"sha256:a2cf17a0fe3e975c6aee242ec9e074a24c4d612bd277d25ed5c8f7f0525aaa62","observation_id":"c0aa2cf3-d9d9-4912-b478-6bb81d717bd9","resolution":{"observed_at":"2026-05-11T11:11:00.846071Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2604.19636","last_updated":"2026-04-21T16:25:43Z","snapshot_observed_at":"2026-08-11T10:13:44.152012Z","submitted_at":"2026-04-21T16:25:43Z","title":"CoInteract: Physically-Consistent Human-Object Interaction Video Synthesis via Spatially-Structured Co-Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:45.834520Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2604.19636"},"observation_digest":"sha256:660474d5290d8a97754de1ab2407b04e5a67e7245b9a6b30be36dda53e9b9e26","observation_id":"3fbbb5f7-a58b-429f-a599-051e32a9f910","resolution":{"observed_at":"2026-05-11T12:41:04.305402Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2604.19720","last_updated":"2026-04-21T17:47:26Z","snapshot_observed_at":"2026-07-06T23:06:16.972438Z","submitted_at":"2026-04-21T17:47:26Z","title":"ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T02:24:57.882447Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2604.19720"},"observation_digest":"sha256:102eda3ec271ead254c95f84adf7ebb8abca3b95d556035e260bd259ba683c20","observation_id":"6a0795f9-e1a4-4d76-8c84-64a7468ddddd","resolution":{"observed_at":"2026-05-11T13:06:02.046272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2604.27918","last_updated":"2026-04-30T14:22:27Z","snapshot_observed_at":"2026-07-06T23:13:20.516759Z","submitted_at":"2026-04-30T14:22:27Z","title":"Generate Your Talking Avatar from Video Reference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-07T05:32:04.519820Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2604.27918"},"observation_digest":"sha256:fc0632956153db9892e0b435c6ae93e93b1d6ed2d02c74467199c9eb49bb4ecd","observation_id":"4c170827-95c6-4e97-848b-14e456023853","resolution":{"observed_at":"2026-05-12T10:36:29.856032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2605.17488","last_updated":"2026-05-17T14:56:52Z","snapshot_observed_at":"2026-08-04T04:39:45.061732Z","submitted_at":"2026-05-17T14:56:52Z","title":"Omni-Customizer: End-to-End MultiModal Customization for Joint Audio-Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T14:08:30.802619Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2605.17488"},"observation_digest":"sha256:b4024def9ac1c8cc58ed16d1cdcd9741d80c2d5b0fd6e242c65df017fe936e6c","observation_id":"43191b27-afa2-4dd0-ab05-1b3066bfbcb7","resolution":{"observed_at":"2026-05-20T14:13:21.416194Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2605.18748","last_updated":"2026-05-18T17:59:03Z","snapshot_observed_at":"2026-08-02T06:15:05.492636Z","submitted_at":"2026-05-18T17:59:03Z","title":"Aurora: Unified Video Editing with a Tool-Using Agent","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-20T10:47:05.038308Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2605.18748"},"observation_digest":"sha256:23348aebdd719cb60c8fb5cb0617cacc33a37389f8e06ae6052b1cc5fdc7e2b2","observation_id":"c6630e7a-2ec7-401d-a29e-2a57d085da97","resolution":{"observed_at":"2026-05-20T10:48:12.712658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2605.24652","last_updated":"2026-05-23T16:42:39Z","snapshot_observed_at":"2026-08-09T04:08:48.023047Z","submitted_at":"2026-05-23T16:42:39Z","title":"AVBench: Human-Aligned and Automated Evaluation Benchmark for Audio-Video Generative Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T13:35:01.226818Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2605.24652"},"observation_digest":"sha256:93ffb0a45eac69cdfaab3f8400d6f6e2a8ef4f380f04e39d7b2df02650441a0e","observation_id":"ecb2003d-3b8c-4c9f-bf19-2a13a20370de","resolution":{"observed_at":"2026-06-30T13:44:41.246048Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2605.26486","last_updated":"2026-05-26T02:54:12Z","snapshot_observed_at":"2026-08-11T12:55:59.502969Z","submitted_at":"2026-05-26T02:54:12Z","title":"LongCat-Video-Avatar 1.5 Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T18:28:16.968339Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2605.26486"},"observation_digest":"sha256:18247d806b9ed3ea2cf8c12dee40b7ace3716e4b6a30a152239c3b30d62c4248","observation_id":"b3cb5746-2fbf-4d8a-9bfd-8afa6b38967f","resolution":{"observed_at":"2026-06-29T18:33:50.636837Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2606.02441","last_updated":"2026-06-01T16:12:18Z","snapshot_observed_at":"2026-08-08T05:56:53.706139Z","submitted_at":"2026-06-01T16:12:18Z","title":"Spatial-Temporal Decoupled Reference Conditioning for Identity-Preserving Text-to-Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T15:25:22.778550Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2606.02441"},"observation_digest":"sha256:6fe72f572b8aa7fbb0dcfc3c8da81c8fce3d16078a4cb7253501fd740fd0f2ae","observation_id":"b2f10b8f-5a9c-4371-9d50-d5d54890b41c","resolution":{"observed_at":"2026-07-01T22:26:17.473972Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2606.10839","last_updated":"2026-06-22T14:44:53Z","snapshot_observed_at":"2026-08-08T03:14:09.273162Z","submitted_at":"2026-06-09T13:26:39Z","title":"HarmoView: Harmonizing Multi-View Constraints for Identity-Consistent Video Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T13:49:50.272650Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2606.10839"},"observation_digest":"sha256:0c50a7d26f7cf85b900f27fc95c278331d2f75aab3d72019580f36bae7732b59","observation_id":"23737e46-c8ca-483b-a636-1a1101528f32","resolution":{"observed_at":"2026-07-03T04:37:36.651576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":"2509.08519","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-04T21:10:09.676485Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning","venue":null,"work_id":"313111a9-b492-44f5-bf1f-6b5c2c642abf","year":2025},"citing_paper":{"arxiv_id":"2606.26058","last_updated":"2026-06-24T17:33:13Z","snapshot_observed_at":"2026-08-10T18:08:57.833777Z","submitted_at":"2026-06-24T17:33:13Z","title":"DomainShuttle: Freeform Open Domain Subject-driven Text-to-video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-25T19:00:23.260939Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2606.26058"},"observation_digest":"sha256:666012f9231af7d251275d45d6c14424f9f0727738ad689063044f88022adc8e","observation_id":"f6df4e3b-1a50-4e2e-a38f-4b7da48f6258","resolution":{"observed_at":"2026-07-04T21:10:09.678040Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-11T20:11:31.576642Z","title":"arXiv preprint arXiv:2509.08519 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04311","last_updated":"2026-07-07T14:30:21Z","snapshot_observed_at":"2026-08-11T18:31:58.276527Z","submitted_at":"2026-07-05T13:54:33Z","title":"Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-11T20:11:31.576642Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2607.04311"},"observation_digest":"sha256:c501f30f326c506567781b53468dd6c11a5fcb7283317565a43ded9c909ca128","observation_id":"8f0d2e04-551f-41c2-9952-bb51c793bb71","resolution":{"observed_at":"2026-07-11T20:11:31.576642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-01T10:37:57.061257Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20174","last_updated":"2026-07-22T14:06:39Z","snapshot_observed_at":"2026-08-09T20:55:01.986085Z","submitted_at":"2026-07-22T14:06:39Z","title":"StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T10:37:57.061257Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2607.20174"},"observation_digest":"sha256:7b843a598b02c0796907e9af8679979bab82465488d18f992825307a6b947672","observation_id":"a7effad9-82da-4ba1-ae87-441f648ab486","resolution":{"observed_at":"2026-08-01T10:37:57.061257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-01T05:27:15.266478Z","title":"Humo: Human-centric video generation via collaborative multi-modal conditioning.arXiv preprint arXiv:2509.08519, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.22241","last_updated":"2026-07-30T03:34:42Z","snapshot_observed_at":"2026-08-06T04:16:05.161328Z","submitted_at":"2026-07-24T12:17:57Z","title":"AgentHOI: Multi-Agent Reasoning for Human-Object-Interaction Video Generation via Implicit Representation Alignment","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T05:27:15.266478Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2607.22241"},"observation_digest":"sha256:3a02419061b086f6780c52ff77d5436882d4cdf4f70afd92c16c6eef0939ccb6","observation_id":"65597ed5-91f9-48d8-8830-5a7d2d18c6a9","resolution":{"observed_at":"2026-08-01T05:27:15.266478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-01T04:27:31.607132Z","title":"arXiv preprint arXiv:2509.08519 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.22830","last_updated":"2026-07-24T18:12:58Z","snapshot_observed_at":"2026-08-08T06:26:12.527056Z","submitted_at":"2026-07-24T18:12:58Z","title":"ID-V2V: Identity-Preserving Video Restylization","version":1},"reference_index":204,"source":"arxiv_source","source_observed_at":"2026-08-01T04:27:31.607132Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2607.22830"},"observation_digest":"sha256:cffb7a407b0ef437bc796afb9ba233d5e45060c38e069cbf4bd8be2028b4f9f5","observation_id":"8917a336-66f4-4a14-b688-44e063684b20","resolution":{"observed_at":"2026-08-01T04:27:31.607132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-07-30T20:31:38.681716Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23517","last_updated":"2026-07-26T07:34:14Z","snapshot_observed_at":"2026-08-10T00:06:45.195279Z","submitted_at":"2026-07-26T07:34:14Z","title":"Real-Time Human-Centric World Modeling for Upper-Body Human-Object Interaction","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-30T20:31:38.681716Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2607.23517"},"observation_digest":"sha256:d9506d5b4c664b1cb085d1ec43ef077d4654b926323fff5b6320ff50f86817dc","observation_id":"99433b28-261f-4369-903d-a30387fef95f","resolution":{"observed_at":"2026-07-30T20:31:38.681716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.08519","snapshot_observed_at":"2026-08-06T13:04:14.380575Z","title":"arXiv preprint arXiv:2509.08519 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04956","last_updated":"2026-08-05T15:27:26Z","snapshot_observed_at":"2026-08-08T23:13:39.797567Z","submitted_at":"2026-08-05T15:27:26Z","title":"ContextMaster: Interactive Multi-Shot Video Creation via Fixed-Budget Sparse Context Routing","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-06T13:04:14.380575Z"},"links":{"cited_paper":"/paper/2509.08519","citing_paper":"/paper/2608.04956"},"observation_digest":"sha256:1ef7e1b8186e73078a228e15fa91cd23de3e1da345fcba2ba9bccbfa9da55d21","observation_id":"ff8d26ba-0435-4682-9be0-1eaf459188d7","resolution":{"observed_at":"2026-08-06T13:04:14.380575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.08519/citation-record","integrity":"/paper/2509.08519/integrity","json":"/paper/2509.08519/citation-record.json","paper":"/paper/2509.08519"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.233495Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.233495Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:fdd7d5780428561febe9d1a28662594a8bd9c9533957b1d12bbb62a5eaff5119","observation_id":"9f6e52b1-42c4-4c68-8d10-025ce616f829","resolution":{"observed_at":"2026-08-04T20:35:30.233495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04896","last_updated":"2025-02-10T13:56:35Z","snapshot_observed_at":"2026-08-10T10:23:34.227473Z","submitted_at":"2025-02-07T13:03:55Z","title":"Goku: Flow Based Video Generative Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04896","snapshot_observed_at":"2026-08-04T20:35:30.238979Z","title":"Goku: Flow based video generative foundation models.arXiv preprint arXiv:2502.04896, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.238979Z"},"links":{"cited_paper":"/paper/2502.04896","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:3210f1eb696c922d6cf318a3d3e900dae9af021fac282ca75ff30cf4ade8e143","observation_id":"6cff7969-361a-4ced-bf5a-e069987fa478","resolution":{"observed_at":"2026-08-04T20:35:30.238979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.244265Z","title":"Phantom-data : Towards a general subject-consistent video generation dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.244265Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:ce5225afbbac0f859e267720189b959685e1487fc580b4ed298d49d497d5a85c","observation_id":"c7a744eb-4b69-4c52-a723-e40767a1831a","resolution":{"observed_at":"2026-08-04T20:35:30.244265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.248586Z","title":"Unimax: Fairer and more effective language sampling for large-scale multilingual pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.248586Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:cce35b3c9df2cd81c866459a194c21fe54f7edb27f70f36f8b202a54b073a792","observation_id":"01de29e7-9c07-4e5c-9b3b-f2d0a4f64690","resolution":{"observed_at":"2026-08-04T20:35:30.248586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.252509Z","title":"Hallo3: Highly dynamic and realistic portrait image animation with video diffusion transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.252509Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:0efcd0e7af3ae51640abe201170ef6a274127e73bba1c6ffbb3999d724c88825","observation_id":"73526c4d-fef5-4337-a088-f151684a4563","resolution":{"observed_at":"2026-08-04T20:35:30.252509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.256166Z","title":"Arcface: Additive angular margin loss for deep face recognition.IEEE Transactions on Pattern Analysis and Machine Intelligence, page 1–1, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.256166Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:d43daddce7ffcbe8c5d40637dc00383ccde77f75f897abeb1d9304b31d41c156","observation_id":"1982d1ed-fb0e-4aa2-a0c1-7a6d565eae51","resolution":{"observed_at":"2026-08-04T20:35:30.256166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.259941Z","title":"Magref: Masked guidance for any-reference video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.259941Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:a4111de439839f52d6c85540f1a47d4eb53d347636d31afe10f98257bbdf307e","observation_id":"e04f3538-3bc5-484b-ac68-160620b20b12","resolution":{"observed_at":"2026-08-04T20:35:30.259941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.264055Z","title":"Seedream 3.0 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.264055Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:0d9053f67c378c3771e548a813617fd2725e71ba9e4dc14922a965f9b2f7ae8e","observation_id":"44100d2c-905c-4bed-8b66-757f6c16f9e7","resolution":{"observed_at":"2026-08-04T20:35:30.264055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09113","last_updated":"2025-06-28T11:58:23Z","snapshot_observed_at":"2026-08-09T02:36:54.979612Z","submitted_at":"2025-06-10T17:56:11Z","title":"Seedance 1.0: Exploring the Boundaries of Video Generation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09113","snapshot_observed_at":"2026-08-04T20:35:30.268006Z","title":"Seedance 1.0: Exploring the boundaries of video generation models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.268006Z"},"links":{"cited_paper":"/paper/2506.09113","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:c2ab4fed3aac1718a589590f4e5ceeddb2a4c576282f7d039e11dd1bd5c6da7c","observation_id":"74c364d4-1825-4b38-87bc-97a4f1befbf4","resolution":{"observed_at":"2026-08-04T20:35:30.268006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15275","last_updated":"2024-06-25T16:57:27Z","snapshot_observed_at":"2026-08-10T20:05:48.970997Z","submitted_at":"2024-04-23T17:59:43Z","title":"ID-Animator: Zero-Shot Identity-Preserving Human Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15275","snapshot_observed_at":"2026-08-04T20:35:30.271855Z","title":"Id-animator: Zero-shot identity-preserving human video generation.arXiv preprint arXiv:2404.15275, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.271855Z"},"links":{"cited_paper":"/paper/2404.15275","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:08c2c789688a021f2030bb1e43bab90bbbd7f4fb7ed3c4ff2038e458382feb90","observation_id":"5c884a46-d3b8-45aa-acca-7cf61f7e5515","resolution":{"observed_at":"2026-08-04T20:35:30.271855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.275819Z","title":"Hunyuancustom: A multimodal-driven architecture for customized video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.275819Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:7ad178bfdcc29a9d359b8e814fc1548ea4cdb9c81e2afe7b6f63ef3800d4579b","observation_id":"3b99b558-d953-4af1-bf04-df27b6da5e97","resolution":{"observed_at":"2026-08-04T20:35:30.275819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.279526Z","title":"Curricularface: Adaptive curriculum learning loss for deep face recognition","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.279526Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:45cff2c351bfedebb6e55eb449cdbd4fdc71d6c65053f768cefcecce31dc3637","observation_id":"863638f1-8ad9-4be2-a9a8-6b58c0f34f5c","resolution":{"observed_at":"2026-08-04T20:35:30.279526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.283029Z","title":"Vbench: Comprehensive benchmark suite for video generative models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.283029Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:14b820993ed2ee5e59b7321e5fccd7422c7a8b2f97bcf340a50ea6e24de9d6e4","observation_id":"c5c714b8-89c6-4e78-8a3d-a5fdac551aec","resolution":{"observed_at":"2026-08-04T20:35:30.283029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.286812Z","title":"Multi-reference images to video generation feature","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.286812Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:1e9be27184928c6e6589d4163b390028a1b071f247d25b7e7845a247986239de","observation_id":"fdbdf8e8-125d-48c5-959f-175d01f7c997","resolution":{"observed_at":"2026-08-04T20:35:30.286812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03603","last_updated":"2025-03-11T08:14:25Z","snapshot_observed_at":"2026-08-03T00:44:01.942521Z","submitted_at":"2024-12-03T23:52:37Z","title":"HunyuanVideo: A Systematic Framework For Large Video Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03603","snapshot_observed_at":"2026-08-04T20:35:30.290001Z","title":"Hunyuanvideo: A systematic framework for large video generative models.arXiv preprint arXiv:2412.03603, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.290001Z"},"links":{"cited_paper":"/paper/2412.03603","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:78d12f065946cfea8ee57d3d4ff35b0907dc52f55760561e13f92c204bd85e5d","observation_id":"e02591c5-48db-4050-9bf1-7b32005ecb64","resolution":{"observed_at":"2026-08-04T20:35:30.290001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.293710Z","title":"Let them talk: Audio-driven multi-person conversational video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.293710Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:8e0d0ceb3b6fa5402d1cb5b2702b01b8f8410d06bb93caadc7dfd5c6d0c5df9b","observation_id":"e85d97a2-7601-46d2-a88a-5a5e715ee43d","resolution":{"observed_at":"2026-08-04T20:35:30.293710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.297026Z","title":"Latentsync: Taming audio-conditioned latent diffusion models for lip sync with syncnet supervision,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.297026Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:4b86abbebc02cb9c10e48867b89c44c92e92234043508bcbc1eb2937389ee590","observation_id":"e8056d4d-a20d-4e3a-82c0-26d76dd245ec","resolution":{"observed_at":"2026-08-04T20:35:30.297026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.304093Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.304093Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:fc176a938a5d5c59ab5c779b196524d4139f7d06f8ddad9531700844450b969b","observation_id":"0fe98423-05f1-4ca0-ad34-4ad69779c0d0","resolution":{"observed_at":"2026-08-04T20:35:30.304093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.307584Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.307584Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:c703b1289a30c168166e5974fdbc081f08214f2a74361b58bd474181b8945da1","observation_id":"6d9df52a-35b1-4f13-a357-79421bbbcf0b","resolution":{"observed_at":"2026-08-04T20:35:30.307584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.311182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.311182Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:ace10b448a09e21f0caae08be206fc965f33cc38505005397a610ceaadbaa698","observation_id":"54b180c7-8a38-4f89-8ad7-61606f1148ea","resolution":{"observed_at":"2026-08-04T20:35:30.311182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.314780Z","title":"Improving video generation with human feedback, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.314780Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:ced2dac48973117f10f2a33ef77557d2e64a089bf86a244cc50c6d23de0c53cc","observation_id":"19d52d6e-60b5-4514-95eb-4cfa52ede0b2","resolution":{"observed_at":"2026-08-04T20:35:30.314780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.318096Z","title":"Phantom: Subject-consistent video generation via cross-modal alignment","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.318096Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:0079d0ed3512cf9906f08dd576b6582821ac2ccb8f1f5aa71f14f2e7c26882fc","observation_id":"89dac79d-2b20-4695-8017-7d86e6f3cecd","resolution":{"observed_at":"2026-08-04T20:35:30.318096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.321358Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.321358Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:85b3ea3412a48fbea080a1c8b27bab2a95b4e21cd2682247cf1632e161bd65ac","observation_id":"8edc8a2e-5f5e-405f-83ba-f097b569c2e0","resolution":{"observed_at":"2026-08-04T20:35:30.321358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-10T21:41:31.247717Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-04T20:35:30.324506Z","title":"Movie gen: A cast of media foundation models.arXiv preprint arXiv:2410.13720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.324506Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:8487c58570337faa0d8a05e0febabbb43040d956777f7cd2708b87712b4b9282","observation_id":"dcca47f5-00a3-4da8-9eea-bfe8a32261de","resolution":{"observed_at":"2026-08-04T20:35:30.324506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.328222Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.328222Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:2d65d13bfbf270ee34d0e1c37f4a65d86cb85f8efbf794ff19b702a6ff60966b","observation_id":"dd519e46-b700-4561-93c2-7c6a130b742e","resolution":{"observed_at":"2026-08-04T20:35:30.328222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.331572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.331572Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:d37b4b39c1bc0553fdd596114af155356c5bf7d6e0b0e56e0754f7be0eed56cb","observation_id":"e35adaba-2d5d-45de-a961-6add66bae3d7","resolution":{"observed_at":"2026-08-04T20:35:30.331572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-11T03:47:05.420581Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-04T20:35:30.335032Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.335032Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:ecc205b5de024c409f970ddb6b9fb49609f5e523685bbb0e76ab1b672200996d","observation_id":"1342596d-7656-46e5-9770-fa20a0badf5b","resolution":{"observed_at":"2026-08-04T20:35:30.335032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.338475Z","title":"Seitz, and Ira Kemelmacher-Shlizerman","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.338475Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:4567a5a29618bbf2a267e33c42d33d601b98b4cfe4f19f9ee6947ba737417005","observation_id":"404e1143-193f-435e-a946-c7821ae3966b","resolution":{"observed_at":"2026-08-04T20:35:30.338475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.341527Z","title":"Gemini 2.5 flash image","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.341527Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:75591124e858ff91682c7c67ee4ad8e966890cb74d4e2e92d9bd62e9df61c246","observation_id":"66a12392-8187-48c7-99b0-49621ece1022","resolution":{"observed_at":"2026-08-04T20:35:30.341527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.344720Z","title":"Gemini 2.5: Our most intelligent ai model.https://blog.google/technology/google-deepmind/ gemini-model-thinking-updates-march-2025/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.344720Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:0e0fe82514a53710fd356b055b9d8b1c3fe4cc7463da352c0137c67f05b77122","observation_id":"5015b6f4-0fdf-4cc8-99f7-331a36e5d40e","resolution":{"observed_at":"2026-08-04T20:35:30.344720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.348072Z","title":"Wan: Open and advanced large-scale video generative models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.348072Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:da8f4896623af164ffb3ac96348e041d4bbec9e0feddab284a2a6224963fbc9b","observation_id":"6761de8e-cee4-4ef1-8e5c-626d1aece653","resolution":{"observed_at":"2026-08-04T20:35:30.348072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.352280Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.352280Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:8b1674df03422fa34aba247c02f2bcf7d552d46204fe0c07936353ea9cbb6725","observation_id":"535abdab-5554-4da2-b606-24ca809d2cbc","resolution":{"observed_at":"2026-08-04T20:35:30.352280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.355742Z","title":"Koala-36m: A large-scale video dataset improving consistency between fine-grained conditions and video content","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.355742Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:ca03c6bb869dd86b5df4369325f955b90367dece3de407dc4224dc5d74ed2c86","observation_id":"e298fb75-861e-4e5f-b1d5-32b3bd102811","resolution":{"observed_at":"2026-08-04T20:35:30.355742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.359072Z","title":"Interacthuman: Multi-concept human animation with layout-aligned audio conditions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.359072Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:c6ab15bb98599d539d7f323b0da8986c959b4e8127907458fbc77b28403a9bfd","observation_id":"b517a61d-d8bc-4ca9-ae08-daba4705f3d7","resolution":{"observed_at":"2026-08-04T20:35:30.359072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.362761Z","title":"Mocha: Towards movie-grade talking character synthesis, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.362761Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:d75801f0ebcddec50d94caae9527dd783168bd862cce1f561d59ee60b078a0ce","observation_id":"ca611332-8519-4922-aa86-96592f562257","resolution":{"observed_at":"2026-08-04T20:35:30.362761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.366342Z","title":"Magicinfinite: Generating infinite talking videos with your words and voice, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.366342Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:d3ae65e7a6689ec170b79b2c28d80c40039e011f00b96ca288a2ee6c78acf033","observation_id":"5d0c4ebe-897b-41e1-9b3f-afff7b7f7a52","resolution":{"observed_at":"2026-08-04T20:35:30.366342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.369765Z","title":"Opens2v-nexus: A detailed benchmark and million-scale dataset for subject-to-video generation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.369765Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:5b1a1522b0090d884ad7b11a811f017a264b85a570baca38b1d0b624fb96394e","observation_id":"200ba8ae-e51a-4cd2-b076-cb23f14777c6","resolution":{"observed_at":"2026-08-04T20:35:30.369765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:35:30.373373Z","title":"Identity- preserving text-to-video generation by frequency decomposition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.373373Z"},"links":{"citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:eaa7611be8a999a6cb2a7f907033b817deadaf1e58039706de07b6bdac894383","observation_id":"437606c5-bc8c-40c1-ac7f-c34dc4d3a8af","resolution":{"observed_at":"2026-08-04T20:35:30.373373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09262","last_updated":"2025-03-13T09:17:52Z","snapshot_observed_at":"2026-08-11T17:03:35.116642Z","submitted_at":"2024-12-12T13:20:52Z","title":"LatentSync: Taming Audio-Conditioned Latent Diffusion Models for Lip Sync with SyncNet Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09262","snapshot_observed_at":"2026-08-04T20:35:30.300454Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T20:35:30.300454Z"},"links":{"cited_paper":"/paper/2412.09262","citing_paper":"/paper/2509.08519"},"observation_digest":"sha256:791ebefec12a59cd7008e884dd0669ebb7a4d17e48c1aa95e655eef7bb8f0a3f","observation_id":"d05a74d5-491e-44ba-a394-a08056f9ec64","resolution":{"observed_at":"2026-08-04T20:35:30.300454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.08519","last_updated":"2025-09-10T11:54:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T10:23:44.624492Z","submitted_at":"2025-09-10T11:54:29Z","title":"HuMo: Human-Centric Video Generation via Collaborative Multi-Modal Conditioning"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 25 inbound Pith citation observations for arXiv:2509.08519."}