{"as_of":"2026-08-20T13:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c481c98fd5500b81bfb118392f13ebaf2dce288b7d414c25a6ba146781c5340","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:55:19.714539Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01944/citation-record","integrity":"/paper/2608.01944/integrity","json":"/paper/2608.01944/citation-record.json","paper":"/paper/2608.01944"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.406201Z","title":"Communication, Simulation, and Intelligent Agents: Implications of Personal Intelligent Machines for Medical Education","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.406201Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:986616be5a3f42097b0768aae9ebcd7ae4809dec09acc7b15fec976184f57ab4","observation_id":"c316f3e0-5ed7-4045-8119-d2213561d3a5","resolution":{"observed_at":"2026-08-04T17:55:19.406201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.411301Z","title":"Classification Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.411301Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:56fd850653f3ec936e6fe0458ba7596f8c5e71d1074144f7e1639663f0f061c7","observation_id":"4e68b746-dbd0-4e19-87f1-9150a7884f18","resolution":{"observed_at":"2026-08-04T17:55:19.411301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.415791Z","title":", title =","venue":null,"work_id":null,"year":1980},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.415791Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:325cf453e1b36efc81508fa3ae65124c48645a1aa3f52990038d7b76f34a89ec","observation_id":"6ae3583a-db13-47b4-8a67-feada3b02c83","resolution":{"observed_at":"2026-08-04T17:55:19.415791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.420364Z","title":"New Ways to Make Microcircuits Smaller---Duplicate Entry","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.420364Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e519ebed6d43825c79a2cf868952f3af46f30f80147f0f4785cfb76c78329752","observation_id":"5f535607-69b9-452c-9d73-53ca44a2513b","resolution":{"observed_at":"2026-08-04T17:55:19.420364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.424584Z","title":"Clancey and Glenn Rennels , abstract =","venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.424584Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:76efb709bc85e1e1b34d56dfeb6ebf90316897db0631dbad7a07274f9801e0dd","observation_id":"4a4b830b-8cb9-42e2-a134-500b938b8c25","resolution":{"observed_at":"2026-08-04T17:55:19.424584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.429299Z","title":"and Rennels, Glenn R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.429299Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:3408417e058cc14df63d17c6c352e57ffab9076b6479fad02c3de1cbbcbbd8a0","observation_id":"1af77669-36ae-40f4-8267-a412507b6d50","resolution":{"observed_at":"2026-08-04T17:55:19.429299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.433780Z","title":"Poligon: A System for Parallel Problem Solving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.433780Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:df564e32b3695124f62403ff32e847a78f3bafc001ec1b3c776965d205e02371","observation_id":"9eab829e-53a6-4566-a4df-0e553a0c8b90","resolution":{"observed_at":"2026-08-04T17:55:19.433780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.438304Z","title":"Transfer of Rule-Based Expertise through a Tutorial Dialogue","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.438304Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:0be4946fdfe4b0af0d7332f5ecb341dd6f815fc54c33543d4381b85db54696c3","observation_id":"1e825180-2cf5-4acd-b585-f505b5e1244c","resolution":{"observed_at":"2026-08-04T17:55:19.438304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.443500Z","title":"The Engineering of Qualitative Models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.443500Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:6ed5b9f355a61f49185b33bc1a91ab6ea9ccd1382fd3ec829f6f7c34f0649ffe","observation_id":"55621505-9df0-441e-9d83-38511cbc32a0","resolution":{"observed_at":"2026-08-04T17:55:19.443500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.447880Z","title":"2023 , eprint=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.447880Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:7800f76973bdc2dab75521f06aac2bcdc85a372677b2a10c429713fa42b9ae94","observation_id":"867725f0-158f-4a64-98e3-f9650572e46c","resolution":{"observed_at":"2026-08-04T17:55:19.447880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.452519Z","title":"Pluto: The 'Other' Red Planet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.452519Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:256fa30671323960380c7d5e7dcbb122a983ead8e373982c009e4b16e740222a","observation_id":"b1acab0e-0136-413e-b557-7793f6ae7d0b","resolution":{"observed_at":"2026-08-04T17:55:19.452519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.456615Z","title":"ICLR workshop on deep generative models for highly structured data , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.456615Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:c2c569f1712ada2b4a68137a55cae7f729d5540a0b7e3625f5d5b7d597a94304","observation_id":"ac596da4-23b9-41f4-84b2-38320fb70ea0","resolution":{"observed_at":"2026-08-04T17:55:19.456615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-04T17:55:19.460765Z","title":"arXiv preprint arXiv:2311.15127 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.460765Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:15f47b07e0e7b461c52ea55e0bf24e8596998f7dc117ba42e36d4bcad5b287fc","observation_id":"55c654e4-6f78-41f7-8b54-973e7ffc73cf","resolution":{"observed_at":"2026-08-04T17:55:19.460765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.465499Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.465499Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:9f498874c8f9970477403e6f172d635be98e6b8badbac7a5564e1e26e790711e","observation_id":"d25c82cd-c5ee-4b47-aaf1-6583ec843de6","resolution":{"observed_at":"2026-08-04T17:55:19.465499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11325","last_updated":"2025-01-20T08:09:36Z","snapshot_observed_at":"2026-08-19T20:26:20.409139Z","submitted_at":"2025-01-20T08:09:36Z","title":"CatV2TON: Taming Diffusion Transformers for Vision-Based Virtual Try-On with Temporal Concatenation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11325","snapshot_observed_at":"2026-08-04T17:55:19.469516Z","title":"arXiv preprint arXiv:2501.11325 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.469516Z"},"links":{"cited_paper":"/paper/2501.11325","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:f3be4808b26f7008ff4384957da41bb7b7b83b5437e5c3379a799805424d7c35","observation_id":"5e1943a3-2872-4aa0-897d-08668255fe95","resolution":{"observed_at":"2026-08-04T17:55:19.469516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.474003Z","title":"Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision (WACV) , month =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.474003Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:71e5863f7606f0d8b632845fe9c40b84ac8ef021cf1e44a1e617555b1557b35a","observation_id":"6cd4fafb-afc7-46dc-8dff-bdb6b2a95349","resolution":{"observed_at":"2026-08-04T17:55:19.474003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14977","last_updated":"2025-04-21T09:09:21Z","snapshot_observed_at":"2026-08-19T14:05:22.876216Z","submitted_at":"2025-04-21T09:09:21Z","title":"RealisDance-DiT: Simple yet Strong Baseline towards Controllable Character Animation in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14977","snapshot_observed_at":"2026-08-04T17:55:19.478448Z","title":"arXiv preprint arXiv:2504.14977 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.478448Z"},"links":{"cited_paper":"/paper/2504.14977","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:ea7a51701f87db62dcb3eb9f82085449fabd69d6c746fa6591148a38791d1334","observation_id":"248b0822-583b-46b8-9ee5-a4564cf405b8","resolution":{"observed_at":"2026-08-04T17:55:19.478448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06202","last_updated":"2024-09-10T04:14:11Z","snapshot_observed_at":"2026-08-16T13:19:54.079878Z","submitted_at":"2024-09-10T04:14:11Z","title":"RealisDance: Equip controllable character animation with realistic hands","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06202","snapshot_observed_at":"2026-08-04T17:55:19.482839Z","title":"arXiv preprint arXiv:2409.06202 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.482839Z"},"links":{"cited_paper":"/paper/2409.06202","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:7544b99ae1c2a5b62aba19d3aec2ee6f8ca991350fe8f224ccd5000688bf7c2d","observation_id":"ec7023fe-9ede-45a9-bb20-aeb1a01c41ed","resolution":{"observed_at":"2026-08-04T17:55:19.482839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.487593Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.487593Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:b1f17a7b60c22851f6098d45687d2f24227f930da2a8c0b81e5b5c7b41f38d42","observation_id":"0bede6f5-e7b4-4e59-850e-0ad41425a9e2","resolution":{"observed_at":"2026-08-04T17:55:19.487593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.492567Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.492567Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e33ce80055819acd9d2d7a0e228cc558700c856c0ee04d9a8a65e0e36a888620","observation_id":"5a5c15a0-a319-483b-9e9c-1420bd3a8b1d","resolution":{"observed_at":"2026-08-04T17:55:19.492567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.497338Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.497338Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:98eaba74e9c24f39d647e0f24db7b37f4249a1572cdeeff689fcf98f131520f6","observation_id":"bae3eb34-dda3-4df3-9779-c75fdd313f3f","resolution":{"observed_at":"2026-08-04T17:55:19.497338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.501751Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.501751Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:ae0075d2037449f85bf01f4bc5090775f9d16c803b4ccf08dd8677e54d5ed371","observation_id":"e7e2668a-6e12-412a-9d47-279fb2c81e7f","resolution":{"observed_at":"2026-08-04T17:55:19.501751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.505874Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.505874Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:f50f41e5cae63bb58ec1979da992f26d1ff48db5460651df0d2fceea9263d620","observation_id":"a3e40bb2-0e6f-493d-a417-6aea457936a7","resolution":{"observed_at":"2026-08-04T17:55:19.505874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.10804","last_updated":"2026-08-05T01:57:13Z","snapshot_observed_at":"2026-08-13T04:21:58.755533Z","submitted_at":"2026-06-09T12:49:34Z","title":"SCAIL-2: Unifying Controlled Character Animation with End-to-End In-Context Conditioning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.10804","snapshot_observed_at":"2026-08-04T17:55:19.510168Z","title":"arXiv preprint arXiv:2606.10804 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.510168Z"},"links":{"cited_paper":"/paper/2606.10804","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:f65c1e98cd0668c9f5576dad0e466d83db62b40c2c7ca68dda5519464376a55f","observation_id":"d020ff75-5cbb-42a0-90e0-da5833f4d97b","resolution":{"observed_at":"2026-08-04T17:55:19.510168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.515118Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.515118Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:7a02282130cd5403f2d14cb70faa6284974a849e26b338512e37bbab38b4ec05","observation_id":"3b073e8d-ed8b-4fb6-af2e-453b8e0efe20","resolution":{"observed_at":"2026-08-04T17:55:19.515118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-08-16T17:39:09.604516Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-08-04T17:55:19.519320Z","title":"arXiv preprint arXiv:2404.02101 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.519320Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:9ce94eb715675878ceb9e7ed4c7c43fd7aeff0c290641f8674970eb7cede3daa","observation_id":"fbc96dd1-5f5f-4b3f-8a6b-3feb33fe39a7","resolution":{"observed_at":"2026-08-04T17:55:19.519320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.524312Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.524312Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:15b6a4cce78ea4c39881bfa2d3c3cde74d97f11eb3af7dec9f1df903acb972f0","observation_id":"cabec608-af36-4249-9566-c114667ca8f3","resolution":{"observed_at":"2026-08-04T17:55:19.524312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.528498Z","title":"Proceedings of the SIGGRAPH Asia 2025 Conference Papers , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.528498Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:bc07927f59c32e7d3f566e16fa796a3a98563a69fa2713c6e02ddd914375851b","observation_id":"e67a6c18-89a0-409f-b896-7f405e85b51f","resolution":{"observed_at":"2026-08-04T17:55:19.528498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-08-12T22:34:51.361078Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-04T17:55:19.533112Z","title":"arXiv preprint arXiv:2503.20314 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.533112Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:57dd9073a075002e50a94513f1749db62497abfd332f02165f192acd72fb79cd","observation_id":"503fecdd-553f-4a35-82a1-539dabd76a3c","resolution":{"observed_at":"2026-08-04T17:55:19.533112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-04T17:55:19.538342Z","title":"arXiv preprint arXiv:2104.09864 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.538342Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:6262e83e87baa237a91b0a544925297ccf72cf097bb8e8d686f8378ab5a45c86","observation_id":"35085b95-4ba4-423f-9b86-1f0408470972","resolution":{"observed_at":"2026-08-04T17:55:19.538342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.542484Z","title":"Proceedings of the Computer Vision and Pattern Recognition Conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.542484Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:31889c0281ec33ff945acbf10f7913e6e85819b6b80c5b0d40cbacedb4e0478b","observation_id":"8c053511-dca5-4e6e-99bd-909bb90076a9","resolution":{"observed_at":"2026-08-04T17:55:19.542484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05098","last_updated":"2025-01-09T09:37:27Z","snapshot_observed_at":"2026-08-17T09:12:56.498039Z","submitted_at":"2025-01-09T09:37:27Z","title":"Motion-X++: A Large-Scale Multimodal 3D Whole-body Human Motion Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05098","snapshot_observed_at":"2026-08-04T17:55:19.546632Z","title":"arXiv preprint arXiv:2501.05098 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.546632Z"},"links":{"cited_paper":"/paper/2501.05098","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:cc3ac6206097657da357c4291e7e4de67234ea057d0fb06f58d12628c5840a10","observation_id":"318e21b9-733a-4a28-a69a-1f6ff5f537f8","resolution":{"observed_at":"2026-08-04T17:55:19.546632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.551303Z","title":"The eleventh international conference on learning representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.551303Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:f20540a3b18283b09ecb7837fef292c7965a560fbf258ca71811ecfbd9882525","observation_id":"a1bc2924-1ed8-44f8-8905-60e3d79b44ae","resolution":{"observed_at":"2026-08-04T17:55:19.551303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.555550Z","title":"Computational Visual Media , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.555550Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e4cfd7c1edcbcc1c015e3939ac8bc695b9a6fef322c83874294ee477666446ae","observation_id":"bf999bd1-19d3-48cd-8f47-3d0f4c5c2643","resolution":{"observed_at":"2026-08-04T17:55:19.555550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.559837Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.559837Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:9e6d26502adcc3b0b46ee9dd26d6cd6ae99e4a8815f754449b85ff215879f62b","observation_id":"4b0b85d3-5b58-4933-95ff-34322e53f7b8","resolution":{"observed_at":"2026-08-04T17:55:19.559837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10647","last_updated":"2025-11-13T18:59:53Z","snapshot_observed_at":"2026-08-15T23:16:19.228206Z","submitted_at":"2025-11-13T18:59:53Z","title":"Depth Anything 3: Recovering the Visual Space from Any Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10647","snapshot_observed_at":"2026-08-04T17:55:19.564018Z","title":"arXiv preprint arXiv:2511.10647 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.564018Z"},"links":{"cited_paper":"/paper/2511.10647","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:aeca20a6506d7df593d7cf020904f543ca04ed94175daf7f086a1a4733e0612f","observation_id":"3ad60806-3ace-4321-92bd-76a64e07175f","resolution":{"observed_at":"2026-08-04T17:55:19.564018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.568411Z","title":"The journal of machine learning research , volume=","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.568411Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:14bdd2e2a63405c9d93b7288e8cb0f8677561ef699de0c7673e25b70397177e8","observation_id":"b26fcbde-0198-46cd-b7e3-99d10cc50d44","resolution":{"observed_at":"2026-08-04T17:55:19.568411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.14148","last_updated":"2026-04-15T17:59:40Z","snapshot_observed_at":"2026-08-19T04:53:25.142828Z","submitted_at":"2026-04-15T17:59:40Z","title":"Seedance 2.0: Advancing Video Generation for World Complexity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.14148","snapshot_observed_at":"2026-08-04T17:55:19.572932Z","title":"arXiv preprint arXiv:2604.14148 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.572932Z"},"links":{"cited_paper":"/paper/2604.14148","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:7867c3dc6e8206e4b79aa67c4db62835959c63460995f0553eb034c45094009e","observation_id":"75bc52f1-1408-462c-8916-fa3e61f5c72e","resolution":{"observed_at":"2026-08-04T17:55:19.572932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.577597Z","title":"Proceedings of the SIGGRAPH Asia 2025 Conference Papers , pages=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.577597Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:d6e31464996286656f95608e0fa410273ca37c5b6c9844bd0433e05b9983641e","observation_id":"5a81f53b-ff9c-4732-b6cf-6d68c311b58a","resolution":{"observed_at":"2026-08-04T17:55:19.577597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.583353Z","title":"arXiv preprint arXiv:2601.05138 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.583353Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:9ba2259a45c96fdd12ec74ae457ab11e67f7f6ab7bc5604a913d0b07a3acf013","observation_id":"b1d85eb1-9a9f-457d-8064-e79518ac499c","resolution":{"observed_at":"2026-08-04T17:55:19.583353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.588369Z","title":"IEEE Transactions on Visualization and Computer Graphics , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.588369Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e074d28dd1d62bd362afcc77ec9a5e00ef94bac8c489a53e27ee4349e53d9d50","observation_id":"88999b08-250f-466a-a8bf-ce4cc162b6f9","resolution":{"observed_at":"2026-08-04T17:55:19.588369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.592589Z","title":"arXiv preprint arXiv:2602.15989 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.592589Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:506bb99cecc5cc9163481501a071ee06dea121c27130a63a5b8adedfd784cada","observation_id":"c9c8f06e-d699-4a11-bc75-338afe8f04db","resolution":{"observed_at":"2026-08-04T17:55:19.592589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.596692Z","title":"China University of Mining Technology Beijing Graduate School , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.596692Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:88a9f0329d1a1fe50c04d8a2b93479793270ecd7b2f0fa1ffa686cf33337bf75","observation_id":"9b2f2b9d-60ab-4966-81d5-2c74dca93a1b","resolution":{"observed_at":"2026-08-04T17:55:19.596692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.601013Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.601013Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:8c1736d4cd4c3a9f7f4fe7113d483619ee3fc6e660690fa9ceae0af2f2023ecf","observation_id":"515120aa-7e04-4962-b631-2c614d8262f8","resolution":{"observed_at":"2026-08-04T17:55:19.601013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.606074Z","title":"On the content bias in fr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.606074Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:473c443353b85f2348dbfb3d19398be196d68ffbad2d91f0e9719e40696a2fa8","observation_id":"a1516324-1a17-4179-86d8-e0227548d6f1","resolution":{"observed_at":"2026-08-04T17:55:19.606074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-16T13:38:51.127960Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-04T17:55:19.610372Z","title":"arXiv preprint arXiv:2406.19680 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.610372Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:1c5121bff9d314674173f3f5eb0e81a050905d87697296c26189b6d319c08571","observation_id":"c9fc0812-7dc7-475b-aff9-d548cb658ebd","resolution":{"observed_at":"2026-08-04T17:55:19.610372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.614889Z","title":"Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.614889Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:ab835c5bbaf0eb170b1c36134c7ae1a1d9d4efb1834fb067c0cd0ce8a623e3a8","observation_id":"44cea419-8af4-46f1-abaf-2e5aad3303b2","resolution":{"observed_at":"2026-08-04T17:55:19.614889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.621118Z","title":"Science China Information Sciences , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.621118Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:34d0c35666056279a5350c46679d092ddc1d72b28b897089992d80894f6cf04e","observation_id":"52436f48-fae9-4f2d-8deb-81e77629b3ae","resolution":{"observed_at":"2026-08-04T17:55:19.621118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.625690Z","title":"arXiv preprint arXiv:2509.14055 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.625690Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:890005aa75dba9e73ad67862ac69a820ef1936dc84f63b2f7d783e4b2ca98d5e","observation_id":"7651121d-3c00-468c-877b-0aa7307e728c","resolution":{"observed_at":"2026-08-04T17:55:19.625690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.629850Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.629850Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:e49c990d451c6de403919a8012802be307821fa4a767f701de743389a9a6ce5b","observation_id":"61bc3dd5-ad07-4128-b03e-c62a2abe7a78","resolution":{"observed_at":"2026-08-04T17:55:19.629850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.634070Z","title":"Proceedings of the IEEE/CVF conference on computer vision and pattern recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.634070Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:197e9cb29ebb898d8bd01fcbb2f38cd20ec53a9ca347fe690c977687702c9280","observation_id":"276a78c7-280e-45df-94f9-98cea33e7cd8","resolution":{"observed_at":"2026-08-04T17:55:19.634070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.638241Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.638241Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:659ba6f3b2897e08b4447e5e5ed7505c4e58806bb65b540ef0fed836fc9e8391","observation_id":"0d3b3454-837b-4960-8932-00f6d7f3d668","resolution":{"observed_at":"2026-08-04T17:55:19.638241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10306","last_updated":"2024-12-11T02:55:31Z","snapshot_observed_at":"2026-08-17T02:05:24.887374Z","submitted_at":"2024-10-14T09:06:55Z","title":"Animate-X: Universal Character Image Animation with Enhanced Motion Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10306","snapshot_observed_at":"2026-08-04T17:55:19.642542Z","title":"arXiv preprint arXiv:2410.10306 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.642542Z"},"links":{"cited_paper":"/paper/2410.10306","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:38e2cf907a6b1e0fae0e1b6a8e99def66dc233203e850f9d835e5acc7eb8de27","observation_id":"de2a6a73-0c6c-487e-99c5-db0b20614fdd","resolution":{"observed_at":"2026-08-04T17:55:19.642542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.647007Z","title":"Seminal Graphics Papers: Pushing the Boundaries, Volume 2 , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.647007Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:efb6a7cfef9c957ceefd3dbcd4db99f1f7b306135e12b497d984344f04ac8310","observation_id":"510a23f8-dedf-4ce3-a4e7-f383dbf3cc8e","resolution":{"observed_at":"2026-08-04T17:55:19.647007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.651121Z","title":"European conference on computer vision , pages=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.651121Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:6643a9f298ea683d15f83f19a98717e0d7323f37a21da51c2564281e16585fe3","observation_id":"95c20330-930f-4a4b-bac3-376043aca542","resolution":{"observed_at":"2026-08-04T17:55:19.651121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.655786Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.655786Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:5523d8520854c06a945bd9c60be0ec437b4e597dfc66e3367449c8625d0fe41d","observation_id":"24f63585-b0f0-4926-a555-ee75db458ef7","resolution":{"observed_at":"2026-08-04T17:55:19.655786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.660683Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.660683Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:ffd6a72f40202180da7ea94fc60b7e4993e8f018543f2a00a8a97fbfe35fc5b5","observation_id":"2c2a270a-0a70-40bc-b256-86186d00bccb","resolution":{"observed_at":"2026-08-04T17:55:19.660683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.665326Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.665326Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:52b414905b827af9c76bcfe9d662ffb572a25dd3493eb71accbb3e7d605133b1","observation_id":"05c3b670-8baf-49a1-845b-7a1071c37c0b","resolution":{"observed_at":"2026-08-04T17:55:19.665326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.669943Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.669943Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:4ee3599fe025cdee67329e460cc9b50d6dd31aa1b3c67defc2e95e0645579bfb","observation_id":"055ffed6-51f5-49f3-acf1-3d42777c6e16","resolution":{"observed_at":"2026-08-04T17:55:19.669943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00131","last_updated":"2024-11-28T14:07:45Z","snapshot_observed_at":"2026-08-13T21:19:07.777045Z","submitted_at":"2024-11-28T14:07:45Z","title":"Open-Sora Plan: Open-Source Large Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00131","snapshot_observed_at":"2026-08-04T17:55:19.674234Z","title":"arXiv preprint arXiv:2412.00131 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.674234Z"},"links":{"cited_paper":"/paper/2412.00131","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:0ad42c0124f3592f77e830bc323d49042e59a155c086bde148a7a92a628733a5","observation_id":"76259ac3-ccd3-4139-aeb9-b9efd11f0efc","resolution":{"observed_at":"2026-08-04T17:55:19.674234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.679200Z","title":"European Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.679200Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:1edea3e8e2b6cff8de10b548f1f63cb839a078216cd35fa6520c79fd45ce90c7","observation_id":"5ea5773e-ced3-4fa1-8bc3-4e3561ed9020","resolution":{"observed_at":"2026-08-04T17:55:19.679200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.683735Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.683735Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:f7519aed8fd965a39a872213f30efa7c429becb481e7be56a551e321842b4549","observation_id":"7cbb3b76-5837-43f6-9d75-6f77f0a51e27","resolution":{"observed_at":"2026-08-04T17:55:19.683735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.687945Z","title":"Proceedings of the computer vision and pattern recognition conference , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.687945Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:8dba3a63ad10f0c4ab7feac68cafea594eb3f7cb7f5b906673cc42fad920003b","observation_id":"328907aa-38a9-423c-8324-8b4d435476d2","resolution":{"observed_at":"2026-08-04T17:55:19.687945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.692294Z","title":"Proceedings of the IEEE/CVF international conference on computer vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.692294Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:d6c624a4ea039841788dfa0c632566efa19ee0e030a97429143f808173d8a8e0","observation_id":"2bf0af53-5060-4f00-9871-4174b38e1586","resolution":{"observed_at":"2026-08-04T17:55:19.692294Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.31946","last_updated":"2026-07-14T06:00:42Z","snapshot_observed_at":"2026-08-14T12:09:02.486667Z","submitted_at":"2026-06-30T16:52:53Z","title":"World Narrative Model for Highly Controllable Video Generation: A Paradigm Shift from Pixel Sampling to Physical World Orchestration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.31946","snapshot_observed_at":"2026-08-04T17:55:19.696746Z","title":"arXiv preprint arXiv:2606.31946 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.696746Z"},"links":{"cited_paper":"/paper/2606.31946","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:44530c87683522e5a48007d5e5bd4aeae6234f3946e56437674343bd7bafb188","observation_id":"b7f47b17-78d1-4b62-9f8c-5ac7e3856ea1","resolution":{"observed_at":"2026-08-04T17:55:19.696746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:55:19.701369Z","title":"arXiv preprint arXiv:2510.12256 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.701369Z"},"links":{"citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:8e63c43a2f8c050477a74db037be81e3bff99ea391a1b13343b2f8405db582be","observation_id":"8b4585b0-4bd8-4946-9252-5f379d11fa0a","resolution":{"observed_at":"2026-08-04T17:55:19.701369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.04512","last_updated":"2025-05-08T08:29:00Z","snapshot_observed_at":"2026-08-18T10:31:16.201312Z","submitted_at":"2025-05-07T15:33:18Z","title":"HunyuanCustom: A Multimodal-Driven Architecture for Customized Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.04512","snapshot_observed_at":"2026-08-04T17:55:19.705417Z","title":"arXiv preprint arXiv:2505.04512 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.705417Z"},"links":{"cited_paper":"/paper/2505.04512","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:7a7a146f0c6f7632e7f7522ae34bb66c0077572c47fc9f23d22def1365083c53","observation_id":"f34af647-a454-47b8-99ea-6fd7f628fb95","resolution":{"observed_at":"2026-08-04T17:55:19.705417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02753","last_updated":"2026-06-01T18:20:20Z","snapshot_observed_at":"2026-08-16T00:06:16.567037Z","submitted_at":"2026-06-01T18:20:20Z","title":"MetaWorld: Scaling Multi-Agent Video World Model from Single-view Video Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02753","snapshot_observed_at":"2026-08-04T17:55:19.709947Z","title":"arXiv preprint arXiv:2606.02753 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.709947Z"},"links":{"cited_paper":"/paper/2606.02753","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:50d607b85038a498fdf83ddefc81f01c726008f3fc4746f47d9cb5ed60b1443a","observation_id":"3b4f27d2-e2df-4162-9f11-07a1c519cf7c","resolution":{"observed_at":"2026-08-04T17:55:19.709947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15789","last_updated":"2024-05-01T02:37:18Z","snapshot_observed_at":"2026-08-19T20:24:48.087116Z","submitted_at":"2024-04-24T10:28:54Z","title":"MotionMaster: Training-free Camera Motion Transfer For Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15789","snapshot_observed_at":"2026-08-04T17:55:19.714539Z","title":"arXiv preprint arXiv:2404.15789 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-04T17:55:19.714539Z"},"links":{"cited_paper":"/paper/2404.15789","citing_paper":"/paper/2608.01944"},"observation_digest":"sha256:cdd0dbf39129623fb1e2cd54d417d12ee69d36e5ec1cb83131c989833cedcb31","observation_id":"af75675e-ded9-49cb-860c-528317d18847","resolution":{"observed_at":"2026-08-04T17:55:19.714539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01944","last_updated":"2026-08-03T09:18:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T09:16:19.874599Z","submitted_at":"2026-08-03T09:18:13Z","title":"UniMoCa: Unifying Motion and Camera Controls as Visual Proxies for Faithful Human Video Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2608.01944."}