{"as_of":"2026-08-17T15:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b58fbe49c2607d340ac3c0b669fdfe8e224e0a3d42ee3f8d0d5a5f7250c3d6a2","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:55:28.944960Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:57:29.607694Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T22:20:22.357042Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11144","snapshot_observed_at":"2026-08-05T20:06:47.301483Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11255","last_updated":"2025-08-15T06:43:46Z","snapshot_observed_at":"2026-08-15T12:40:44.223386Z","submitted_at":"2025-08-15T06:43:46Z","title":"FantasyTalking2: Timestep-Layer Adaptive Preference Optimization for Audio-Driven Portrait Animation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:47.301483Z"},"links":{"cited_paper":"/paper/2506.11144","citing_paper":"/paper/2508.11255"},"observation_digest":"sha256:215093977545c0a90b1dddbe976d900c3bda72d7a9c874bc64ab11cbbab70d0d","observation_id":"80b09f0d-f1bb-4a0f-88ba-5793b7779ac2","resolution":{"observed_at":"2026-08-05T20:06:47.301483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11144","snapshot_observed_at":"2026-08-15T16:57:29.607694Z","title":"Alignhuman: Improving motion and fidelity via timestep-segment preference optimization for audio-driven human animation.arXiv preprint arXiv:2506.11144, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.19209","last_updated":"2025-08-26T17:15:26Z","snapshot_observed_at":"2026-08-15T16:51:31.461718Z","submitted_at":"2025-08-26T17:15:26Z","title":"OmniHuman-1.5: Instilling an Active Mind in Avatars via Cognitive Simulation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:57:29.607694Z"},"links":{"cited_paper":"/paper/2506.11144","citing_paper":"/paper/2508.19209"},"observation_digest":"sha256:f14b98f40ca1e518efea12cdb1c768275e3117e8b8ce21e10ab8c26b5ef898fe","observation_id":"80078491-1f0c-4640-bab4-1ab7cf469d17","resolution":{"observed_at":"2026-08-15T16:57:29.607694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"cited_work":{"arxiv_id":"2506.11144","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11144","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Alignhuman: Improving motion and fidelity via timestep- segment preference optimization for audio-driven human an- imation","venue":null,"work_id":"33a3bd64-e18d-49ea-bcef-9bf451b34768","year":2025},"citing_paper":{"arxiv_id":"2602.13669","last_updated":"2026-04-22T07:41:44Z","snapshot_observed_at":"2026-08-11T04:55:53.338738Z","submitted_at":"2026-02-14T08:32:38Z","title":"EchoTorrent: Towards Swift, Sustained, and Streaming Multi-Modal Video Generation","version":5},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-15T22:20:16.320171Z"},"links":{"cited_paper":"/paper/2506.11144","citing_paper":"/paper/2602.13669"},"observation_digest":"sha256:8bb3e49024c876d414f89bc1eab0ad9448d59bbbe94f85db25c0b47b27430f9d","observation_id":"2220945c-701f-4271-b0de-e9a73bb81630","resolution":{"observed_at":"2026-05-15T22:20:22.360892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11144/citation-record","integrity":"/paper/2506.11144/integrity","json":"/paper/2506.11144/citation-record.json","paper":"/paper/2506.11144"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.694299Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.694299Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:21bdda038f1ab86337788f7690da54be1bef819c1710a0626d411fbc856313f2","observation_id":"fd8d86da-6153-4bef-a97b-4378a606b53a","resolution":{"observed_at":"2026-08-07T04:55:28.694299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.699706Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.699706Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:4beb6992db308e105de13218f4da5d677779ed63424ca6f13cf2c54f142695b2","observation_id":"1fa5b9a3-079e-49ef-af72-95a0684e3a38","resolution":{"observed_at":"2026-08-07T04:55:28.699706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13074","last_updated":"2025-04-21T10:34:50Z","snapshot_observed_at":"2026-08-15T13:01:37.943884Z","submitted_at":"2025-04-17T16:37:27Z","title":"SkyReels-V2: Infinite-length Film Generative Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13074","snapshot_observed_at":"2026-08-07T04:55:28.705104Z","title":"Skyreels-v2: Infinite-length film generative model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.705104Z"},"links":{"cited_paper":"/paper/2504.13074","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:d048ae7ae88a680bed097a64f4b06b5e3148d687944db7f7206302be2e275a96","observation_id":"59b2f9db-ad79-4432-bd5b-8233d8d2d7e9","resolution":{"observed_at":"2026-08-07T04:55:28.705104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.932685Z","title":"Echomimic: Lifelike audio- driven portrait animations through editable landmark conditions","venue":null,"work_id":"4736b263-2556-4eca-b58b-fd20274b8416","year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.710520Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:6c49b2b0c32e5d286db4f00d358032aa6f27a357b06b8cbd2cfc6be1a7560cc8","observation_id":"4b8ab91f-1943-4a55-96c5-781a00fd4a7b","resolution":{"observed_at":"2026-08-07T04:55:30.991079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.715503Z","title":"Out of time: automated lip sync in the wild","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.715503Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f606cee079a5108815cb5a304e179bf3a45eadf619797f0148094f6b23fc2df5","observation_id":"31c0ca70-889b-4879-8337-4a1f37d8e2dd","resolution":{"observed_at":"2026-08-07T04:55:28.715503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:55:28.720484Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.720484Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:e52d0617846dcf599be82230a8894e82f9561db8d1e977f6de04c9631c78f57d","observation_id":"8fa74461-f8fc-4e81-820f-7b24069f5283","resolution":{"observed_at":"2026-08-07T04:55:28.720484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15252","last_updated":"2024-10-14T04:08:53Z","snapshot_observed_at":"2026-08-16T13:40:41.995891Z","submitted_at":"2024-06-21T15:43:46Z","title":"VideoScore: Building Automatic Metrics to Simulate Fine-grained Human Feedback for Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15252","snapshot_observed_at":"2026-08-07T04:55:28.726179Z","title":"Videoscore: Building automatic metrics to simulate fine-grained human feedback for video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.726179Z"},"links":{"cited_paper":"/paper/2406.15252","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f58079ba363cd00f20af263dc2d5dc6efbdf4fcc4e32ccaed79308dee87a24dd","observation_id":"ccbba998-7073-4628-b767-729d3c09c679","resolution":{"observed_at":"2026-08-07T04:55:28.726179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.731300Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.731300Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:99c2cb87d24add2b7bdfd511dec860b3efc5f9219a7eb2c262f654a893899512","observation_id":"332b2d9a-3fe5-4db6-b829-f34eee398ab6","resolution":{"observed_at":"2026-08-07T04:55:28.731300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.627456Z","title":"Diffted: One-shot audio- driven ted talk video generation with diffusion-based co-speech gestures","venue":null,"work_id":"b4e7564d-96d1-4062-9323-0299c8e36998","year":1922},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.736426Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:c3080e279d6f6e7d7f6491e501ee39ce68e7cbc34f494d56077ad54446bdadd2","observation_id":"0a64a6aa-ae2a-4e2d-ac61-1cd4ad56309a","resolution":{"observed_at":"2026-08-07T04:55:30.764884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.472716Z","title":"Loopy: Taming audio-driven portrait avatar with long-term motion dependency","venue":null,"work_id":"4802120b-4663-469a-ab7f-7ea6eab06128","year":null},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.741288Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:89a6c37b836d403be44f73c8a33f14f383c438948f026b05c366a15e19dda10b","observation_id":"f3cb1880-620a-49d7-abef-6e4645e6b613","resolution":{"observed_at":"2026-08-07T04:55:30.549854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.746899Z","title":"Elucidating the design space of diffusion-based generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.746899Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:e7c66b4eb5d75a6b396f70899018ad4655568f553dd03d59f382ba15d723ed0d","observation_id":"4de104e3-24dc-47c3-9f22-8e2c4e85cdc7","resolution":{"observed_at":"2026-08-07T04:55:28.746899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.751488Z","title":"Auto-encoding variational bayes, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.751488Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:b08c6f916ba241b302f9c0828ed62b18ff648ba377edb2697e4de92ba66fb384","observation_id":"14601b1c-aea7-419d-99d0-34d6dd353218","resolution":{"observed_at":"2026-08-07T04:55:28.751488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00115","last_updated":"2025-01-04T06:16:56Z","snapshot_observed_at":"2026-08-17T01:19:21.155701Z","submitted_at":"2024-11-28T07:01:06Z","title":"OpenHumanVid: A Large-Scale High-Quality Dataset for Enhancing Human-Centric Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.00115","snapshot_observed_at":"2026-08-07T04:55:28.756180Z","title":"Openhumanvid: A large-scale high-quality dataset for enhancing human-centric video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.756180Z"},"links":{"cited_paper":"/paper/2412.00115","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:74324ad9944fcf016575d69321f1b285a2d2f29ed671868446710ad568b9ba1b","observation_id":"40ef71f1-9dc5-4609-b324-a1291948ba06","resolution":{"observed_at":"2026-08-07T04:55:28.756180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18750","last_updated":"2024-10-11T07:50:49Z","snapshot_observed_at":"2026-08-16T13:48:21.513276Z","submitted_at":"2024-05-29T04:26:17Z","title":"T2V-Turbo: Breaking the Quality Bottleneck of Video Consistency Model with Mixed Reward Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18750","snapshot_observed_at":"2026-08-07T04:55:28.761207Z","title":"T2v-turbo: Breaking the quality bottleneck of video consistency model with mixed reward feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.761207Z"},"links":{"cited_paper":"/paper/2405.18750","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f795cad5c27d3c845a3ab1b0033c625efe18e059cfee5f6ce22e2061c58345ba","observation_id":"fd030be6-b309-445a-b29d-afe56d43af43","resolution":{"observed_at":"2026-08-07T04:55:28.761207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.291743Z","title":"Cyberhost: A one-stage diffusion framework for audio-driven talking body generation","venue":null,"work_id":"70026623-6c7e-4275-9411-fbcc1219731d","year":null},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.766234Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:d0f542ef73a87b729bf905b43eda12f7392b2860b03d3aec3dcfd89a18d7a9e7","observation_id":"55c403f1-9e1d-4dc4-8708-d78ecdbdda0d","resolution":{"observed_at":"2026-08-07T04:55:30.352728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01061","last_updated":"2025-06-30T08:26:56Z","snapshot_observed_at":"2026-08-15T11:53:30.534687Z","submitted_at":"2025-02-03T05:17:32Z","title":"OmniHuman-1: Rethinking the Scaling-Up of One-Stage Conditioned Human Animation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01061","snapshot_observed_at":"2026-08-07T04:55:28.771375Z","title":"Omnihuman-1: Rethinking the scaling-up of one-stage conditioned human animation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.771375Z"},"links":{"cited_paper":"/paper/2502.01061","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:7d6b5c30b2d1349843eccec2694cb235f0bf9006cafd69eca272a2bde9a70948","observation_id":"6e47c66c-d5ac-4cfb-81e4-cd383f6c223d","resolution":{"observed_at":"2026-08-07T04:55:28.771375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-07T04:55:28.776489Z","title":"Flow matching for generative modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.776489Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:6bc5d40c6128040e3bb088b0705343ed6bbd3782277a4f8ab5cad9f8524a7fa8","observation_id":"3ec72267-a68f-48f7-bd25-d5955335aa6a","resolution":{"observed_at":"2026-08-07T04:55:28.776489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13918","snapshot_observed_at":"2026-08-07T04:55:28.781462Z","title":"Improving video generation with human feedback","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.781462Z"},"links":{"cited_paper":"/paper/2501.13918","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:97d3ecd7e0c05c670eebb99fbd49286609eacea92b850dd655f352455633ff66","observation_id":"a37f8ded-f857-4f57-9170-1f9ee3402428","resolution":{"observed_at":"2026-08-07T04:55:28.781462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14167","last_updated":"2024-12-18T18:59:49Z","snapshot_observed_at":"2026-08-15T03:52:49.564723Z","submitted_at":"2024-12-18T18:59:49Z","title":"VideoDPO: Omni-Preference Alignment for Video Diffusion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14167","snapshot_observed_at":"2026-08-07T04:55:28.786930Z","title":"Videodpo: Omni-preference alignment for video diffusion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.786930Z"},"links":{"cited_paper":"/paper/2412.14167","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:3850a56d6abf9bad08da9406fc5ad64a10eabe88d09d7efdd83994eabbfe90bd","observation_id":"b3b91f74-c925-4196-a87f-0d3bf56f71de","resolution":{"observed_at":"2026-08-07T04:55:28.786930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.791865Z","title":"Dpm-solver: A fast ode solver for diffusion probabilistic model sampling in around 10 steps","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.791865Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:13c90bee8683b5f12eadf8203c52498436081a369be2c1c4c762b3b5a533a5d1","observation_id":"eaee10a4-b814-4bed-be3d-ab01b6ab6454","resolution":{"observed_at":"2026-08-07T04:55:28.791865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14619","last_updated":"2024-05-02T00:30:57Z","snapshot_observed_at":"2026-08-16T19:20:26.111702Z","submitted_at":"2024-04-22T23:12:03Z","title":"OpenELM: An Efficient Language Model Family with Open Training and Inference Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14619","snapshot_observed_at":"2026-08-07T04:55:28.796700Z","title":"Openelm: An efficient language model family with open training and inference framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.796700Z"},"links":{"cited_paper":"/paper/2404.14619","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:c7ceb888c8eb501bab2712251ff80cec475d711dac9a6c456e7a551b86b77785","observation_id":"67473cb3-1792-452b-b3c9-f9add8a36d7b","resolution":{"observed_at":"2026-08-07T04:55:28.796700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.801724Z","title":"Echomimicv2: Towards striking, simplified, and semi-body human animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.801724Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:04bcb610f1246c82d9931e91f0df32a4ca1d286d6341c4d6e9be3426a1387f62","observation_id":"5df5be53-4302-4b5e-aa28-5d2486ae2e29","resolution":{"observed_at":"2026-08-07T04:55:28.801724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.806487Z","title":"Simpo: Simple preference optimization with a reference-free reward","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.806487Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:d0564b3cddd7020b3b8b20c9b5cb839d64095ba808ffb6e11c42ebaba95c2536","observation_id":"55458c22-2b77-4943-ab82-be5c5862081f","resolution":{"observed_at":"2026-08-07T04:55:28.806487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:30.132896Z","title":"Clip-dpo: Vision-language models as a source of preference for fixing hallucinations in lvlms","venue":null,"work_id":"d54391c2-5260-4c1f-9133-320b3438b3c0","year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.811290Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:43e4e31ad758f3270cfcee7d425f4aa4fd2d539f2c85f60a41d8e097fe9e2091","observation_id":"560225d4-646b-4d12-8ba8-9bf455d38ca6","resolution":{"observed_at":"2026-08-07T04:55:30.211552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.816015Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.816015Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:dc3b6d9694c235b7a447c30034d72376dfcea66fce7f8136435a20cabb2e0c90","observation_id":"d0e261d7-f504-4929-bf90-a71fd56def66","resolution":{"observed_at":"2026-08-07T04:55:28.816015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10841","last_updated":"2025-02-15T16:08:40Z","snapshot_observed_at":"2026-08-16T12:58:07.365732Z","submitted_at":"2025-02-15T16:08:40Z","title":"SkyReels-A1: Expressive Portrait Animation in Video Diffusion Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10841","snapshot_observed_at":"2026-08-07T04:55:28.820779Z","title":"Skyreels-a1: Expressive portrait animation in video diffusion transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.820779Z"},"links":{"cited_paper":"/paper/2502.10841","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:91a99a69a08ec3e62bfd6efe3636ee450967e3643fd790d5c2383ac0661880b8","observation_id":"f412f38c-0a59-4fe2-a4e8-94f7499ef526","resolution":{"observed_at":"2026-08-07T04:55:28.820779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.826201Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.826201Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:a75d7805068575add6946f1da1407ccecaa9ba9273a44906a5a8db8ccc3cd160","observation_id":"2f1fd874-d2a5-4f25-aaa8-6e7570cbc331","resolution":{"observed_at":"2026-08-07T04:55:28.826201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08685","last_updated":"2025-05-05T03:31:30Z","snapshot_observed_at":"2026-08-16T12:41:57.140222Z","submitted_at":"2025-04-11T16:46:20Z","title":"Seaweed-7B: Cost-Effective Training of Video Generation Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08685","snapshot_observed_at":"2026-08-07T04:55:28.831101Z","title":"Seaweed-7b: Cost-effective training of video generation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.831101Z"},"links":{"cited_paper":"/paper/2504.08685","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:6c15927b0074e7e13c8c78fe398378eea31273428c4bd5fd077aa253ca314ed6","observation_id":"53c8f23a-562d-4125-af33-9fd5bf8e15ed","resolution":{"observed_at":"2026-08-07T04:55:28.831101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.836232Z","title":"First order motion model for image animation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.836232Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:74e781990e13ad1c88ab313496ec935f818fb3a5699869744ae8b25d5a23631b","observation_id":"84fdc69f-6180-43d1-82f3-e60177f829ef","resolution":{"observed_at":"2026-08-07T04:55:28.836232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:29.936617Z","title":"Motion repre- sentations for articulated animation","venue":null,"work_id":"4373374d-36b8-416f-a13e-0aa7f2f8122a","year":2021},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.841312Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:522ed3a4413d5584bfe4acabbcefaf8d69a4afc2b51aba4057f92d763a0bc2e9","observation_id":"eb78e81a-9ec2-45fa-aa05-8f363e9ed10a","resolution":{"observed_at":"2026-08-07T04:55:30.020083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.846144Z","title":"Learning to summarize with human feedback","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.846144Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:980c2c033b0178326a668b1003af44bfc810bb5a23754a197baa465a13fb4166","observation_id":"c0e90711-c221-422b-9c4c-c10a9716e5ee","resolution":{"observed_at":"2026-08-07T04:55:28.846144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10687","last_updated":"2025-01-18T07:51:29Z","snapshot_observed_at":"2026-08-15T05:23:08.447798Z","submitted_at":"2025-01-18T07:51:29Z","title":"EMO2: End-Effector Guided Audio-Driven Avatar Video Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10687","snapshot_observed_at":"2026-08-07T04:55:28.850843Z","title":"Emo2: End-effector guided audio-driven avatar video generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.850843Z"},"links":{"cited_paper":"/paper/2501.10687","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:1d610801ec07863d39e4a77b7722433e7e2d6d9d8e91d42158c76060ecb8f56d","observation_id":"71ee290a-41c2-40a6-a35c-52be9b948044","resolution":{"observed_at":"2026-08-07T04:55:28.850843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.855934Z","title":"Emo: Emote portrait alive generating expressive portrait videos with audio2video diffusion model under weak conditions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.855934Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:919cd3dcb2130175ee3a6401f6f7c1470e51e0bafe7e4d1a4db20ef15ffa7bdd","observation_id":"3317897e-905e-4580-b747-3b0fcb39c634","resolution":{"observed_at":"2026-08-07T04:55:28.855934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.860592Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.860592Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:194ddb1fee855ea3705c17709567ee5b5e282e394570132226178540e34ef8a7","observation_id":"3b28877d-56fe-4a91-9b86-b40291324f9c","resolution":{"observed_at":"2026-08-07T04:55:28.860592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.865734Z","title":"Fvd: A new metric for video generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.865734Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:499f2f7353d34ad9703f202976c2ac3e5d6f9ef3f2b464a43bd83aa1a3793614","observation_id":"812fa1c1-c70e-4371-a564-bfb6b70afd5c","resolution":{"observed_at":"2026-08-07T04:55:28.865734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.870532Z","title":"Diffusion model alignment using direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.870532Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:ca7e447838d2dcd770aa7ffaa6f4049bb8666cba8ddc25550109dfc0c5292b64","observation_id":"9de4a076-298c-4f18-845f-79c9c37e7b38","resolution":{"observed_at":"2026-08-07T04:55:28.870532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04842","last_updated":"2025-04-07T08:56:01Z","snapshot_observed_at":"2026-08-16T12:43:28.043771Z","submitted_at":"2025-04-07T08:56:01Z","title":"FantasyTalking: Realistic Talking Portrait Generation via Coherent Motion Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04842","snapshot_observed_at":"2026-08-07T04:55:28.875127Z","title":"Fantasytalking: Realistic talking portrait generation via coherent motion synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.875127Z"},"links":{"cited_paper":"/paper/2504.04842","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:340cd5a95dc34ac776a4d7bfd61112270ec8f62d8165632abf5c3ef1822d7675","observation_id":"ab4b4deb-7c2c-47d2-8177-452149814295","resolution":{"observed_at":"2026-08-07T04:55:28.875127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T04:55:28.880281Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.880281Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:dd98713ae36195ae16eb317422d14c90a9a01cd1a08020cb1fe4bf9ccb3fce8d","observation_id":"9c039a11-5378-406b-8f97-09dfc2d9857c","resolution":{"observed_at":"2026-08-07T04:55:28.880281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.06601","last_updated":"2018-12-03T15:12:44Z","snapshot_observed_at":"2026-08-15T12:47:37.760328Z","submitted_at":"2018-08-20T17:58:42Z","title":"Video-to-Video Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.06601","snapshot_observed_at":"2026-08-07T04:55:28.884977Z","title":"Video-to-video synthesis","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.884977Z"},"links":{"cited_paper":"/paper/1808.06601","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:4659cbd04b7e10f54ec84f93881e6db88a4986c00598897d8034811d77f567e2","observation_id":"66d15514-4ce7-4003-b194-d045990134d5","resolution":{"observed_at":"2026-08-07T04:55:28.884977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23307","last_updated":"2025-03-30T04:22:09Z","snapshot_observed_at":"2026-08-16T12:45:39.428566Z","submitted_at":"2025-03-30T04:22:09Z","title":"MoCha: Towards Movie-Grade Talking Character Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23307","snapshot_observed_at":"2026-08-07T04:55:28.890139Z","title":"Mocha: Towards movie-grade talking character synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.890139Z"},"links":{"cited_paper":"/paper/2503.23307","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:390acaaf8810b41518ef71485ccc14c69f252fdef021348e644883b1b2025065","observation_id":"31529f22-2b38-45ac-bb66-f124081eb677","resolution":{"observed_at":"2026-08-07T04:55:28.890139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17090","last_updated":"2023-12-28T16:10:25Z","snapshot_observed_at":"2026-08-02T07:14:02.308302Z","submitted_at":"2023-12-28T16:10:25Z","title":"Q-Align: Teaching LMMs for Visual Scoring via Discrete Text-Defined Levels","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17090","snapshot_observed_at":"2026-08-07T04:55:28.894940Z","title":"Q-align: Teaching lmms for visual scoring via discrete text-defined levels","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.894940Z"},"links":{"cited_paper":"/paper/2312.17090","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:3c5eb4f0c5c1e070867ee6f8576a70a8c5e2216529e14771aa109d313a6509e5","observation_id":"3623e821-9b74-4eb0-8bca-2c23fbf8d40c","resolution":{"observed_at":"2026-08-07T04:55:28.894940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09341","last_updated":"2023-09-25T08:19:23Z","snapshot_observed_at":"2026-08-14T02:46:25.655503Z","submitted_at":"2023-06-15T17:59:31Z","title":"Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09341","snapshot_observed_at":"2026-08-07T04:55:28.900227Z","title":"Human preference score v2: A solid benchmark for evaluating human preferences of text-to-image synthesis.arXiv preprint arXiv:2306.09341, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.900227Z"},"links":{"cited_paper":"/paper/2306.09341","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f01effe8e8398e0cae22133e32b5a394f727d5e1310e8d8765782f3432f39e89","observation_id":"b96501ee-2d9b-4a1d-b447-6e00bd365e02","resolution":{"observed_at":"2026-08-07T04:55:28.900227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21059","last_updated":"2026-01-05T02:39:01Z","snapshot_observed_at":"2026-08-15T00:38:30.343980Z","submitted_at":"2024-12-30T16:24:09Z","title":"VisionReward: Fine-Grained Multi-Dimensional Human Preference Learning for Image and Video Generation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21059","snapshot_observed_at":"2026-08-07T04:55:28.905535Z","title":"Visionreward: Fine-grained multi-dimensional human preference learning for image and video generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.905535Z"},"links":{"cited_paper":"/paper/2412.21059","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:05cd93ece005bcf269e4bd963f9290a41781b92d70f693b2fa53e05716079c62","observation_id":"02dfe58c-2446-4726-9098-ea9aa4e97b5b","resolution":{"observed_at":"2026-08-07T04:55:28.905535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.910579Z","title":"Imagereward: Learning and evaluating human preferences for text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.910579Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:8d55cd9f4c3bfd4306b8930850df843ba703eb978fe36c062dcd3a0cc8079540","observation_id":"973dce22-a8ec-4689-adcc-bebf3488a4f9","resolution":{"observed_at":"2026-08-07T04:55:28.910579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-17T05:35:17.658314Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-07T04:55:28.915211Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.915211Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:361fb6beb73cecfa5f523d401dd81f85dac3dd2309c4a7b6ac2b09210529151f","observation_id":"f8b87c68-d613-4395-a5e6-d84a82c53b51","resolution":{"observed_at":"2026-08-07T04:55:28.915211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T04:55:28.919921Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.919921Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:9fa69b18d9de4c38f6287054138bd9eb2e90840ce8e4700071458ad0a6ec718e","observation_id":"38fb32d1-51cb-41d7-a3e7-27574f913fd6","resolution":{"observed_at":"2026-08-07T04:55:28.919921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05978","last_updated":"2025-03-07T23:21:11Z","snapshot_observed_at":"2026-08-16T12:52:01.999974Z","submitted_at":"2025-03-07T23:21:11Z","title":"MagicInfinite: Generating Infinite Talking Videos with Your Words and Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05978","snapshot_observed_at":"2026-08-07T04:55:28.924931Z","title":"Magicinfinite: Generating infinite talking videos with your words and voice","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.924931Z"},"links":{"cited_paper":"/paper/2503.05978","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:7ae963bd55d23b922fa2b108903da462b60c6b992a5daf7029b91ef65ea1ba71","observation_id":"91a34f10-0f46-42b2-b700-0a2d7e954b6b","resolution":{"observed_at":"2026-08-07T04:55:28.924931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-16T13:38:51.127960Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-07T04:55:28.929697Z","title":"Mimicmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.929697Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:ed6f7ae742a0d5898045c4c32a3ea635ec634c37d87ef0aa7e8163d0f9be1d22","observation_id":"43bb5afe-d99e-421f-b48d-a980d648cfd6","resolution":{"observed_at":"2026-08-07T04:55:28.929697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:29.708516Z","title":"Learning to compare for better training and evaluation of open domain natural language generation models","venue":null,"work_id":"bc9bb985-66be-42e7-bd60-fb4906c24bf4","year":2020},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.935045Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:f4461dbb875bcacb76547357f6a870d02394e5852ce06bea5f118bb4624fb235","observation_id":"cf331162-f1b4-4f4e-a36a-2d3f7c10ba00","resolution":{"observed_at":"2026-08-07T04:55:29.765277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:28.940019Z","title":"Taming diffusion models for audio-driven co-speech gesture generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.940019Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:493174a804b330a1b7358ab528f1e8783e5f16a7de29cd5fbd1c568e2c1e89b9","observation_id":"81a56989-01fb-48eb-b3bd-a3f7b69ee758","resolution":{"observed_at":"2026-08-07T04:55:28.940019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:55:29.560355Z","title":"Vlogger: Make your dream a vlog","venue":null,"work_id":"27298a1c-5ef6-4f4b-afbf-3d2426d41cb4","year":2024},"citing_paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T04:55:28.944960Z"},"links":{"citing_paper":"/paper/2506.11144"},"observation_digest":"sha256:419692e3efacb1a8449e864e4fbdfc554b722ce25a0f4a124fb8a716d384c94e","observation_id":"4b5ee12e-bb9b-47aa-84d2-20ad52b4d177","resolution":{"observed_at":"2026-08-07T04:55:29.620891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11144","last_updated":"2025-06-11T05:33:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T04:46:32.123425Z","submitted_at":"2025-06-11T05:33:03Z","title":"AlignHuman: Improving Motion and Fidelity via Timestep-Segment Preference Optimization for Audio-Driven Human Animation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 3 inbound Pith citation observations for arXiv:2506.11144."}