{"as_of":"2026-08-15T03:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:acc008e34b1e0826693855813ab7cf720e0f120edf1a0aa11a909a5b2c969c89","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:13:40.746783Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.19459/citation-record","integrity":"/paper/2411.19459/integrity","json":"/paper/2411.19459/citation-record.json","paper":"/paper/2411.19459"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-07T21:47:08.589400Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-12T10:13:40.490628Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.490628Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:478326af052f97d4b335765d5c33037543c175a15133c13e7c7bf47ad90c5558","observation_id":"aa37aba5-55c7-4dd9-a31a-5c6e062c5d5e","resolution":{"observed_at":"2026-08-12T10:13:40.490628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.560913Z","title":"Magicpose: Realistic human poses and facial expressions retargeting with identity-aware diffusion","venue":null,"work_id":"2ba3b8a7-7cd0-4048-bdea-ddd772172112","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.496525Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:7379abc829b4d579811636c8d37ed0ad1b47144be01cceaff444b43e0c43a4b0","observation_id":"306a3257-29dd-406c-8cd3-31373c77e294","resolution":{"observed_at":"2026-08-12T10:13:41.566438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.543677Z","title":"Videocrafter1: Open diffusion models for high-quality video generation, 2023","venue":null,"work_id":"8e57a68d-9083-4b57-9ada-e129026c5966","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.501191Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:d08e007f812f1b35ac4968689c9a827155cabe7f91409cba124b79f23d52834a","observation_id":"85175727-acca-46c4-a71b-ac1f02ed6e0c","resolution":{"observed_at":"2026-08-12T10:13:41.548929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-14T13:54:28.489740Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-12T10:13:40.506000Z","title":"Motionllm: Understanding human behaviors from human motions and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.506000Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:0fd3e05515c4a2fbb5bac5bf0fbfaef31992a834bdf2043c3d49259292c47769","observation_id":"07729790-99de-4d0b-82e3-90bd3ef760d0","resolution":{"observed_at":"2026-08-12T10:13:40.506000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.511123Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.511123Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:3898005f67bcdd35accffa6bbfe290efaad71b8be82769f07c8fcce453934bd2","observation_id":"a0224a63-38ed-4c7e-b3be-ca156790713c","resolution":{"observed_at":"2026-08-12T10:13:40.511123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09344","last_updated":"2023-12-08T21:02:07Z","snapshot_observed_at":"2026-08-14T16:45:13.572276Z","submitted_at":"2023-06-15T17:59:50Z","title":"DreamSim: Learning New Dimensions of Human Visual Similarity using Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09344","snapshot_observed_at":"2026-08-12T10:13:40.516086Z","title":"Dream- sim: Learning new dimensions of human visual similar- ity using synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.516086Z"},"links":{"cited_paper":"/paper/2306.09344","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f4da8211507ae166a086dd2106c8491a0c232698bfa28171b1f69e433a0656bf","observation_id":"30dafbfc-6158-4901-a755-c3e07ba38f99","resolution":{"observed_at":"2026-08-12T10:13:40.516086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.515658Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"81c4b3a6-f7fd-4c31-9437-d6fef490f6f4","year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.521478Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f940f89f7494fe315a87a88f9b61fd469a9ec72a93a1eb52406060eb5ac85714","observation_id":"d5db001f-06ba-4da2-95a7-ed09bb9ec565","resolution":{"observed_at":"2026-08-12T10:13:41.520802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.498408Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"98edee19-2c0d-4898-8f9e-e649d3dd62e7","year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.526877Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:eba9d8ac9a59da2929addad5eb8c37c0d43e00e864b46d2edda1acb86c404be9","observation_id":"35f238d6-8ab1-4ac6-a13b-4728c237111c","resolution":{"observed_at":"2026-08-12T10:13:41.504168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.531947Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.531947Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:a61745551a77da2546ce81930575a60e9e66b440ce0dd9d5138e50993338e36f","observation_id":"d1f4abd9-4af8-4eae-98a4-29c44bee6f3e","resolution":{"observed_at":"2026-08-12T10:13:40.531947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.537129Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.537129Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:dfff0caad329ab51ee90993e236c5d149a8243aacceb8f388f931f10c8ebad39","observation_id":"4323b666-deb9-408d-96ee-8c9d1e5e353e","resolution":{"observed_at":"2026-08-12T10:13:40.537129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.459225Z","title":"Image quality metrics: Psnr vs","venue":null,"work_id":"256432bf-8e36-4756-a94d-377c5ca31ed5","year":2010},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.542131Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:04601325711903682a1a3953f7a20081b7449449a55e59613d3241522f904d59","observation_id":"352d5eae-8fc4-4c5a-98ab-4e28f202ec68","resolution":{"observed_at":"2026-08-12T10:13:41.465326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.547207Z","title":"Animate anyone: Consistent and controllable image- to-video synthesis for character animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.547207Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:9b3ff7ad04d8c878fa8c9e75c31cbc54ff3ff2bda45415ed74680b0bdf78089b","observation_id":"3fcaea52-a3e1-422a-b8ec-8a573cf7fcb8","resolution":{"observed_at":"2026-08-12T10:13:40.547207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.430508Z","title":"VBench: Com- prehensive benchmark suite for video generative models","venue":null,"work_id":"ce7ba2c0-8cd6-4107-97ed-7549b08a6571","year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.552596Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:6ad3ca8df5aac4b283de513f1b868061f4faf424d7014fe634071dbb40e4e2a9","observation_id":"66a148ff-19f3-4270-a84d-fb56cc3e6f4e","resolution":{"observed_at":"2026-08-12T10:13:41.436014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.412861Z","title":"Learning high fi- delity depths of dressed humans by watching social media dance videos","venue":null,"work_id":"a8018729-a3f5-48f4-9be9-aa19f63de489","year":2021},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.558580Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:2f919e587a0f4484a97d98577f2eafb892be93342e88b8afab10202328d7081f","observation_id":"51415097-2d8d-4f04-8d8d-4a1f768a04ff","resolution":{"observed_at":"2026-08-12T10:13:41.418841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.395300Z","title":"Digital image processing","venue":null,"work_id":"da171c86-8e8b-46a8-a510-13b8259cc800","year":2005},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.563720Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:ff0e9305aac93d57067800eb815d7015ff4b3dcb752013fa0d4723a772fc190e","observation_id":"0a7dcbed-faef-4f16-9566-14794036de09","resolution":{"observed_at":"2026-08-12T10:13:41.400503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.377987Z","title":"Motiongpt: Human motion as a foreign lan- guage","venue":null,"work_id":"0da786c0-f1f7-46fd-9b95-088090deab6a","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.569750Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:abffa39325c6b606ca897f2febb240d5dfc3ff447d830f181d8576d4b7de883d","observation_id":"1d25c30c-ac2e-487e-bd4d-fe96f12df98a","resolution":{"observed_at":"2026-08-12T10:13:41.383558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-12T10:13:40.574807Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.574807Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:b6ffe0053f6547e4be16f5618c12c1605ccb1013f6824012b6a337917ae6364a","observation_id":"c743c967-c44d-4ab0-bce1-0c26cd6deeee","resolution":{"observed_at":"2026-08-12T10:13:40.574807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06513","last_updated":"2024-10-09T03:27:14Z","snapshot_observed_at":"2026-08-12T22:27:39.628413Z","submitted_at":"2024-10-09T03:27:14Z","title":"MotionRL: Align Text-to-Motion Generation to Human Preferences with Multi-Reward Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06513","snapshot_observed_at":"2026-08-12T10:13:40.580329Z","title":"Motionrl: Align text-to-motion generation to human preferences with multi-reward reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.580329Z"},"links":{"cited_paper":"/paper/2410.06513","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:0c9c9d13fbd359695a3595886bba2da96a9029395be79436272668ff43133127","observation_id":"635a1e0d-0bcc-49a2-9b29-6856134bbbd9","resolution":{"observed_at":"2026-08-12T10:13:40.580329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17177","last_updated":"2024-04-17T18:41:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-27T03:30:58Z","title":"Sora: A Review on Background, Technology, Limitations, and Opportunities of Large Vision Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17177","snapshot_observed_at":"2026-08-12T10:13:40.586149Z","title":"Sora: A review on background, technology, limitations, and opportunities of large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.586149Z"},"links":{"cited_paper":"/paper/2402.17177","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:a9094b52d0248e0332a4917f68d347445f64ced44ba665087c860e27e4c6e3d5","observation_id":"8b7b0fe3-09a8-45a0-9c7b-a6c04fa420c9","resolution":{"observed_at":"2026-08-12T10:13:40.586149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.591536Z","title":"Temos: Generating diverse human motions from textual descriptions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.591536Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:14c5c4fc940f300d5396d4767b7e81fc4e6f623a1d6fdc7cd18069e327b15c6e","observation_id":"e3137eab-588e-410d-8fe4-22a636f1c0c6","resolution":{"observed_at":"2026-08-12T10:13:40.591536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-14T11:08:32.950294Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13720","snapshot_observed_at":"2026-08-12T10:13:40.596628Z","title":"Movie gen: A cast of media foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.596628Z"},"links":{"cited_paper":"/paper/2410.13720","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:32e9b9d76c9de6ededf2d9ea576fb1a565bcda39fb9bf7e00168c39a6d3c6374","observation_id":"cbd17b83-ed0c-4bc5-ac1e-51f7ca7be329","resolution":{"observed_at":"2026-08-12T10:13:40.596628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.602806Z","title":"Improving language understanding by gener- ative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.602806Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:6ff2a635916341214fce0921c4c836c022fd3fbaa0866fad657b95d716cfdc60","observation_id":"df0364af-f184-47bd-abb4-bfb7d7eb7771","resolution":{"observed_at":"2026-08-12T10:13:40.602806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.337252Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"45ec83ca-77f5-4786-afbd-935e85cdf963","year":2021},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.608126Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:e1013696284ded24f71d1860283e0bce3b101206047fd4e95ab03a749a861975","observation_id":"610265d1-7e15-49f6-8f17-e962004d6f3b","resolution":{"observed_at":"2026-08-12T10:13:41.343599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.613159Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.613159Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:abbe4ca418f6ef611f7c32d09a2efd7b1d18435a83f2bf580a91c200769889f7","observation_id":"099f73fc-c123-481a-8729-e9b283e32030","resolution":{"observed_at":"2026-08-12T10:13:40.613159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.307787Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"0df7a756-6018-4a6f-9b12-02c7bd2cdcfe","year":2015},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.617674Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:18da3db8b5d2c96770f8e9f80be545a43bb8d390f91db6ce204a2da1eb09f44a","observation_id":"8ee44a92-404d-40da-a3ef-885a4514d83e","resolution":{"observed_at":"2026-08-12T10:13:41.313799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-08-11T15:38:14.931716Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-12T10:13:40.623959Z","title":"Denoising diffusion implicit models","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.623959Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:cb9e9dd605bd9cfdd9bfdd1d1e67c0836aa1193d94981dddaca7c963cd0dee30","observation_id":"b4956ba8-fa6f-4f93-9039-bbaa7eedde67","resolution":{"observed_at":"2026-08-12T10:13:40.623959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.290691Z","title":"Motionclip: Exposing human motion generation to clip space","venue":null,"work_id":"d4f25308-7052-4c0f-af7a-5b539fdd1719","year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.629027Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:2f55baf1696dbbf6465bd31c1c531726736c0a634bc90dcae601d65282eca216","observation_id":"8fe6dd56-9acd-417c-b744-5f76035aa2ef","resolution":{"observed_at":"2026-08-12T10:13:41.296313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.633810Z","title":"Human motion diffu- sion model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.633810Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:40250b7a0649ed7443e8f3953bf6b1bef291279ce1074d826cdf0b1046870510","observation_id":"dfe17384-989e-4f99-aa52-2f582bd643e2","resolution":{"observed_at":"2026-08-12T10:13:40.633810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T10:13:40.638481Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.638481Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:25cc1316e2e4fb98abf4d1542a472dd79e2e3e078ba27464a8a1dc8964fb4b95","observation_id":"1eda211a-0435-4395-9a7b-9012e9d5a3e3","resolution":{"observed_at":"2026-08-12T10:13:40.638481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.01717","last_updated":"2019-03-27T16:43:17Z","snapshot_observed_at":"2026-08-15T00:26:15.250313Z","submitted_at":"2018-12-03T03:57:42Z","title":"Towards Accurate Generative Models of Video: A New Metric & Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.01717","snapshot_observed_at":"2026-08-12T10:13:40.643288Z","title":"Towards accurate generative models of video: A new metric & chal- lenges","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.643288Z"},"links":{"cited_paper":"/paper/1812.01717","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:1d0bf320061f51b53cce77a29fe62844ff665a4df7633587c32ef825d6ea9ad8","observation_id":"7531c7ab-42c4-4264-bf72-4d052fa1e0d3","resolution":{"observed_at":"2026-08-12T10:13:40.643288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.262736Z","title":"Neural discrete representation learning","venue":null,"work_id":"bc96f02c-58f6-4231-ad0b-78a0f3126cb3","year":2017},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.648803Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:b58f20df5cd46e1384863800ea1d898518b0a6d79806f8ffc1649881019e02f3","observation_id":"71ac6984-57c3-4c31-b2a3-7b57cb4c4fd6","resolution":{"observed_at":"2026-08-12T10:13:41.268363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.245937Z","title":"Disco: Disentangled control for realistic human dance generation","venue":null,"work_id":"4a258495-1072-4cfd-b9f7-ac7691a52be0","year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.653923Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:e7d0746d989c326bffd8eed758c61a88efebb9f2878f23318827286e3e856680","observation_id":"98037765-4d57-4783-b922-55550336bd89","resolution":{"observed_at":"2026-08-12T10:13:41.250983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-12T22:13:07.514751Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-12T10:13:40.659063Z","title":"Motiongpt-2: A general-purpose motion- language model for motion generation and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.659063Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:2a45440a73b911cde84b41f94d2f017461b748a15309ce8f4d0b702c0c3ac17b","observation_id":"fd20ac5c-1ba7-43f4-a49e-379b1d094c9e","resolution":{"observed_at":"2026-08-12T10:13:40.659063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17438","last_updated":"2024-11-21T03:26:54Z","snapshot_observed_at":"2026-08-12T23:15:28.181869Z","submitted_at":"2024-07-24T17:15:58Z","title":"HumanVid: Demystifying Training Data for Camera-controllable Human Image Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17438","snapshot_observed_at":"2026-08-12T10:13:40.664845Z","title":"Humanvid: Demystifying training data for camera-controllable human image animation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.664845Z"},"links":{"cited_paper":"/paper/2407.17438","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:32268b6930d838b438fd2702008a6fdd5d574e4ceef7880b203cb6a1f6eb4707","observation_id":"33df348a-e6a5-4dcb-b727-039626c45b6b","resolution":{"observed_at":"2026-08-12T10:13:40.664845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.670394Z","title":"Dynamicrafter: Animating open-domain images with video diffusion priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.670394Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f588a30b99f5514e3504b7a52a42ed8586d1158809eb8d8ea1847a092d88bb56","observation_id":"8bb9181f-870d-4545-9828-2e672ae51df0","resolution":{"observed_at":"2026-08-12T10:13:40.670394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.676128Z","title":"Magicanimate: Temporally consistent human im- age animation using diffusion model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.676128Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:7bb9ceb394b07bc5c3763d9ff3eab98525f422ea43baf29163719b0decc2bec2","observation_id":"f3572c70-a08b-4924-98ca-d62dd77bfcd8","resolution":{"observed_at":"2026-08-12T10:13:40.676128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.681243Z","title":"Mastering text-to-image dif- fusion: Recaptioning, planning, and generating with multi- modal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.681243Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:810306077d6015e22fa1e2be7bcb06c69ae4ecf131fda1dbca269257ec8511e1","observation_id":"b6f9a81c-d404-49f7-908b-0989387c194f","resolution":{"observed_at":"2026-08-12T10:13:40.681243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:40.686289Z","title":"Effec- tive whole-body pose estimation with two-stages distillation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.686289Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:74d3abb5ca78ef78c91a3c8953c02e55d93157dd66a54948fa02f2faba9b3a14","observation_id":"78dc247a-d061-4453-a51a-ca5796d4e07f","resolution":{"observed_at":"2026-08-12T10:13:40.686289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.183393Z","title":"Generating human motion from textual descrip- tions with discrete representations","venue":null,"work_id":"c8bbc792-620e-47a3-a400-c60abc191f5b","year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.691285Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:460535df310f7213590d798615bd1ae5e4bebd46db4ba961a9a8e6a365f21942","observation_id":"b6c0336b-a910-4c1b-b797-23bc570f50e2","resolution":{"observed_at":"2026-08-12T10:13:41.188838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-13T14:35:06.773752Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-12T10:13:40.696670Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.696670Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:f5b38e7f5d8465d57025dc7a1646d9c3bfe35fc126a82ef019629bf2e0659688","observation_id":"fd0a3502-9bb2-4c97-b219-6ee916ee7cf3","resolution":{"observed_at":"2026-08-12T10:13:40.696670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.165836Z","title":"The unreasonable effectiveness of deep features as a perceptual metric","venue":null,"work_id":"e0d972af-ee76-4d6e-ab55-5668945fa8ed","year":2018},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.702359Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:cc57e56383132430d01fe4738c7f5bb837aeecfbea510bd571265f3d5c881823","observation_id":"cbe6ab5c-e06a-4d22-a0da-2082230bd188","resolution":{"observed_at":"2026-08-12T10:13:41.171000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04145","last_updated":"2023-11-07T17:16:06Z","snapshot_observed_at":"2026-08-02T12:25:34.488259Z","submitted_at":"2023-11-07T17:16:06Z","title":"I2VGen-XL: High-Quality Image-to-Video Synthesis via Cascaded Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04145","snapshot_observed_at":"2026-08-12T10:13:40.708407Z","title":"I2vgen-xl: High-quality image-to-video synthesis via cascaded diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.708407Z"},"links":{"cited_paper":"/paper/2311.04145","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:b853834ccbfdbc12876d1125fb61873f103cedf79bf2882d478a306d83c4b5d0","observation_id":"e685905d-b4ac-4548-b98d-2af5ae8f7a7b","resolution":{"observed_at":"2026-08-12T10:13:40.708407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19680","last_updated":"2025-06-27T10:06:13Z","snapshot_observed_at":"2026-08-13T04:40:24.036354Z","submitted_at":"2024-06-28T06:40:53Z","title":"MimicMotion: High-Quality Human Motion Video Generation with Confidence-aware Pose Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19680","snapshot_observed_at":"2026-08-12T10:13:40.714663Z","title":"Mim- icmotion: High-quality human motion video generation with confidence-aware pose guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.714663Z"},"links":{"cited_paper":"/paper/2406.19680","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:79ad6bc550c88c1f80e67fe719f1c7932d7d39d7b27d09a4c8401db67102fd4d","observation_id":"ac604c50-b044-487e-8a94-667f7703c171","resolution":{"observed_at":"2026-08-12T10:13:40.714663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15458","last_updated":"2024-10-20T17:51:35Z","snapshot_observed_at":"2026-08-12T22:19:09.109938Z","submitted_at":"2024-10-20T17:51:35Z","title":"Allegro: Open the Black Box of Commercial-Level Video Generation Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15458","snapshot_observed_at":"2026-08-12T10:13:40.720090Z","title":"Al- legro: Open the black box of commercial-level video gener- ation model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.720090Z"},"links":{"cited_paper":"/paper/2410.15458","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:c116d346332db5d03f3b248b58794c7312f35e16fca50cf13dd9ebf8adb1bdb8","observation_id":"751af8ba-2a72-4a5c-a9cb-cd6a7cb971b5","resolution":{"observed_at":"2026-08-12T10:13:40.720090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14781","last_updated":"2024-06-01T08:27:23Z","snapshot_observed_at":"2026-08-13T00:48:24.019003Z","submitted_at":"2024-03-21T18:52:58Z","title":"Champ: Controllable and Consistent Human Image Animation with 3D Parametric Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14781","snapshot_observed_at":"2026-08-12T10:13:40.725281Z","title":"Champ: Controllable and consistent human image animation with 3d parametric guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.725281Z"},"links":{"cited_paper":"/paper/2403.14781","citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:776e112beb7bf2527c9302251772dea74224ec553bda9e81e9ab34d8eed8fb4d","observation_id":"6a15dd41-6bbb-4c42-ad05-0eef4427a5b5","resolution":{"observed_at":"2026-08-12T10:13:40.725281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.149475Z","title":null,"venue":null,"work_id":"73393851-b5b2-4167-9d43-10f8ec0931ca","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.730645Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:0cc99b0197784aa73240333d422d7c3c2392371e781fdf5003a24a793ba27620","observation_id":"c12d70c2-b26d-4e82-b9e9-36160d1dd5c4","resolution":{"observed_at":"2026-08-12T10:13:41.154430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.132712Z","title":null,"venue":null,"work_id":"60bcf03d-462d-4936-8094-97f4e176efcd","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.736302Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:61b8aa137b133fe62478744e7bdc1012c727a2d3998635a4ab5628200ce3b8b9","observation_id":"059d3f59-9fa6-4b2b-8c68-2424071bec42","resolution":{"observed_at":"2026-08-12T10:13:41.137854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.114349Z","title":"Eight participants evaluate each video across three criteria: video quality, identity preservation, and motion-text alignment","venue":null,"work_id":"fa42328b-56ab-43fb-987d-1671e122343f","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.741528Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:968690931da7f186847b8d8a7868a90d17b1d5c30b2b52579ed544fb6c5b4fd8","observation_id":"6570606a-56ba-4320-a462-a4119f302c96","resolution":{"observed_at":"2026-08-12T10:13:41.120246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:13:41.095414Z","title":null,"venue":null,"work_id":"a90fb3be-78a1-4ca0-baf4-83089deb1c46","year":null},"citing_paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:13:40.746783Z"},"links":{"citing_paper":"/paper/2411.19459"},"observation_digest":"sha256:62e3a7685a0a724247679c8052e9205fc069172c217b27c71754d3f3116511a4","observation_id":"d8e6b706-78f6-4a4c-b1fa-2c6eb3f5b2fd","resolution":{"observed_at":"2026-08-12T10:13:41.101458Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19459","last_updated":"2024-11-29T04:09:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T18:47:33.191813Z","submitted_at":"2024-11-29T04:09:13Z","title":"Fleximo: Towards Flexible Text-to-Human Motion Video Generation"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":17},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2411.19459."}