{"as_of":"2026-08-23T05:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b2dbba4377c0cb9b7b2f8764e049f1436ed0e4ea3999a0ead6ec5e2792501e47","coverage":[{"denominator":79,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":79,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:29:46.938716Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:11:12.977121Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T18:15:21.360726Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-08-16T10:11:12.977121Z","title":"Learning from massive human videos for universal humanoid pose control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18904","last_updated":"2025-04-26T12:31:04Z","snapshot_observed_at":"2026-08-19T21:51:56.835264Z","submitted_at":"2025-04-26T12:31:04Z","title":"RoboVerse: Towards a Unified Platform, Dataset and Benchmark for Scalable and Generalizable Robot Learning","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T10:11:12.977121Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2504.18904"},"observation_digest":"sha256:27017e2d7d43d362fc5d12c53ec7a3fe248d8de5e28ea560dbc69878a8d1d05e","observation_id":"e95e81a9-ca41-49c5-869e-436bdc0b47a1","resolution":{"observed_at":"2026-08-16T10:11:12.977121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-08-16T05:00:28.337040Z","title":"Learning from massive human videos for universal humanoid pose control.arXiv preprint arXiv:2412.14172, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.21738","last_updated":"2025-04-30T15:37:23Z","snapshot_observed_at":"2026-08-19T01:52:29.277889Z","submitted_at":"2025-04-30T15:37:23Z","title":"LangWBC: Language-directed Humanoid Whole-Body Control via End-to-end Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T05:00:28.337040Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2504.21738"},"observation_digest":"sha256:75423ae127aac854a041b77cc900246c4da19fd34e589fb9c8811e3ce222f882","observation_id":"76932038-a8d1-4943-ae15-49c66e385006","resolution":{"observed_at":"2026-08-16T05:00:28.337040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-08-07T00:45:00.880531Z","title":"Learning from massive human videos for universal humanoid pose control.arXiv preprint arXiv:2412.14172, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12851","last_updated":"2026-07-01T07:21:43Z","snapshot_observed_at":"2026-08-19T19:10:09.152844Z","submitted_at":"2025-06-15T13:58:53Z","title":"KungfuBot: Physics-Based Humanoid Whole-Body Control for Learning Highly-Dynamic Skills","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:45:00.880531Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2506.12851"},"observation_digest":"sha256:9d23d8929c47ab3715eeb0a42dd63b2222e561950c66a30352e83cdfdcea43c0","observation_id":"84d8370a-0097-4440-8df1-dbcd5f39b247","resolution":{"observed_at":"2026-08-07T00:45:00.880531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-08-07T00:13:37.670272Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.14770","last_updated":"2025-09-04T02:48:07Z","snapshot_observed_at":"2026-08-14T19:22:40.392293Z","submitted_at":"2025-06-17T17:59:33Z","title":"GMT: General Motion Tracking for Humanoid Whole-Body Control","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:13:37.670272Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2506.14770"},"observation_digest":"sha256:a35ab1ab86986f3090965dce1a9fcc919c7d903feba3a2c035d0809e7ada6fcf","observation_id":"df6e441d-3b27-495c-ad3b-49a70f3d5b3d","resolution":{"observed_at":"2026-08-07T00:13:37.670272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-08-04T10:44:30.082678Z","title":"Learning from massive human videos for universal humanoid pose control,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08807","last_updated":"2026-07-04T03:31:36Z","snapshot_observed_at":"2026-08-04T10:44:29.379805Z","submitted_at":"2025-10-09T20:43:27Z","title":"Humanoid Everyday: A Comprehensive Robotic Dataset for Open-World Humanoid Manipulation","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T10:44:30.082678Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2510.08807"},"observation_digest":"sha256:154f214e5a9b6ee638039cf323fe2c85fdf0e4d5c57e6cd4e7c57d7612bef2d1","observation_id":"b180192d-dceb-43b6-9bd1-e13689839634","resolution":{"observed_at":"2026-08-04T10:44:30.082678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-08-04T08:37:20.378298Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.19789","last_updated":"2026-07-18T10:26:44Z","snapshot_observed_at":"2026-08-15T03:35:06.551915Z","submitted_at":"2025-10-22T17:25:33Z","title":"OmniMotion-X: Versatile Multimodal Whole-Body Motion Generation","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-04T08:37:20.378298Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2510.19789"},"observation_digest":"sha256:28646bce4ca0eb1d0818d410c1dbe542d712c6ddc22e949a39b405e284e45829","observation_id":"1152f504-9176-47a9-8d57-31cca7cfe022","resolution":{"observed_at":"2026-08-04T08:37:20.378298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":"2412.14172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-07-08T18:15:21.360726Z","title":"Learning from massive human videos for universal humanoid pose control","venue":"cs.RO","work_id":"dd72523b-acdf-43cf-8234-9922318fc19a","year":2024},"citing_paper":{"arxiv_id":"2604.17807","last_updated":"2026-04-20T04:59:28Z","snapshot_observed_at":"2026-08-11T16:52:26.927303Z","submitted_at":"2026-04-20T04:59:28Z","title":"Re$^2$MoGen: Open-Vocabulary Motion Generation via LLM Reasoning and Physics-Aware Refinement","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T05:42:58.700609Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2604.17807"},"observation_digest":"sha256:be55aa754318b24e88d1c8cbac368f7f392a3a3be6e4b7793d0f687b9be9dff1","observation_id":"85e8596c-7c13-4273-9e09-2ee668e70951","resolution":{"observed_at":"2026-05-10T05:56:11.606859Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":"2412.14172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-07-08T18:15:21.360726Z","title":"Learning from massive human videos for universal humanoid pose control","venue":"cs.RO","work_id":"dd72523b-acdf-43cf-8234-9922318fc19a","year":2024},"citing_paper":{"arxiv_id":"2604.22199","last_updated":"2026-04-24T04:09:42Z","snapshot_observed_at":"2026-08-15T13:38:56.226839Z","submitted_at":"2026-04-24T04:09:42Z","title":"An LLM-Driven Closed-Loop Autonomous Learning Framework for Robots Facing Uncovered Tasks in Open Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T11:27:34.992950Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2604.22199"},"observation_digest":"sha256:f6f18093ef9a98d2e5b8d7f228ddf1968b0ce3055e1f562d7984050008c11b8d","observation_id":"a58d7ac7-c965-4497-be50-23df6d32eb8f","resolution":{"observed_at":"2026-05-11T19:36:14.659231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":"2412.14172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-07-08T18:15:21.360726Z","title":"Learning from massive human videos for universal humanoid pose control","venue":"cs.RO","work_id":"dd72523b-acdf-43cf-8234-9922318fc19a","year":2024},"citing_paper":{"arxiv_id":"2606.03985","last_updated":"2026-06-02T17:59:05Z","snapshot_observed_at":"2026-08-12T07:04:27.608794Z","submitted_at":"2026-06-02T17:59:05Z","title":"Humanoid-GPT: Scaling Data and Structure for Zero-Shot Motion Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T10:01:00.409280Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2606.03985"},"observation_digest":"sha256:5d71f1fc83a3a5e7f863df99bc33ee3334cb8f8f23366cd6fe84f393acedf4f3","observation_id":"7f5625e8-70d6-4949-9b5e-9488ba635e50","resolution":{"observed_at":"2026-07-02T03:26:29.700049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":"2412.14172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-07-08T18:15:21.360726Z","title":"Learning from massive human videos for universal humanoid pose control","venue":"cs.RO","work_id":"dd72523b-acdf-43cf-8234-9922318fc19a","year":2024},"citing_paper":{"arxiv_id":"2606.06953","last_updated":"2026-06-05T06:33:09Z","snapshot_observed_at":"2026-08-12T16:24:48.837702Z","submitted_at":"2026-06-05T06:33:09Z","title":"LIMMT: Less is More for Motion Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-27T22:13:43.198541Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2606.06953"},"observation_digest":"sha256:0dbcb4800138688be0870f220d2138d1e65b15abb80ed5cb87291537afc9ec7c","observation_id":"67260d33-1e88-4235-aee7-b73dc2155708","resolution":{"observed_at":"2026-07-02T17:07:12.550462Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":"2412.14172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-07-08T18:15:21.360726Z","title":"Learning from massive human videos for universal humanoid pose control","venue":"cs.RO","work_id":"dd72523b-acdf-43cf-8234-9922318fc19a","year":2024},"citing_paper":{"arxiv_id":"2607.06052","last_updated":"2026-07-07T09:26:51Z","snapshot_observed_at":"2026-08-12T12:46:33.226481Z","submitted_at":"2026-07-07T09:26:51Z","title":"ThorArena: Benchmarking Humanoid Physical Interaction with Human Motion-Force Demonstrations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T18:10:36.258268Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2607.06052"},"observation_digest":"sha256:a6b0eda09f49f6c6fbbb44b2a441e77d9593217c7aa76b1f00dfacbade3d7334","observation_id":"05cf4f94-8c67-41ae-9ab7-c4f45457429a","resolution":{"observed_at":"2026-07-08T18:15:21.362695Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14172","snapshot_observed_at":"2026-08-12T00:39:25.294813Z","title":"arXiv preprint arXiv:2412.14172 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07993","last_updated":"2026-08-08T08:02:37Z","snapshot_observed_at":"2026-08-14T11:11:02.404005Z","submitted_at":"2026-08-08T08:02:37Z","title":"MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T00:39:25.294813Z"},"links":{"cited_paper":"/paper/2412.14172","citing_paper":"/paper/2608.07993"},"observation_digest":"sha256:73ee414c657771135b49681a64ab5a669ce85fafd2b621b8c39feac68686807b","observation_id":"bbb99c54-894a-46b3-aeec-a6c55834a011","resolution":{"observed_at":"2026-08-12T00:39:25.294813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.14172/citation-record","integrity":"/paper/2412.14172/integrity","json":"/paper/2412.14172/citation-record.json","paper":"/paper/2412.14172"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.257252Z","title":"Human- to-robot imitation in the wild","venue":null,"work_id":"a47413b7-ba8b-457d-b09c-5867c957c71e","year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.536471Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:8909b477f691bf805c1f9cf7d223f0a69bdb2ba0bcaed822730dd22d7a8a6ef9","observation_id":"b2f564c5-9444-417b-a4b5-0ed7c5570e54","resolution":{"observed_at":"2026-08-11T12:29:48.262409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.240710Z","title":"Affordances from human videos as a versa- tile representation for robotics","venue":null,"work_id":"698700ec-c0f8-4d83-b5b7-6c08da7c65c5","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.542027Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:c6bf7f581ca5952808274c12f971ea92b98c60afeb4a820439af5400a78eba0a","observation_id":"5a7f4b1a-5685-4bb5-b74b-1b22ade4404a","resolution":{"observed_at":"2026-08-11T12:29:48.246202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15127","last_updated":"2023-11-25T22:28:38Z","snapshot_observed_at":"2026-08-20T09:39:07.545813Z","submitted_at":"2023-11-25T22:28:38Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15127","snapshot_observed_at":"2026-08-11T12:29:46.547914Z","title":"Stable video diffusion: Scaling latent video diffusion models to large datasets","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.547914Z"},"links":{"cited_paper":"/paper/2311.15127","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:4f2cb086532bbc5947dd2fa32b2e7a4645a91570fe80924899995621d55f1217","observation_id":"308e47e4-a51b-4d4d-ad9b-fa30e79de5d4","resolution":{"observed_at":"2026-08-11T12:29:46.547914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.225546Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":"a76faf48-4fa3-4775-842f-502903f82221","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.553333Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:404392803cbab849f56c6d714152778ca8808a87eaf4282e7e57cc5b135ecfc0","observation_id":"1bb15ec1-a7db-4d7e-b6d8-f1ff694044a6","resolution":{"observed_at":"2026-08-11T12:29:48.230438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.209616Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":"32a637ca-7fa9-4c80-be61-814a366f59e8","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.558290Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:a5473747ce88e20d005fd8351b5d1959a3bcd67f8765a5ee1ece875b0783ce6b","observation_id":"4d620fe6-aca3-49fb-8375-cddc6d5ba51a","resolution":{"observed_at":"2026-08-11T12:29:48.214657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.193553Z","title":"Humman: Multi-modal 4d human dataset for ver- satile sensing and modeling","venue":null,"work_id":"ef87dbc5-0141-4826-b927-d294f81ede18","year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.564057Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:2f8b6867b8c8b0301c4699d2822e50af6d08090f1dde019a7882367ed4567ecd","observation_id":"60a506c3-a396-40f4-8831-0320133b3d99","resolution":{"observed_at":"2026-08-11T12:29:48.198665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-08-14T16:05:50.720818Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-08-11T12:29:46.570427Z","title":"A short note on the kinetics-700 human action dataset","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.570427Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:5ce93188e13ad04c6994cf7935c1ee1ec111e0b071f6b4db7667727667728d70","observation_id":"2b2fa1f7-a3f5-4c9b-903d-acf8cad4804e","resolution":{"observed_at":"2026-08-11T12:29:46.570427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11825","last_updated":"2024-10-28T09:46:19Z","snapshot_observed_at":"2026-08-16T13:09:05.331502Z","submitted_at":"2024-10-15T17:52:20Z","title":"Learning Smooth Humanoid Locomotion through Lipschitz-Constrained Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11825","snapshot_observed_at":"2026-08-11T12:29:46.576024Z","title":"Learning smooth humanoid locomotion through lipschitz-constrained policies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.576024Z"},"links":{"cited_paper":"/paper/2410.11825","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:11a1c8cdfe188b1bf4a52a714a63b98f9da4eb120643390f71503f7be4fd4385","observation_id":"4b26f8c8-5f8c-477a-a893-9f635a6b3a40","resolution":{"observed_at":"2026-08-11T12:29:46.576024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16796","last_updated":"2024-03-06T02:19:38Z","snapshot_observed_at":"2026-08-19T20:14:54.650795Z","submitted_at":"2024-02-26T18:09:24Z","title":"Expressive Whole-Body Control for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16796","snapshot_observed_at":"2026-08-11T12:29:46.581588Z","title":"Expressive whole-body con- trol for humanoid robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.581588Z"},"links":{"cited_paper":"/paper/2402.16796","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:0f1e8e03f051db8e8784d56b47450def5dd0084ec482ac14f76f99520b232f66","observation_id":"57989dae-2787-40b3-9e70-b74f1bcb509c","resolution":{"observed_at":"2026-08-11T12:29:46.581588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T12:29:46.587377Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.587377Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:cd72e95967a3cf5c19ca72ff5293b67b03068654662fe10953d54b65e0cc7372","observation_id":"3bffc8b4-0ebc-48cc-ac6c-591ad609275b","resolution":{"observed_at":"2026-08-11T12:29:46.587377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.177496Z","title":"Haa500: Human-centric atomic action dataset with curated videos","venue":null,"work_id":"efac21f4-a5c8-443f-b277-46e9570a2c85","year":2021},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.592997Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:c64c43101fd80479eda9e6630882edb137d97f3d5662852e74af744993e5da89","observation_id":"278ff0fc-6389-48b3-a6f8-36114dbc7bc7","resolution":{"observed_at":"2026-08-11T12:29:48.182463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.161514Z","title":"Video language plan- ning","venue":null,"work_id":"c793eca8-119a-455f-9dc3-c3fce110f1e9","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.598049Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:b72573d5311d08721672e03e60f352fb96c27183b23c268480f8d4e80bf7b017","observation_id":"eb06418c-c5e0-478a-8ba4-05098bb59e37","resolution":{"observed_at":"2026-08-11T12:29:48.166929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10454","last_updated":"2024-06-15T00:41:34Z","snapshot_observed_at":"2026-08-20T20:46:27.308603Z","submitted_at":"2024-06-15T00:41:34Z","title":"HumanPlus: Humanoid Shadowing and Imitation from Humans","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10454","snapshot_observed_at":"2026-08-11T12:29:46.602989Z","title":"Humanplus: Humanoid shadowing and imita- tion from humans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.602989Z"},"links":{"cited_paper":"/paper/2406.10454","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:50d7970b92396b4ca3306398630ce151df5e26543ded49c34bb2cec7853f680c","observation_id":"b922c7b1-30cd-45c7-af6e-d7455ed72025","resolution":{"observed_at":"2026-08-11T12:29:46.602989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.137309Z","title":"Humans in 4d: Re- constructing and tracking humans with transformers","venue":null,"work_id":"902c2bdd-c3bb-417b-97b0-afb8414156e2","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.608188Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:e2e1117ddacc16afc53f73caf62a29cc7033025a1fd489818a9395e462079fb2","observation_id":"e01ab8e4-c80e-4fc0-bb86-92f286ee1c10","resolution":{"observed_at":"2026-08-11T12:29:48.150060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.107716Z","title":"Ego-exo4d: Understanding skilled human activity from first-and third-person perspectives","venue":null,"work_id":"4acaa0ac-e75a-4fc2-a284-8b7d28b9ffe1","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.613033Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:e64db3e2402415a992f4f91a6f40dcc830e962a63db3c25b4e16959833f9eafe","observation_id":"37186e09-e50f-4a07-ba78-b5e2a85bf85e","resolution":{"observed_at":"2026-08-11T12:29:48.119189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05695","last_updated":"2024-05-18T10:00:30Z","snapshot_observed_at":"2026-08-16T14:02:39.085762Z","submitted_at":"2024-04-08T17:26:28Z","title":"Humanoid-Gym: Reinforcement Learning for Humanoid Robot with Zero-Shot Sim2Real Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05695","snapshot_observed_at":"2026-08-11T12:29:46.617363Z","title":"Humanoid- gym: Reinforcement learning for humanoid robot with zero- shot sim2real transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.617363Z"},"links":{"cited_paper":"/paper/2404.05695","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:b895fcede7a8e4e1554293887682c7a08ebb99b2b46b489225280e1ed7dcc980","observation_id":"5587e8bb-166b-4092-a9f3-0626e88f4cee","resolution":{"observed_at":"2026-08-11T12:29:46.617363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14472","last_updated":"2024-08-26T17:59:03Z","snapshot_observed_at":"2026-08-16T13:23:43.543133Z","submitted_at":"2024-08-26T17:59:03Z","title":"Advancing Humanoid Locomotion: Mastering Challenging Terrains with Denoising World Model Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14472","snapshot_observed_at":"2026-08-11T12:29:46.622418Z","title":"Advanc- ing humanoid locomotion: Mastering challenging terrains with denoising world model learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.622418Z"},"links":{"cited_paper":"/paper/2408.14472","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:4f82ef617818e9684d766d2523f917180be6bcef73743d917692a64d13c12206","observation_id":"fe179203-9085-403c-a846-227519eeb38e","resolution":{"observed_at":"2026-08-11T12:29:46.622418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.087020Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"df2b09bb-54d0-424e-b2f6-1ce6ee406dd9","year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.627544Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:4acb5e9bba70397e4ecfbaa8c6bdd1f90ff3e8b4568e2389b2bfeca28b63f45a","observation_id":"cac6edd0-aae1-4390-a800-6454f9c51af6","resolution":{"observed_at":"2026-08-11T12:29:48.091669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08858","last_updated":"2024-06-13T06:44:46Z","snapshot_observed_at":"2026-08-19T21:16:35.742198Z","submitted_at":"2024-06-13T06:44:46Z","title":"OmniH2O: Universal and Dexterous Human-to-Humanoid Whole-Body Teleoperation and Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08858","snapshot_observed_at":"2026-08-11T12:29:46.633592Z","title":"Omnih2o: Universal and dexterous human- to-humanoid whole-body teleoperation and learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.633592Z"},"links":{"cited_paper":"/paper/2406.08858","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:93ba26732e5b2de8ff8c31a6f0251fc94622ebfa1468332cc1130d01ba6055dc","observation_id":"3c4be4ac-4728-433e-b851-35550912fb76","resolution":{"observed_at":"2026-08-11T12:29:46.633592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04436","last_updated":"2024-03-07T12:10:41Z","snapshot_observed_at":"2026-08-19T20:01:24.150265Z","submitted_at":"2024-03-07T12:10:41Z","title":"Learning Human-to-Humanoid Real-Time Whole-Body Teleoperation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04436","snapshot_observed_at":"2026-08-11T12:29:46.639956Z","title":"Learning human- to-humanoid real-time whole-body teleoperation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.639956Z"},"links":{"cited_paper":"/paper/2403.04436","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:515b063fba9cde2a831a198b35658f0d3e018beef6f03febb2bcd6df7668538c","observation_id":"4f5a56bb-33a0-4a9e-8214-bd25fdcb3a02","resolution":{"observed_at":"2026-08-11T12:29:46.639956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21229","last_updated":"2025-03-06T07:50:56Z","snapshot_observed_at":"2026-08-20T09:50:25.144827Z","submitted_at":"2024-10-28T17:15:24Z","title":"HOVER: Versatile Neural Whole-Body Controller for Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21229","snapshot_observed_at":"2026-08-11T12:29:46.645736Z","title":"Hover: Versatile neural whole-body controller for humanoid robots","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.645736Z"},"links":{"cited_paper":"/paper/2410.21229","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:350a342d7c65f53a4790e26532e8caefeeed8e5f6778040915dadb4d32439782","observation_id":"44e1aba8-3b7c-4a90-b374-45faeffde534","resolution":{"observed_at":"2026-08-11T12:29:46.645736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.071603Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":"6c3be60b-3ae4-41b2-9f18-58f81f7820be","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.651226Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:43c8164ed577a050d6a9b6d08fbaf3f423f2de27bd76f7bea199d1220d445d04","observation_id":"956b06a8-b3a9-4e95-b742-f724b9ffae7b","resolution":{"observed_at":"2026-08-11T12:29:48.076822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12773","last_updated":"2024-10-16T17:48:50Z","snapshot_observed_at":"2026-08-19T20:26:51.223935Z","submitted_at":"2024-10-16T17:48:50Z","title":"Harmon: Whole-Body Motion Generation of Humanoid Robots from Language Descriptions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12773","snapshot_observed_at":"2026-08-11T12:29:46.656230Z","title":"Harmon: Whole-body motion generation of humanoid robots from language descriptions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.656230Z"},"links":{"cited_paper":"/paper/2410.12773","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:6ed3fc628955254c5d29ca350386c6e94cec4e07fb731875f632c6b8adf922d6","observation_id":"32bab377-2f38-4602-9fb6-ca890e9b9468","resolution":{"observed_at":"2026-08-11T12:29:46.656230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-08-16T21:53:14.144225Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-11T12:29:46.662385Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.662385Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:6c9676dd0f299bc16781dc83dab1d12ea80f6f0e1efa22a16cab78a8b209a79b","observation_id":"908142aa-3004-4d2a-9cfe-ee310cdb2244","resolution":{"observed_at":"2026-08-11T12:29:46.662385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.056040Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"286f4a1c-67d5-44c6-8020-ebccef65dbc2","year":2014},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.668329Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:bdcd5f7d4a6fe5d4df10bbbe16c46cf09b6cc0c983805e10e7886f6c2f16e782","observation_id":"c0fa429e-0150-42d4-86ea-4eb0665ed30b","resolution":{"observed_at":"2026-08-11T12:29:48.061524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.040567Z","title":"Segment any- thing","venue":null,"work_id":"997f54d4-e553-4df4-a3fe-6a6fdddd1ea5","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.673251Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:30056f84be69703d87afc384633931230621ae88494b01841c4f71a3e55d4121","observation_id":"c40744b4-17e1-412a-94e0-1c061b45e7d1","resolution":{"observed_at":"2026-08-11T12:29:48.045121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.025798Z","title":"Vibe: Video inference for human body pose and shape estimation","venue":null,"work_id":"48c662ed-87cf-4cda-9ace-e809f84ae70c","year":2020},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.678183Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:2e2975f975052f56e213e30497d6ecdc472fe5a43f02d24a0ab36996ca3d25e7","observation_id":"217d7b6c-05cf-4931-a882-03cf9945ddcb","resolution":{"observed_at":"2026-08-11T12:29:48.030750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04689","last_updated":"2024-07-05T17:50:38Z","snapshot_observed_at":"2026-08-16T13:36:42.466358Z","submitted_at":"2024-07-05T17:50:38Z","title":"RAM: Retrieval-Based Affordance Transfer for Generalizable Zero-Shot Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04689","snapshot_observed_at":"2026-08-11T12:29:46.682966Z","title":"Ram: Retrieval-based affordance transfer for gen- eralizable zero-shot robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.682966Z"},"links":{"cited_paper":"/paper/2407.04689","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:c108c0dfdf46927ddb5a4245c38c7b3604e46ea9f6080babe79218d7aa18ba4b","observation_id":"ca51d2b7-a4ec-4c68-bf3b-15e1f43cf470","resolution":{"observed_at":"2026-08-11T12:29:46.682966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11792","last_updated":"2024-10-15T17:17:54Z","snapshot_observed_at":"2026-08-19T21:39:55.065669Z","submitted_at":"2024-10-15T17:17:54Z","title":"OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11792","snapshot_observed_at":"2026-08-11T12:29:46.687823Z","title":"Okami: Teaching hu- manoid robots manipulation skills through single video imi- tation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.687823Z"},"links":{"cited_paper":"/paper/2410.11792","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:222878acc0f708c0ecea6810794758ff2ba0306987d338e24ccebffb53ca8dad","observation_id":"8a85e45e-db21-4b27-8c02-3ada4aa16fff","resolution":{"observed_at":"2026-08-11T12:29:46.687823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:48.009740Z","title":"Robust and versatile bipedal jumping control through reinforcement learning","venue":null,"work_id":"b9c6bdd3-d8f8-4783-8397-ea1cf06c130c","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.692355Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:4481b1eb75e83643d670a5e285c5a9d7b0d4ff4d14b5f36851de964fb7c9c44d","observation_id":"f274362c-2130-42e9-8c26-430eff8810e6","resolution":{"observed_at":"2026-08-11T12:29:48.015089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.993268Z","title":"Intergen: Diffusion-based multi-human motion genera- tion under complex interactions","venue":null,"work_id":"66166d5b-e509-48a2-8020-434b7274ca81","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.696590Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:4b5d8d32705f37d3f5e00949a039b8076ad6451e7a6dcbf3031f0ae5467f38c1","observation_id":"3603b37d-41b9-4728-a233-10d76baf0975","resolution":{"observed_at":"2026-08-11T12:29:47.998739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.977149Z","title":"Motion-x: A large- scale 3d expressive whole-body human motion dataset","venue":null,"work_id":"256c562a-e214-4527-8e51-0927f0f89045","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.702254Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:979f0e48f0f142c84cd0d5a100e62ddad8d04fc1e6032cfa279f32de0a59e3af","observation_id":"f596ef4d-21e1-4a82-9deb-12573753a192","resolution":{"observed_at":"2026-08-11T12:29:47.982370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.960724Z","title":"Smpl: a skinned multi- person linear model","venue":null,"work_id":"3c017de4-4ddd-44e6-a8b3-fa5e38304e04","year":2015},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.706861Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:8cc777f664dad089dee12ab6b52bb66eca972f4fbb595b67ad3a887f693fa069","observation_id":"96108273-4c8e-4a15-8d60-c719cb406700","resolution":{"observed_at":"2026-08-11T12:29:47.966149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.945466Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":"041d9112-997e-4e7a-b601-9c254147619d","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.712113Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:56aebce4c99e7df651618c2fbb4cfa25dc68e1abcf8cd9d9c7821be66d072241","observation_id":"517272c3-5557-4c01-86ad-23a4afe65238","resolution":{"observed_at":"2026-08-11T12:29:47.950302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.929270Z","title":"Universal hu- manoid motion representations for physics-based control","venue":null,"work_id":"7f39cdd2-843c-4137-816c-bdf5298ce6d9","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.716847Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:50678ef7cc085837073083912df28ebae1eb499cab0ef0d95241ebc3ca547868","observation_id":"798ca62d-351f-4ecf-9523-5480b283fbc6","resolution":{"observed_at":"2026-08-11T12:29:47.934415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.914233Z","title":"Vip: Towards universal visual reward and representation via value-implicit pre-training","venue":null,"work_id":"222c071a-7bac-4ef9-a041-f82da36711a4","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.721637Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:d4c486218fa31e50dae88fde212d55cea639542a5b15988285e6ca7cdaa8f563","observation_id":"ea053ca2-a14e-4fa4-be02-ea855ee10b59","resolution":{"observed_at":"2026-08-11T12:29:47.918913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.899007Z","title":"Troje, Ger- ard Pons-Moll, and Michael J","venue":null,"work_id":"e903ecd9-8e93-47bb-8f10-82a8a1f2f1b5","year":2019},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.726818Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:388de678aa1969d7a81eb334baaa7fd1eaabcac102bcc7696cf52091215ae634","observation_id":"a95dbc38-23fa-4a82-b71c-d2600a61a412","resolution":{"observed_at":"2026-08-11T12:29:47.903796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.882899Z","title":"Struc- tured world models from human videos","venue":null,"work_id":"9064a2a9-87e8-417b-9d60-41e985659e75","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.731534Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:254779a1585035f1dffaec632a852c89c7cea4bfb2327931e769cb5d0e5309ef","observation_id":"65f9f69c-0650-4628-8869-f0e6ec985c9c","resolution":{"observed_at":"2026-08-11T12:29:47.888403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.864159Z","title":"R3m: A universal visual repre- sentation for robot manipulation","venue":null,"work_id":"f2a028b6-6103-4db2-ae75-f5361956b5f8","year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.736234Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:5e83d0f9a889040085d2f1afe8123a48b7d505322e1fa6b9e3bcee4c64a18bf5","observation_id":"19274c76-e8b9-4aa1-b6bf-a7628c4a8286","resolution":{"observed_at":"2026-08-11T12:29:47.871488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.847272Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":"b4b8db9e-b4bd-4bcb-bf2d-f8dde7325457","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.740954Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:17a9083a414d42a127b96116f5b04be9b73752b45bd5301fb6b5ba13f065d11e","observation_id":"99fe3a29-021e-4cb5-b20f-55cdef8871fb","resolution":{"observed_at":"2026-08-11T12:29:47.853314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-11T12:29:46.745609Z","title":"Dinov2: Learning robust visual features without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.745609Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:dc0f98667b29b726fe7cb7e8c4c370f951d463f566f4502c776c5b9dd5836e13","observation_id":"b364eb6a-cc80-40e1-b49c-5947c2333a09","resolution":{"observed_at":"2026-08-11T12:29:46.745609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.830073Z","title":"Amp: Adversarial motion priors for styl- ized physics-based character control","venue":null,"work_id":"2798599c-3323-487a-bb96-3b721e79254e","year":2021},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.750403Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:66bfa5429a7585f3199327e2148defb156a9b4069226090fd7da3560ef474c9b","observation_id":"fe1b216b-3fe6-43bd-827d-d850f6677914","resolution":{"observed_at":"2026-08-11T12:29:47.835861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.813354Z","title":"Ase: Large-scale reusable adversarial skill embeddings for physically simulated characters","venue":null,"work_id":"0304301f-4e97-4af9-83a2-4ca1ee856794","year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.755389Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:31d7a1f90e976d00fd97aac31c13be3252c7fc46c65b7d34bd5e4963b28b233a","observation_id":"10f5b3cd-20c4-41db-a2c9-55a494f34368","resolution":{"observed_at":"2026-08-11T12:29:47.819228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.794791Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"041ba757-7543-419a-9344-1889e4199153","year":2021},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.760711Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:d4667ae90e2744515534e66818a32411d3d33d94d42050c23d4e346ed820f8ef","observation_id":"78ac66b6-88a2-4d11-86fc-a6dd473ebcc9","resolution":{"observed_at":"2026-08-11T12:29:47.801583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.776089Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"dc4c37f6-c46e-404c-968c-422d343d809b","year":2021},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.765413Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:c9589e246339a8ba55b8c0f694ce7a8e2a424ea971aa3233f0573b905854ba83","observation_id":"ee266928-3e85-49ad-8d69-b8bb4bc1b5b6","resolution":{"observed_at":"2026-08-11T12:29:47.781821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.758463Z","title":"Robot learning with sen- sorimotor pre-training","venue":null,"work_id":"777d8dfa-125c-420a-900b-4cad28b62282","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.770997Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:07a374183c88af43275bc33c490c1c72ef4511be0cf2da4cd8e18bffbaf01b1e","observation_id":"0daf2c91-ad0c-4166-88df-476db7ec7403","resolution":{"observed_at":"2026-08-11T12:29:47.763624Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03654","last_updated":"2024-10-04T17:57:09Z","snapshot_observed_at":"2026-08-19T19:55:06.338018Z","submitted_at":"2024-10-04T17:57:09Z","title":"Learning Humanoid Locomotion over Challenging Terrain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03654","snapshot_observed_at":"2026-08-11T12:29:46.775903Z","title":"Learning humanoid locomotion over challenging terrain","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.775903Z"},"links":{"cited_paper":"/paper/2410.03654","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:0fe2caadeffed56b2942fabc3aff736bfa50a6e7eb38f1c8ae4652b9414f6839","observation_id":"10a7882d-d20e-4a0f-97c9-dcdca3b827cf","resolution":{"observed_at":"2026-08-11T12:29:46.775903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.741899Z","title":"Real-world humanoid locomotion with reinforcement learning","venue":null,"work_id":"36794077-88f9-44c6-8280-16e7bd1e7ee0","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.780721Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:a8cfe6ea2f6f4d9440fecfcefc30f356c4a8335e82e74a2551094d4db0950caf","observation_id":"2c3abc2c-05fe-4465-b3de-c461f20efa04","resolution":{"observed_at":"2026-08-11T12:29:47.747592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19469","last_updated":"2024-02-29T18:57:37Z","snapshot_observed_at":"2026-08-20T14:59:44.264279Z","submitted_at":"2024-02-29T18:57:37Z","title":"Humanoid Locomotion as Next Token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19469","snapshot_observed_at":"2026-08-11T12:29:46.785407Z","title":"Humanoid locomotion as next token pre- diction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.785407Z"},"links":{"cited_paper":"/paper/2402.19469","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:7b0b51971b53e5206ac9e592184d9e6650d4f475c2c988a5d30364aed0c3ecfc","observation_id":"5072d50b-85ac-4216-9185-58c8aa090ba8","resolution":{"observed_at":"2026-08-11T12:29:46.785407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09972","last_updated":"2024-05-22T05:05:38Z","snapshot_observed_at":"2026-08-16T15:32:27.531555Z","submitted_at":"2023-05-17T06:11:10Z","title":"Real-Time Flying Object Detection with YOLOv8","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09972","snapshot_observed_at":"2026-08-11T12:29:46.790270Z","title":"Real-time flying object detection with yolov8.arXiv preprint arXiv:2305.09972, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.790270Z"},"links":{"cited_paper":"/paper/2305.09972","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:a3038638935061c22cf4c2bef13108e6ec41ef9b243fbd9fb8a4420b0e838c1f","observation_id":"5d758e81-3be2-4853-881d-1c3cf994a5f3","resolution":{"observed_at":"2026-08-11T12:29:46.790270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.726334Z","title":"High-resolution image synthesis with latent diffusion models","venue":null,"work_id":"2a222b0c-6cdd-4157-bab2-b59e8571bc9c","year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.795145Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:8e4b01826093b49b1c79c4cca142ef3f44ad13c80b190c7b40ed64f561f7705b","observation_id":"e672f7f7-57b8-428c-8d85-e373661896e2","resolution":{"observed_at":"2026-08-11T12:29:47.730944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-20T07:04:06.309989Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-11T12:29:46.800392Z","title":"Proximal policy optimization algo- rithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.800392Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:8e81149fce8169dfc8c628da54015e9296c01943e86f7711ac91bbf540cc0145","observation_id":"254612ce-8c2f-4b76-beb8-e991700c0aaf","resolution":{"observed_at":"2026-08-11T12:29:46.800392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.711639Z","title":"Deep imita- tion learning for humanoid loco-manipulation through hu- man teleoperation","venue":null,"work_id":"51239ab5-3c7c-4cd1-b2f6-d0330a67a5cd","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.805497Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:56be9084dbca3ba5f1a0e6b1e2013bd30a8a1d1f0a018eb61987359962c8921e","observation_id":"502b82d9-b4f0-43a8-96ae-960214be5daa","resolution":{"observed_at":"2026-08-11T12:29:47.716151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:46.810547Z","title":"Human motion diffusion as a generative prior","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.810547Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:1f09848ee2469ecbb84b176f347bea462cfeaed4fc14646c4b23970915f7e1de","observation_id":"33deea5b-0ebc-4203-9b5d-2474c9124a42","resolution":{"observed_at":"2026-08-11T12:29:46.810547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.685525Z","title":"Sigurdsson, G ¨ul Varol, Xiaolong Wang, Ivan Laptev, Ali Farhadi, and Abhinav Gupta","venue":null,"work_id":"a948bea8-3631-41ba-a8e5-6b41e8189d42","year":2016},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.815541Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:3be1acc10a659476c60fd18b081ca1a764890cde7d21138a9cf3307c9434c1c6","observation_id":"8c3ae30a-4b76-4b83-ba13-ae8d1bb6a003","resolution":{"observed_at":"2026-08-11T12:29:47.690173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.668750Z","title":"Grab: A dataset of whole-body human grasp- ing of objects","venue":null,"work_id":"eab7c9f9-9f9a-4ad9-ad98-4ca5c656fb36","year":2020},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.820635Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:5b3f757c23fbd2beabc63373bf6a07daff809b7244114d49e328e73ef74ee493","observation_id":"7914f6a8-3442-4fa8-a1c5-39be0e96e3fb","resolution":{"observed_at":"2026-08-11T12:29:47.674122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.650628Z","title":"Humanmimic: Learning natural locomo- tion and transitions for humanoid robot via wasserstein ad- versarial imitation","venue":null,"work_id":"b7c5a3a4-debe-4441-8981-7b5ce76fadb2","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.825451Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:6b41a95b4914bc2ccace7e5e4f0e150176f1cb2a426e71e949f64fea9fa855b2","observation_id":"94c5396d-f752-4489-bb9c-a6f390277232","resolution":{"observed_at":"2026-08-11T12:29:47.656426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.633741Z","title":"Calm: Conditional adversar- ial latent models for directable virtual characters","venue":null,"work_id":"80056bdb-1a8f-4743-aba4-7c7574e4e67f","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.830885Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:48a8394f6840db1803504e46134ae775bac36e7fff279cd1cf9fd60b32d26a9e","observation_id":"ca47395a-ea0b-42e3-97ae-66ec84079f37","resolution":{"observed_at":"2026-08-11T12:29:47.639383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.617847Z","title":"Human motion diffu- sion model","venue":null,"work_id":"7278297c-8b67-40d1-8027-e8ef2f4ef9dd","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.836307Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:590bcce49910812a9333c95988a3db912ce57f900266885c05ded2334197413d","observation_id":"3e5067d9-fb3e-4365-9bde-ef2346c2fe07","resolution":{"observed_at":"2026-08-11T12:29:47.623011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.601171Z","title":null,"venue":null,"work_id":"ba9fb84c-e93b-4c2d-9f82-99022b723141","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.841442Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:5e3f0f09cc6e8ed67a23c76f64b2c3629f3df1c29b52fe008cfc9917b51b00e0","observation_id":"bd2e05f3-8ec0-4b6d-beee-a0476f0be197","resolution":{"observed_at":"2026-08-11T12:29:47.606132Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.584746Z","title":"Aist dance video database: Multi-genre, multi-dancer, and multi-camera database for dance informa- tion processing","venue":null,"work_id":"c42ddb1f-450a-4cf8-b3f5-305570fe8f76","year":2019},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.846487Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:b1c46c2e02aefdfd6f91db9fe82ece76bd9e20de69e6a2c23b3c16de01ac45be","observation_id":"0a0d4209-fb94-4419-996c-43c326de9651","resolution":{"observed_at":"2026-08-11T12:29:47.589903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.568101Z","title":"Neural discrete representation learning","venue":null,"work_id":"643d6e25-b066-45f6-a102-3bf55e5a3d09","year":2017},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.851796Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:3f45c520cb1c2ad4e3b52ca89f935b3f5d3aef20b31073b90e1951888d90c5e9","observation_id":"c2937247-faa9-4cc8-a806-b2180b0c35a5","resolution":{"observed_at":"2026-08-11T12:29:47.573317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:46.857444Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.857444Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:e6944559d6fa895003f303b13f23f5f59cfaf325e88002b5145373d59470aaf5","observation_id":"fceb11b7-b548-4501-9ce9-34e27cc0f58b","resolution":{"observed_at":"2026-08-11T12:29:46.857444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.540546Z","title":"A scalable approach to control diverse behaviors for physically simulated characters","venue":null,"work_id":"ac44862d-9d12-491d-9669-b170292c88c0","year":2020},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.862317Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:ba0b87ba0cfa9588c951928a908f4fb08e21b4f4ca52e042f8de30bcfeb0f0a4","observation_id":"d09ae25b-e332-47ce-b25e-74e1bf9ee26e","resolution":{"observed_at":"2026-08-11T12:29:47.546454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.06173","last_updated":"2022-03-11T18:58:10Z","snapshot_observed_at":"2026-08-16T17:15:14.047305Z","submitted_at":"2022-03-11T18:58:10Z","title":"Masked Visual Pre-training for Motor Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.06173","snapshot_observed_at":"2026-08-11T12:29:46.867522Z","title":"Masked visual pre-training for motor control","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.867522Z"},"links":{"cited_paper":"/paper/2203.06173","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:6564e4fbd9f4c6c393fd34dcd6172aa0df4a915d7f8e12b03d9d87cdead56642","observation_id":"8430144f-b435-446c-8bf5-dc82c031e98d","resolution":{"observed_at":"2026-08-11T12:29:46.867522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.522698Z","title":"Omnicontrol: Control any joint at any time for human motion generation","venue":null,"work_id":"846d2feb-38b3-4386-a2e8-4e9121a780a2","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.872612Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:b883292f718e298a99ff14713e6d871a098d5b4c1c5a2751526b14cce5da7f86","observation_id":"1f6e4142-c8f6-42ed-a677-7c129db4e9a2","resolution":{"observed_at":"2026-08-11T12:29:47.528594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15208","last_updated":"2024-10-04T04:05:27Z","snapshot_observed_at":"2026-08-16T13:32:21.178898Z","submitted_at":"2024-07-21T16:15:02Z","title":"Flow as the Cross-Domain Manipulation Interface","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15208","snapshot_observed_at":"2026-08-11T12:29:46.877246Z","title":"Flow as the cross-domain manipulation interface","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.877246Z"},"links":{"cited_paper":"/paper/2407.15208","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:b80d3843786931e86e01f9574043e849597a54710af0526a29cdb03aece500aa","observation_id":"d28dbbe8-b7a0-4635-9529-1842d532c4a0","resolution":{"observed_at":"2026-08-11T12:29:46.877246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.507459Z","title":"Learning interactive real-world simulators","venue":null,"work_id":"719f69c0-1e7e-4726-bae0-091a2c34fdae","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.881947Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:32d4c2e39e1fe33f1874894f3e4ba2fe48d352c7c8dcd4a59c1cca581fe19005","observation_id":"46a9c989-981e-4610-9ec0-290bf0ef9ad0","resolution":{"observed_at":"2026-08-11T12:29:47.512792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11439","last_updated":"2024-09-23T08:22:04Z","snapshot_observed_at":"2026-08-18T19:41:40.971251Z","submitted_at":"2024-01-21T09:39:11Z","title":"General Flow as Foundation Affordance for Scalable Robot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11439","snapshot_observed_at":"2026-08-11T12:29:46.886094Z","title":"General flow as foundation affordance for scalable robot learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.886094Z"},"links":{"cited_paper":"/paper/2401.11439","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:b2e606ca0853dc90e99d010eb286947cf603014b461f1f7e2346d5919b413843","observation_id":"e98182d0-7005-4f6c-990b-52c5682e3e98","resolution":{"observed_at":"2026-08-11T12:29:46.886094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.491176Z","title":"Physdiff: Physics-guided human motion diffusion model","venue":null,"work_id":"27a10628-54a1-426a-8485-2be7c8a4d428","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.891668Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:a986868c1001fa0f431e60bfc7eb10514ccd01355410680ae51eadd228a32499","observation_id":"ebfb568e-d33e-4cc0-9c8c-e98c7a8b588d","resolution":{"observed_at":"2026-08-11T12:29:47.496467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10803","last_updated":"2025-09-09T09:24:29Z","snapshot_observed_at":"2026-08-19T08:16:36.548910Z","submitted_at":"2024-10-14T17:59:00Z","title":"Generalizable Humanoid Manipulation with 3D Diffusion Policies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10803","snapshot_observed_at":"2026-08-11T12:29:46.896458Z","title":"Generalizable humanoid manipulation with improved 3d diffusion policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.896458Z"},"links":{"cited_paper":"/paper/2410.10803","citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:70543acbf947008f9a9476439ee88b6a9d9b83b76c4459eb5eb432a11150a55e","observation_id":"1330e2fd-e66e-4280-b902-9ead981309e6","resolution":{"observed_at":"2026-08-11T12:29:46.896458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.476070Z","title":"Generating human motion from textual descriptions with discrete representations","venue":null,"work_id":"93162cb4-2739-4750-b4a9-d1d1cae959bf","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.902019Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:67104050e28c240e213d2b99d1ce2fa2c0ee5c42292f948a2a25ee66c1513201","observation_id":"21434a24-904f-4380-a395-71cde8870739","resolution":{"observed_at":"2026-08-11T12:29:47.480757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.460335Z","title":"Generating human motion from textual descriptions with discrete representations","venue":null,"work_id":"a0fbbdcf-60a0-4bad-b8df-6228abf8eb31","year":2023},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.906707Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:4f2c445aa0e27306588923bd2e7826055aa8b8bc46cfbc3c96ae040b8a06f652","observation_id":"36b9c2f7-452b-4378-a5a0-5bd034a9005c","resolution":{"observed_at":"2026-08-11T12:29:47.465678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.443152Z","title":"Motiondif- fuse: Text-driven human motion generation with diffusion model","venue":null,"work_id":"377fe9eb-ce86-4370-b6c6-e751968e52b7","year":2024},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.911733Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:8a40a2a43f7243a39ae0cf2a471bf1d095686a8cee15c02eae84a083e93f7b16","observation_id":"dcfd5f5c-7898-49f9-824d-a563558e11a4","resolution":{"observed_at":"2026-08-11T12:29:47.448262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.426208Z","title":"single person","venue":null,"work_id":"4be40b0e-2cb1-497a-871e-af26ee18d682","year":2022},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.916944Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:3dd89d931d05b0f1844f2f69ec4b0e218f9eba0dd6fd49c36a7fb8160218ef14","observation_id":"e0919a9c-1a30-4b8f-ac8e-5e1529fec4c2","resolution":{"observed_at":"2026-08-11T12:29:47.431332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.410388Z","title":null,"venue":null,"work_id":"ee5fd18c-d1ce-465e-b7df-178361acd801","year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.923121Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:d57248d479d387bdd58cd6b3dd362853e46305b3c6f564517389dddc8d081db5","observation_id":"4dae4c7f-b7ae-4019-abd5-e711bcd73e31","resolution":{"observed_at":"2026-08-11T12:29:47.415315Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.393726Z","title":"a man/woman doing something [adverb]","venue":null,"work_id":"70584093-0aaf-429f-a94c-01ae6bbeb13e","year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.928184Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:3bed7b10e8d8b50f5c4ab36f6ec2a1cbf9bdbd1b06dd384b19b7423efb85a4e6","observation_id":"54ebceff-50f1-4195-8523-0f0630a45f92","resolution":{"observed_at":"2026-08-11T12:29:47.399475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.377555Z","title":null,"venue":null,"work_id":"ead5d016-65f4-4d2c-b44f-6699eeca4c70","year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.933936Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:f3885ba098c9e8e702d7f0c618b5f124ad4ba9bddbb468a70be0f42a1e6a6225","observation_id":"7ecde2e4-bc2f-4941-9a02-b1071c7f43a9","resolution":{"observed_at":"2026-08-11T12:29:47.382743Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:29:47.360128Z","title":"in the video","venue":null,"work_id":"f1508d35-0f36-406b-b18e-2eac9dbf5d28","year":null},"citing_paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-11T12:29:46.938716Z"},"links":{"citing_paper":"/paper/2412.14172"},"observation_digest":"sha256:fabea48014526d54e63ddf96e3a7baa9419141479ab9c8582905e94161f78fc8","observation_id":"70b81db5-3d5d-4a96-8263-430869f7885f","resolution":{"observed_at":"2026-08-11T12:29:47.366443Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14172","last_updated":"2024-12-18T18:59:56Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-19T20:23:13.435873Z","submitted_at":"2024-12-18T18:59:56Z","title":"Learning from Massive Human Videos for Universal Humanoid Pose Control"},"reference_resolution":{"displayed":79,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":49},"total_outbound_references":79},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 79 of 79 outbound references and 12 inbound Pith citation observations for arXiv:2412.14172."}