{"as_of":"2026-08-09T17:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0639669e5e7765a07666db51b2fbb0d43987dfc5ee6a9c889ee73d65fd1c77eb","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T04:41:08.519954Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T15:44:02.709823Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T09:56:04.285692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"cited_work":{"arxiv_id":"2502.08556","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.08556","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Human-centric founda- tion models: Perception, generation and agentic modeling","venue":null,"work_id":"6c95fcb2-96de-430a-883d-dfe04a59b295","year":2025},"citing_paper":{"arxiv_id":"2604.10127","last_updated":"2026-04-11T09:44:39Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T09:44:39Z","title":"VGA-Bench: A Unified Benchmark and Multi-Model Framework for Video Aesthetics and Generation Quality Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T15:44:02.709823Z"},"links":{"cited_paper":"/paper/2502.08556","citing_paper":"/paper/2604.10127"},"observation_digest":"sha256:80a5ee80508878414a7f2452d6a89d9313b7d9c8ae3c9db8c7a2f68cb8fe48e5","observation_id":"ecec6641-0f10-4b85-9e6b-078593bce66c","resolution":{"observed_at":"2026-05-11T09:56:04.291715Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.08556/citation-record","integrity":"/paper/2502.08556/integrity","json":"/paper/2502.08556/citation-record.json","paper":"/paper/2502.08556"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T04:41:08.377108Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.377108Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:904cc136c640439c1b43782c8b625851cf50f56cd716cb5646b1be9f732bc0b3","observation_id":"1a1830a2-d5fd-4548-b3a4-918e82ab271e","resolution":{"observed_at":"2026-08-08T04:41:08.377108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:09.414810Z","title":"A morphable model for the synthesis of 3d faces","venue":null,"work_id":"473ecda6-526a-49c3-aaa0-87fe86d73376","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.388121Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:f511b05a2dfc699f526c3fe160918a447790e0d3acd286e506684a5310e839a9","observation_id":"d0f3106d-b488-4ea5-bff3-d073a315d7ec","resolution":{"observed_at":"2026-08-08T04:41:09.418696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:09.374156Z","title":"Instructpix2pix: Learning to follow image editing instructions","venue":null,"work_id":"9285fd82-e8b6-4804-880d-371449283e36","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.391669Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:3aa16dc9ea15939899b775a8c4c57e3c44b8962373defcb27f12ecf5b39ed6cb","observation_id":"9b62267d-bf78-4841-ae6f-6e0d3b0ef9a2","resolution":{"observed_at":"2026-08-08T04:41:09.392174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:09.289153Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation","venue":null,"work_id":"5681eafb-7376-4734-967c-1e90c3e299d4","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.394613Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:0f2b2f5e3b26db592513b757b50c8dac9759afd02279c66e5f24403b3131795f","observation_id":"68db0431-19e6-4f70-b238-ff4cfbfd8ca3","resolution":{"observed_at":"2026-08-08T04:41:09.340011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:09.140108Z","title":"Sofgan: A portrait image generator with dynamic styling","venue":null,"work_id":"6a6475c0-a97c-4166-99c4-9f182d6f54b4","year":2022},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.397844Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:9404e09d815a1a119fb48eb8b0e120f32bd6de6b47c1ff1aad7f0a72f9116258","observation_id":"32cf0edd-7385-46cc-b956-126e241d7e5b","resolution":{"observed_at":"2026-08-08T04:41:09.224513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10523","last_updated":"2024-12-13T19:33:48Z","snapshot_observed_at":"2026-07-06T20:06:48.183096Z","submitted_at":"2024-12-13T19:33:48Z","title":"The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10523","snapshot_observed_at":"2026-08-08T04:41:08.400750Z","title":"The language of motion: Uni- fying verbal and non-verbal language of 3d human motion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.400750Z"},"links":{"cited_paper":"/paper/2412.10523","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:1a74be8e496ad1ef360acd2c8ae0b64abfaf5430ce2edc5b00dbe2c9f1add392","observation_id":"668e820b-f5fe-468d-ace7-1cb4f268bdb1","resolution":{"observed_at":"2026-08-08T04:41:08.400750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:09.053549Z","title":"Unihcp: A unified model for human-centric perceptions","venue":null,"work_id":"2347158e-7f77-4eb4-8557-dc50cfdf43e3","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.403764Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:862ef966750086b62470444401c3d932ff837e365afce5388b6335e0673c0181","observation_id":"25e9178b-06ff-455f-a36b-c67b6067d624","resolution":{"observed_at":"2026-08-08T04:41:09.092314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.984088Z","title":"Ag3d: Learning to generate 3d avatars from 2d image col- lections","venue":null,"work_id":"8a8876a0-1874-423d-97e4-d18141582ae8","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.406354Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:a635271b6e1fccc871bb7b2d0050d050f3b32afc3c22994c2e904b414f7b9776","observation_id":"2c08b5d9-8326-461d-9bea-bacd7bd35446","resolution":{"observed_at":"2026-08-08T04:41:09.000012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14449","last_updated":"2024-03-21T14:56:46Z","snapshot_observed_at":"2026-07-06T17:48:24.076444Z","submitted_at":"2024-03-21T14:56:46Z","title":"Bringing Robots Home: The Rise of AI Robots in Consumer Electronics","version":1},"cited_work":{"arxiv_id":"2403.14449","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14449","snapshot_observed_at":"2026-08-08T04:41:08.660003Z","title":"Bringing Robots Home: The Rise of AI Robots in Consumer Electronics","venue":"cs.RO","work_id":"4914c1fb-a04e-4269-bbd3-3ca593830439","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.409033Z"},"links":{"cited_paper":"/paper/2403.14449","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:ad35d60fa7dc77dbf81a718753ca551ac074e1a98fee857edbd1a9df64d2c0f0","observation_id":"3ce47ec6-abae-4151-a1fa-e9f7d1ae4e55","resolution":{"observed_at":"2026-08-08T04:41:08.663866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.976298Z","title":"Foundation Models for 3D Humans,","venue":null,"work_id":"02b041e4-8d9e-404f-84bf-961a68287bcb","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.412412Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:04ebf6f8303e97e1cd910307e7b6a48c79f4a71bd61f2d468c6f8bfe1b1b0b92","observation_id":"26ea5f40-56fb-4af6-b24a-a15b6429f6ff","resolution":{"observed_at":"2026-08-08T04:41:08.978794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.968409Z","title":"Chatpose: Chatting about 3d human pose","venue":null,"work_id":"882fb1c8-28a9-4b72-a85b-8a11b3dbb5d2","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.415119Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:c560b5d6904256c1dce00cbb12b36db6263c16fb0beadb252543a6e5a1530e24","observation_id":"1e2bb3b0-5d9f-4dd5-9f03-cd9497290edb","resolution":{"observed_at":"2026-08-08T04:41:08.971308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.960062Z","title":"Stylegan-human: A data-centric odyssey of human generation","venue":null,"work_id":"cbe0dc01-0f1b-4306-b31b-0a91c57287a8","year":2022},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.417883Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:5f16bd8c0a9c52f97e5e9b8322dc7d60048696bfa80992e38e5262e9999c2aaa","observation_id":"51cdde9c-17a8-4469-9fae-0796167e5570","resolution":{"observed_at":"2026-08-08T04:41:08.962826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.942889Z","title":"Instruct-reid: A multi- purpose person re-identification task with instructions","venue":null,"work_id":"d7100192-c2b7-410e-85c6-f954eb12f8df","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.423883Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:6c8748151513693629c8287e479a181a63cacdc98d09117ec7a744be42932093","observation_id":"c179ddcc-5116-405a-869b-b06b9dd8c5ea","resolution":{"observed_at":"2026-08-08T04:41:08.945694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.934752Z","title":"Versatile multi-modal pre-training for human-centric perception","venue":null,"work_id":"1ffa2edf-d8d8-4ae8-b51f-8cab16bc90d8","year":2022},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.426774Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:14877bff5515df76fa16b88745c75378954e5ef25f77d89ac3df16035f1187cd","observation_id":"f2a3aca0-9532-44e7-8bae-6c7ed63de1dc","resolution":{"observed_at":"2026-08-08T04:41:08.937719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.926075Z","title":"Animate anyone: Consistent and control- lable image-to-video synthesis for character animation","venue":null,"work_id":"1a16a498-3753-4e99-83de-99ba4e75f82c","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.429347Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:9a41db12a306d15ee4f835dc18639f250098d9d1038732c87e4ffa04e28ee829","observation_id":"3c50a14d-6a28-4a26-8cf0-931df301697a","resolution":{"observed_at":"2026-08-08T04:41:08.929237Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14643","last_updated":"2024-12-19T08:51:57Z","snapshot_observed_at":"2026-08-01T14:52:24.929336Z","submitted_at":"2024-12-19T08:51:57Z","title":"RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios","version":1},"cited_work":{"arxiv_id":"2412.14643","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14643","snapshot_observed_at":"2026-08-08T04:41:08.649124Z","title":"RefHCM: A Unified Model for Referring Perceptions in Human-Centric Scenarios","venue":"cs.CV","work_id":"93cdfbb9-71c1-4a27-be7a-8b9ce53879bf","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.431780Z"},"links":{"cited_paper":"/paper/2412.14643","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:09bc0c637d8eb34ba0474920ebcef26da8c0b1747062a1b2e6f23d6eb376cdb1","observation_id":"bcf3f852-e480-42f0-b09a-17a317120d32","resolution":{"observed_at":"2026-08-08T04:41:08.652133Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.912928Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":"0e69dfab-5ec6-4ac3-ac04-4da89ca344f4","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.435204Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:d7b8e5768c3f9d2d7f31d8a3973a1f426c76875df02ae6e8f2184d0dc34f73ff","observation_id":"e5524322-98c8-42f8-a06e-c0a84a2206f2","resolution":{"observed_at":"2026-08-08T04:41:08.920111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.904071Z","title":"You only learn one query: learning unified human query for single-stage multi-person multi-task human-centric perception","venue":null,"work_id":"08114d5b-49e2-4cfc-ba97-d75d7fa75919","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.438420Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:1481b061ed33835a66193e650e9e1a240b2b39290ec825cb7a022e93216f7ddd","observation_id":"7d44acf9-6e04-4ece-816a-1f87c0349b6c","resolution":{"observed_at":"2026-08-08T04:41:08.907445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.876857Z","title":"Humansd: A native skeleton-guided diffusion model for human image generation","venue":null,"work_id":"007c7a80-d58a-4ee1-afb7-d7b73b5c7c0d","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.441074Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:14c93108eb425ae14ed67bc42f73d9fd8b67bd2acaa91dac0ae13a4fe8356887","observation_id":"2812a0b5-a4c3-420a-af3d-797bd727cf4c","resolution":{"observed_at":"2026-08-08T04:41:08.898770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.814431Z","title":"Superpadl: Scaling language- directed physics-based control with progressive supervised distillation","venue":null,"work_id":"c8cc4cc0-14cb-4363-b5ee-5ee71bbc2dcc","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.444889Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:704b1d2ed3d65acb03a54d0f69ef178f20b489d2601a942a404363d32c502a57","observation_id":"4fb847e5-10f6-402c-b44e-b61631a0d4e5","resolution":{"observed_at":"2026-08-08T04:41:08.846654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.804514Z","title":"Fashion- vdm: Video diffusion model for virtual try-on","venue":null,"work_id":"b5ac84ae-ed13-4b66-ad96-2d5ee35abecd","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.447499Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:4f423745bd244f172a67e92ed7a8cc3e630dde14f4176808d25542796fc97806","observation_id":"598fbca9-d1cb-46d8-b0c4-d0e7165a1960","resolution":{"observed_at":"2026-08-08T04:41:08.807616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.796030Z","title":"Sapiens: Foundation for human vision models","venue":null,"work_id":"023ab9ab-8950-42fe-a975-18aa54eb34fe","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.450493Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:3f19f34defad14376733a5a77960c3b1c7efc050ed0f5a8ac663a854121032f6","observation_id":"9731220b-9840-4e9f-a763-8998a8a61f8d","resolution":{"observed_at":"2026-08-08T04:41:08.799224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09329","last_updated":"2023-06-15T17:58:21Z","snapshot_observed_at":"2026-08-05T08:34:04.524761Z","submitted_at":"2023-06-15T17:58:21Z","title":"DreamHuman: Animatable 3D Avatars from Text","version":1},"cited_work":{"arxiv_id":"2306.09329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09329","snapshot_observed_at":"2026-08-08T04:41:08.637289Z","title":"DreamHuman: Animatable 3D Avatars from Text","venue":"cs.CV","work_id":"745edb35-8abb-4c42-94f8-a003121928fb","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.453676Z"},"links":{"cited_paper":"/paper/2306.09329","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:721f7101b5759846b1b8ee39d1b7d01c533e51622627cf2b6ecd2eafc5b901d6","observation_id":"cad1d602-586b-4794-9275-770b85e7a134","resolution":{"observed_at":"2026-08-08T04:41:08.640613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.787960Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":"d3f35b3e-3177-44a5-92cf-dee8d7cb9765","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.457353Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:0da68f1d53f6dd6ff3a6300d389fb7be0df390917080558bfc3e02b52cfcc3f1","observation_id":"58e59c0b-f90e-4ba0-b0f8-8734290830df","resolution":{"observed_at":"2026-08-08T04:41:08.790976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16781","last_updated":"2025-03-29T03:35:20Z","snapshot_observed_at":"2026-07-06T19:56:48.086175Z","submitted_at":"2024-11-25T08:06:30Z","title":"UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16781","snapshot_observed_at":"2026-08-08T04:41:08.459981Z","title":"Unipose: A unified multi- modal framework for human pose comprehension, genera- tion and editing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.459981Z"},"links":{"cited_paper":"/paper/2411.16781","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:082b02543a4bd4dec4eab9519348497666ad3aa1a22983fd7c106dea97b4e9b5","observation_id":"deb65451-07b8-4f89-b9a5-20ee598e4a3e","resolution":{"observed_at":"2026-08-08T04:41:08.459981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.779907Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset","venue":null,"work_id":"4a60a688-a244-4ec1-8209-88db77ff2aa7","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.463040Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:c02b7d36719c79e77507d0a81dd3c699d2df9d230ddcf4dcfdeef40c992017fa","observation_id":"b1e3a915-0735-49ae-b470-3ee2df4cb797","resolution":{"observed_at":"2026-08-08T04:41:08.782830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04533","last_updated":"2025-05-29T11:29:37Z","snapshot_observed_at":"2026-08-09T10:18:50.919642Z","submitted_at":"2024-05-07T17:59:31Z","title":"ChatHuman: Chatting about 3D Humans with Tools","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04533","snapshot_observed_at":"2026-08-08T04:41:08.465666Z","title":"Chathuman: Language-driven 3d hu- man understanding with retrieval-augmented tool reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.465666Z"},"links":{"cited_paper":"/paper/2405.04533","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:bdfc88bdd3544e1468939411644e405d08f36b03e4c6bc5848783ad485c083e3","observation_id":"af07394e-ec87-4a02-849b-c17cbed32da1","resolution":{"observed_at":"2026-08-08T04:41:08.465666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.771486Z","title":"Omnihuman-1: Rethinking the scaling-up of one- stage conditioned human animation models,","venue":null,"work_id":"ee6c6e35-fd71-443a-9571-2ef060cddae3","year":2025},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.468306Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:ef5cee0f614a8f7461a18c832f9f15cbcdba6f6b2e03e4131e0e6cc1958775c3","observation_id":"3e8d6917-fac6-44a2-8139-c7ef4e1a200d","resolution":{"observed_at":"2026-08-08T04:41:08.774839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.763310Z","title":"Visual instruction tuning","venue":null,"work_id":"b5899446-4046-4ea4-bfd2-4107d73bb333","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.474089Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:4b826b4c7131d397b40e8fa30a6619939867fdf49e62786cda1773417ca3e452","observation_id":"76cfbeeb-ab2e-41f0-8f02-b8f94ec52a98","resolution":{"observed_at":"2026-08-08T04:41:08.766155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16273","last_updated":"2024-11-02T04:39:28Z","snapshot_observed_at":"2026-07-06T18:19:52.121906Z","submitted_at":"2024-05-25T15:21:59Z","title":"M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16273","snapshot_observed_at":"2026-08-08T04:41:08.476445Z","title":"M3-gpt: An advanced multimodal, multitask framework for motion comprehension and gener- ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.476445Z"},"links":{"cited_paper":"/paper/2405.16273","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:6a19fcf4b5e2ada0f4081f4337eccb1393cdb66ee5ba9be912710fa3545d805c","observation_id":"59dec457-e653-43bc-af4e-f45b5c87d6de","resolution":{"observed_at":"2026-08-08T04:41:08.476445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.754918Z","title":"Efficient multi-modal human-centric contrastive pre-training with a pseudo body-structured prior","venue":null,"work_id":"25fc5739-9848-48b7-9665-5f23419b5291","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.479097Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:245ac9e6737cfa9c3431b4dd26e6c2e87f0cac1e326bddaf54f27c62937bbd5d","observation_id":"077e29e9-043b-4834-8f28-965af779d315","resolution":{"observed_at":"2026-08-08T04:41:08.757947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.745880Z","title":"Drag your gan: Interactive point-based manipulation on the generative image manifold","venue":null,"work_id":"89cae0a8-3bd8-44f7-90eb-12f4959aae88","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.481712Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:3a47aa94bafb6cbc22a5df62f407ecf543ce62f4736ed67c9fbda893ba9c7fae","observation_id":"31941097-486a-428a-83e5-80d369282312","resolution":{"observed_at":"2026-08-08T04:41:08.749243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.736396Z","title":"360-degree human video generation with 4d diffusion transformer","venue":null,"work_id":"9b86822c-e619-4b66-930a-15f17fde9d7a","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.484447Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:a29038b6bdb41455877e0d6a49ea0d43ef3104bfce7fd6fc3e6707c99848f9b1","observation_id":"42f79f43-4765-41c8-bdf3-1fb6e08eb202","resolution":{"observed_at":"2026-08-08T04:41:08.740218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.727465Z","title":"Humanbench: To- wards general human-centric perception with projector as- sisted pretraining","venue":null,"work_id":"c5d3cbcb-c5ce-4b09-aeac-5c3b77d40c84","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.486921Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:26cc138598af09182eda90c0f71660f7b5025fa9bf9f81992a28be94ffe80d86","observation_id":"6ff272ab-2943-475d-a030-bbba13f42eb2","resolution":{"observed_at":"2026-08-08T04:41:08.730286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-08T04:41:08.489625Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.489625Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:305c4dcabfe3c1cd6ed19ba0d5f1cda8b0ef22dbfe9de9c77598b99f82434af3","observation_id":"f8244cab-e9bc-4662-bb34-007dedf8a584","resolution":{"observed_at":"2026-08-08T04:41:08.489625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.01697","last_updated":"2025-08-06T10:40:31Z","snapshot_observed_at":"2026-08-08T03:10:26.178779Z","submitted_at":"2023-12-04T07:36:04Z","title":"Hulk: A Universal Knowledge Translator for Human-Centric Tasks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.01697","snapshot_observed_at":"2026-08-08T04:41:08.492729Z","title":"Hulk: A universal knowledge trans- lator for human-centric tasks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.492729Z"},"links":{"cited_paper":"/paper/2312.01697","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:564b965537cf79184605b6818102ab6451077809f81de23a84336da2f91a7e7c","observation_id":"628b6da8-4e69-454c-8f60-45ae1ad5d54d","resolution":{"observed_at":"2026-08-08T04:41:08.492729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07163","last_updated":"2024-06-11T11:13:29Z","snapshot_observed_at":"2026-07-06T18:28:47.000729Z","submitted_at":"2024-06-11T11:13:29Z","title":"FaceGPT: Self-supervised Learning to Chat about 3D Human Faces","version":1},"cited_work":{"arxiv_id":"2406.07163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.07163","snapshot_observed_at":"2026-08-08T04:41:08.580119Z","title":"FaceGPT: Self-supervised Learning to Chat about 3D Human Faces","venue":"cs.CV","work_id":"f6ac5888-9825-4bcd-a460-c6248d9a71f8","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.495779Z"},"links":{"cited_paper":"/paper/2406.07163","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:25ae3f1536232c17dbf0db2881ee2bd3f36292b16716f4ac85ac493c16f5e5e0","observation_id":"d036d4b3-77bd-4635-83ad-d8adbac3ca22","resolution":{"observed_at":"2026-08-08T04:41:08.584013Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-09T10:12:49.943251Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-08T04:41:08.499116Z","title":"Motiongpt-2: A general- purpose motion-language model for motion generation and understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.499116Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:37cd7c6d6e8a8a069c27da558f379377617c83f605bd71621cf3bd1599716537","observation_id":"bcbbc957-0c2d-4229-a817-922fb49ecf40","resolution":{"observed_at":"2026-08-08T04:41:08.499116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.719053Z","title":"Aniportraitgan: animatable 3d portrait generation from 2d image collections","venue":null,"work_id":"3223c787-3d2f-4947-983e-f7e61c61a625","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.502014Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:ec94bb598772f392e9168b9cc42d8d53d067cc9fa6bcd90202734c489acc622d","observation_id":"af5f1fb6-f059-4e8c-b57e-e36e7b61a9dc","resolution":{"observed_at":"2026-08-08T04:41:08.722090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17013","last_updated":"2024-10-06T13:46:47Z","snapshot_observed_at":"2026-08-04T14:25:14.829572Z","submitted_at":"2024-05-27T09:57:51Z","title":"Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17013","snapshot_observed_at":"2026-08-08T04:41:08.504904Z","title":"Motionllm: Multimodal motion-language learning with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.504904Z"},"links":{"cited_paper":"/paper/2405.17013","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:dc281ba5e813436ecb4404ba799dcf11f830e93b395deedb5c3dee062c2e8a04","observation_id":"4c4a901d-d771-4107-8346-564711dc1b0c","resolution":{"observed_at":"2026-08-08T04:41:08.504904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.710565Z","title":"Get3dhuman: Lifting stylegan-human into a 3d generative model using pixel- aligned reconstruction priors","venue":null,"work_id":"aa60d915-2763-4200-b66d-737a0eece6d0","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.507741Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:1892320d8219a4f7615f1bca5427a520359235e1f710b2ca3a9db06f0dae619a","observation_id":"3c267c3e-08ae-4aa1-9654-4ec216898056","resolution":{"observed_at":"2026-08-08T04:41:08.713742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19972","last_updated":"2024-11-13T16:56:21Z","snapshot_observed_at":"2026-07-06T18:38:29.579641Z","submitted_at":"2024-06-28T15:00:46Z","title":"HumanVLA: Towards Vision-Language Directed Object Rearrangement by Physical Humanoid","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19972","snapshot_observed_at":"2026-08-08T04:41:08.510578Z","title":"Humanvla: Towards vision- language directed object rearrangement by physical hu- manoid","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.510578Z"},"links":{"cited_paper":"/paper/2406.19972","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:3c2aab96dd05a7c4337d49c860511c5a479671aa87ecef698cedd678ba16030b","observation_id":"27b19fc3-d202-4fd5-8e75-814db2c649fb","resolution":{"observed_at":"2026-08-08T04:41:08.510578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16759","last_updated":"2024-03-20T05:00:06Z","snapshot_observed_at":"2026-07-06T15:33:49.583359Z","submitted_at":"2023-05-26T09:21:56Z","title":"StyleHumanCLIP: Text-guided Garment Manipulation for StyleGAN-Human","version":4},"cited_work":{"arxiv_id":"2305.16759","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16759","snapshot_observed_at":"2026-08-08T04:41:08.542200Z","title":"StyleHumanCLIP: Text-guided Garment Manipulation for StyleGAN-Human","venue":"cs.CV","work_id":"a8fe6d39-417d-4f4e-a651-955bc7e74540","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.513566Z"},"links":{"cited_paper":"/paper/2305.16759","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:b9636918c65c83f6e50fafd035c49b3dec2bcc65d397b345a0d43f75a0306d4d","observation_id":"861fa56b-80ea-4dd2-8c1c-92cdf519b075","resolution":{"observed_at":"2026-08-08T04:41:08.547968Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.701693Z","title":"Hap: Structure-aware masked image modeling for human-centric perception","venue":null,"work_id":"f0cf2bb9-2bdc-4d4b-95f9-dd0c8854d757","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.517546Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:2a2f49db4719445de6a01d69038cb875609ca8c38a471bccf0c3a10c00d79fb7","observation_id":"abcf1d4f-85cf-4137-9ef2-069522cb4d2b","resolution":{"observed_at":"2026-08-08T04:41:08.705280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.691679Z","title":"Avatargpt: All-in-one framework for motion un- derstanding planning generation and beyond","venue":null,"work_id":"86d376c5-1c86-46fa-a075-6b9306fb548a","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.519954Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:f6e17b4f66a6174752b859e24190a5b18cca8caeb1d83d67db60a4067e806261","observation_id":"eb642ab2-4af6-4676-903b-ae9515111fe9","resolution":{"observed_at":"2026-08-08T04:41:08.695948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:08.950957Z","title":"Unitedhuman: Har- nessing multi-source data for high-resolution human gener- ation","venue":null,"work_id":"97bba29d-d00e-4c3b-b777-cb43df73d633","year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.420447Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:a4ab7ee4cc4c94a4849ae8fa4726a730f2ca3574b271c01613eb8352bf5e3eaf","observation_id":"d7aed88c-a3d2-4c9c-ad70-69d97b6723a5","resolution":{"observed_at":"2026-08-08T04:41:08.954775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T04:41:09.429163Z","title":"Cross- view and cross-pose completion for 3d human understand- ing","venue":null,"work_id":"92f9d462-b56d-4f3f-9363-42e2668fc48e","year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.380323Z"},"links":{"citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:88515da7758304ffbd958be73060673ce2974500633b3bbfdcd674f13ee7a85e","observation_id":"a4cf39ba-56f8-4266-b381-1350e9f52606","resolution":{"observed_at":"2026-08-08T04:41:09.432138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17811","last_updated":"2025-04-03T09:47:55Z","snapshot_observed_at":"2026-07-06T20:12:18.144353Z","submitted_at":"2024-12-23T18:59:28Z","title":"ChatGarment: Garment Estimation, Generation and Editing via Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.17811","snapshot_observed_at":"2026-08-08T04:41:08.383912Z","title":"Chatgarment: Garment estimation, generation and editing via large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.383912Z"},"links":{"cited_paper":"/paper/2412.17811","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:72e12202bda727736f4019af30cba618bfd7f8ec5ab5648362d21a8d4a8dc037","observation_id":"bb6479c3-a526-4dd0-89ac-590ea0b17a3d","resolution":{"observed_at":"2026-08-08T04:41:08.383912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08579","last_updated":"2024-03-15T02:02:21Z","snapshot_observed_at":"2026-07-06T16:32:07.186600Z","submitted_at":"2023-10-12T17:59:34Z","title":"HyperHuman: Hyper-Realistic Human Generation with Latent Structural Diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08579","snapshot_observed_at":"2026-08-08T04:41:08.471237Z","title":"Hyperhuman: Hyper- realistic human generation with latent structural diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-08T04:41:08.471237Z"},"links":{"cited_paper":"/paper/2310.08579","citing_paper":"/paper/2502.08556"},"observation_digest":"sha256:a20f61c3eda94e3837eb87afae585a0cfd793624d3f77f65bc55a99964f36916","observation_id":"83b6b5f0-890c-4ea3-9b97-504d4cd99d08","resolution":{"observed_at":"2026-08-08T04:41:08.471237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.08556","last_updated":"2025-02-12T16:38:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:51:51.313852Z","submitted_at":"2025-02-12T16:38:40Z","title":"Human-Centric Foundation Models: Perception, Generation and Agentic Modeling"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":5,"verified_fuzzy":32},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 1 inbound Pith citation observation for arXiv:2502.08556."}