{"as_of":"2026-08-15T11:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8282f939d567e55bce4710900020d41b17aa448a7f862f8b201c98d23c6a3a86","coverage":[{"denominator":215,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:06:30.858202Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T17:06:55.290791Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03191","snapshot_observed_at":"2026-08-03T17:06:55.290791Z","title":"Multimodal generative ai with autoregressive llms for human motion understanding and generation: A way for- ward.arXiv preprint arXiv:2506.03191, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-14T08:34:27.596886Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:55.290791Z"},"links":{"cited_paper":"/paper/2506.03191","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:d5dc7cc96e45843f2ca42ab024e3c6d38d053cd1c4c52d8393f75c0deedb22b0","observation_id":"64f9dfd7-8ad4-4012-8524-0c611f135736","resolution":{"observed_at":"2026-08-03T17:06:55.290791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03191/citation-record","integrity":"/paper/2506.03191/integrity","json":"/paper/2506.03191/citation-record.json","paper":"/paper/2506.03191"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14378","last_updated":"2022-06-08T12:02:30Z","snapshot_observed_at":"2026-08-13T17:44:54.729417Z","submitted_at":"2021-10-27T12:25:21Z","title":"Towards artificial general intelligence via a multimodal foundation model","version":2},"cited_work":{"arxiv_id":"2110.14378","doi":"10.48550/arxiv.2110.14378","metadata_source":"pith","pith_arxiv_id":"2110.14378","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Towards artificial general intelligence via a multimodal foundation model","venue":"cs.AI","work_id":"ddfb5d2b-6e31-45d4-83f7-ca1a85161519","year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:20.959485Z"},"links":{"cited_paper":"/paper/2110.14378","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:852c53686612a3873792da4b12823011227a13aa3d908741f455855bd62b1f67","observation_id":"aef14be2-6600-4a83-80da-6b0e3c56c4fd","resolution":{"observed_at":"2026-08-07T12:06:48.142911Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:21.026474Z","title":"Video generation models as world simulators OpenAI SORA","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.026474Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:1726cc37aace719100afc1b6bb7ae22a214248874be6eb5a940ef4a45520b1f8","observation_id":"306f563e-985f-4ce1-b4ac-4920ec1f52e8","resolution":{"observed_at":"2026-08-07T12:06:21.026474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:06:21.113478Z","title":"GPT-4 Technical Report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.113478Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:2d899240b0a47527ef1adbbb700169fb0375a8989f7a432deddcd4e214e6c54b","observation_id":"de2a762d-a2bd-4902-9501-7362be6a26db","resolution":{"observed_at":"2026-08-07T12:06:21.113478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:21.200498Z","title":"DALL·E 3 understands significantly more nuance and detail than our previous systems, allowing you to easily translate your ideas into exceptionally accurate images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.200498Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:6572efe4baa8ee174e2b1b0a30c48ed7c82e25fbc1adf73543317c90d01213e3","observation_id":"2603691d-3117-4a75-b44d-59d3f1253c84","resolution":{"observed_at":"2026-08-07T12:06:21.200498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-13T14:35:06.773752Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-07T12:06:21.305458Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.305458Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:d3370df4f1df4b46ba9baba93ffa21baa4d38ab894fa139bd1135d12a4471214","observation_id":"0f682403-f7ed-45a0-aacf-221c05469472","resolution":{"observed_at":"2026-08-07T12:06:21.305458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.04993","last_updated":"2017-12-14T00:04:02Z","snapshot_observed_at":"2026-08-14T20:47:18.891823Z","submitted_at":"2017-07-17T03:42:17Z","title":"MoCoGAN: Decomposing Motion and Content for Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.04993","snapshot_observed_at":"2026-08-07T12:06:21.417184Z","title":"MoCoGAN: Decomposing Motion and Content for Video Generation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.417184Z"},"links":{"cited_paper":"/paper/1707.04993","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:4a3add5ba9a39c703048cce81a531199746de8256ae7fcca782319e5374df67c","observation_id":"508278b5-c2f9-4b4a-a118-86f70c1b7fab","resolution":{"observed_at":"2026-08-07T12:06:21.417184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:21.513000Z","title":"Deep Generative Modelling: A Compar- ative Review of V AEs, GANs, Normalizing Flows, Energy-Based and Autoregressive Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.513000Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:3681c8c20e95a1e6dff54ecd1b2469a4120eb0592c9fae6135dbdb162a2e6471","observation_id":"9819e9fb-7239-4b16-8bae-f594b4d58b09","resolution":{"observed_at":"2026-08-07T12:06:21.513000Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:21.629044Z","title":"Graph-based Normalizing Flow for Human Motion Generation and Reconstruction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.629044Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:8611b1f7d9a610a959260d3a8b0b5ff0ddc36a8df768008ef515d0f3666d51ee","observation_id":"cf1967b8-f990-4e98-8d69-64fb25dc88ed","resolution":{"observed_at":"2026-08-07T12:06:21.629044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19435","last_updated":"2024-04-01T13:02:20Z","snapshot_observed_at":"2026-08-15T03:04:03.091819Z","submitted_at":"2024-03-28T14:04:17Z","title":"BAMM: Bidirectional Autoregressive Motion Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19435","snapshot_observed_at":"2026-08-07T12:06:21.702806Z","title":"BAMM: Bidirectional Autoregressive Motion Model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.702806Z"},"links":{"cited_paper":"/paper/2403.19435","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:9fec13f32cc0cc7503ff28abfd168bf4702961d8de2607dd696b64f40f719615","observation_id":"dc39ee27-461e-458e-8bc7-ba8f6378102b","resolution":{"observed_at":"2026-08-07T12:06:21.702806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04048","last_updated":"2023-05-19T08:14:04Z","snapshot_observed_at":"2026-08-14T21:52:33.731156Z","submitted_at":"2022-12-08T03:07:00Z","title":"Executing your Commands via Motion Diffusion in Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04048","snapshot_observed_at":"2026-08-07T12:06:21.802050Z","title":"Executing your Commands via Motion Diffusion in Latent Space,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.802050Z"},"links":{"cited_paper":"/paper/2212.04048","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:411c2eb53f62e95b5b88520fc51ea3e9c0b81fb60604f94e42eb0c521a1fb0f0","observation_id":"95d5a0a4-7dd9-451c-9ed2-579695238d8b","resolution":{"observed_at":"2026-08-07T12:06:21.802050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-08-10T05:21:27.485481Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-07T12:06:21.899958Z","title":"Denoising Diffusion Probabilistic Models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:21.899958Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:bec45a352373473efe4f7b405710840cfbe9fe63013b2f10f03d40c7a6576c7a","observation_id":"595a8053-026d-46a4-a42a-022bf124492c","resolution":{"observed_at":"2026-08-07T12:06:21.899958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:22.007501Z","title":"A survey of GPT-3 family large language models including ChatGPT and GPT-4,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.007501Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:d3264f45bcfa8fbbee89e0a1d9253cb2297796bd29c50b750ed6fa0c312e69a3","observation_id":"1fc907b7-326d-4c61-ad28-ecdbd63ca92e","resolution":{"observed_at":"2026-08-07T12:06:22.007501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01715","last_updated":"2024-01-25T23:15:45Z","snapshot_observed_at":"2026-08-14T12:06:07.666970Z","submitted_at":"2024-01-25T23:15:45Z","title":"ChatGPT vs Gemini vs LLaMA on Multilingual Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01715","snapshot_observed_at":"2026-08-07T12:06:22.111887Z","title":"ChatGPT vs Gemini vs LLaMA on Multilingual Sentiment Anal- ysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.111887Z"},"links":{"cited_paper":"/paper/2402.01715","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:13c3c812e43f6ed7773289a7280d2e667e0673049943a3e6163af3059bb8b7dd","observation_id":"06a9106d-0b4c-4ed9-9459-0261a412b3b9","resolution":{"observed_at":"2026-08-07T12:06:22.111887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:22.198739Z","title":"Text-to-Motion Retrieval: Towards Joint Un- derstanding of Human Motion Data and Natural Language,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.198739Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:6fb2034d5144cedc23e7ba1132800fa4fe848a4d98673c50204fe6a580df7905","observation_id":"63040c9a-15ae-47fa-b5be-6e7bab50ed42","resolution":{"observed_at":"2026-08-07T12:06:22.198739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.08877","last_updated":"2021-12-14T06:19:33Z","snapshot_observed_at":"2026-08-13T18:25:41.638516Z","submitted_at":"2021-08-19T18:58:02Z","title":"Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.08877","snapshot_observed_at":"2026-08-07T12:06:22.243172Z","title":"Sentence-T5: Scalable Sentence Encoders from Pre-trained Text-to-Text Models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.243172Z"},"links":{"cited_paper":"/paper/2108.08877","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:c30f0a52d3f0134e7fb432950f6d226191fdd09e798281bf006c4d9f1775f738","observation_id":"7e41c368-aec5-48f9-ab08-fd2a66c041e2","resolution":{"observed_at":"2026-08-07T12:06:22.243172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09561","last_updated":"2017-11-27T07:07:11Z","snapshot_observed_at":"2026-08-14T20:09:57.829661Z","submitted_at":"2017-11-27T07:07:11Z","title":"HP-GAN: Probabilistic 3D human motion prediction via GAN","version":1},"cited_work":{"arxiv_id":"1711.09561","doi":"10.48550/arxiv.1711.09561","metadata_source":"pith","pith_arxiv_id":"1711.09561","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"HP-GAN: Probabilistic 3D human motion prediction via GAN","venue":"cs.CV","work_id":"aea4a426-68e9-4bcc-b42e-95c75025a2c5","year":2017},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.320222Z"},"links":{"cited_paper":"/paper/1711.09561","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:538c88f6ff46b1abe8f87add048e7b4f40b9201bd68e96545655259f9ca29e10","observation_id":"74009b73-be58-46c5-97a5-2f74111628ab","resolution":{"observed_at":"2026-08-07T12:06:47.849921Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:22.390738Z","title":"RIVQ-V AE: Discrete Rotation-Invariant 3D Rep- resentation Learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.390738Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:73d0459c84a60f40adbbed4d2be82bc0f0bd071e3170e264ba4d76c1b7f09431","observation_id":"be45d9b9-ac07-4291-96e0-24f8ff887a70","resolution":{"observed_at":"2026-08-07T12:06:22.390738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:22.463394Z","title":"A Survey of Cross-Modal Visual Content Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.463394Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:8df044aac64caa9d947afb0a00ff33b281bd4932d145223a67786a7801624a62","observation_id":"badabc46-8eea-4679-962a-35fef7f4dd26","resolution":{"observed_at":"2026-08-07T12:06:22.463394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3665869","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Human Image Generation: A Comprehensive Survey,","venue":"ACM Computing Surveys","work_id":"7ce918aa-be7c-4ce9-959c-790be5ad632b","year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.532795Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:490be15a3b91c81f0ec0b49917959e68303edc72358ab3f29844f3c3cc9e6cef","observation_id":"50213692-742a-4f20-b2e3-97efbe5a9387","resolution":{"observed_at":"2026-08-07T12:06:47.636469Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1016/j.neucom.2022.02.045","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"3D human motion prediction: A survey,","venue":"Neurocomputing","work_id":"3f7a40a8-a872-4368-8a0e-b76cff612bd7","year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.634563Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:d113631df9430194ec5a4f6976c7c8086362944e6b1342f5cc881d28954a6703","observation_id":"07dc76cd-61aa-4d94-bd43-bc742c7f948f","resolution":{"observed_at":"2026-08-07T12:06:47.410419Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:22.721163Z","title":"Human Motion Generation: A Survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.721163Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:c4660b2c7a8b348f6589ad7d49b0aee26cc8ad112a4e682dc6b499960555bc6e","observation_id":"c0f37892-3c66-4e58-bcf6-28fc70459e30","resolution":{"observed_at":"2026-08-07T12:06:22.721163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2409.14993","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:47.225568Z","title":"Multi-Modal Generative AI: Multi-modal LLM, Diffusion and Beyond,","venue":null,"work_id":"deb4f521-28a8-45cd-a88d-08b6b274e348","year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.797709Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:6ce7731857db59a0e60278a133d07effde0d3bc788672be2de72481dad43851b","observation_id":"c113d618-765a-4ab6-9c0f-9ee4de1b3811","resolution":{"observed_at":"2026-08-07T12:06:47.277131Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15663","last_updated":"2023-08-28T03:02:16Z","snapshot_observed_at":"2026-08-14T21:51:50.354004Z","submitted_at":"2022-10-27T17:59:50Z","title":"Deep Generative Models on 3D Representations: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15663","snapshot_observed_at":"2026-08-07T12:06:22.915275Z","title":"Deep generative models on 3d representations: A survey","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.915275Z"},"links":{"cited_paper":"/paper/2210.15663","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:7c5b07ffd48abc1da0d8480bf56f198d448d135dd220d5a10566c6970fa6c853","observation_id":"4cd159a2-b84e-4146-b6e5-7e2e86137310","resolution":{"observed_at":"2026-08-07T12:06:22.915275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:22.991142Z","title":null,"venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:22.991142Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:71fb7f5ecbcceb165da638acbbe59c802dfe24a61592a92b0ef5a15fe70f7f43","observation_id":"e3e081d5-6d1d-4feb-b1bc-9e2a69fbea03","resolution":{"observed_at":"2026-08-07T12:06:22.991142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.052119Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.052119Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:65831a6a92c4ae04414e4d99933e17f008304510001237607521d43db7198b38","observation_id":"29607f91-5faf-427c-91a3-24416eca4b93","resolution":{"observed_at":"2026-08-07T12:06:23.052119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.140845Z","title":"B., Hilton, A., & Krüger, V","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.140845Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:67e234551e70c58640385172a81b57feda354c936014a802c356591d1b050fad","observation_id":"f4d8fa2f-4790-4c0f-9f31-255a67b8af5c","resolution":{"observed_at":"2026-08-07T12:06:23.140845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.221420Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.221420Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:3186743daab838c089c387a7c9cdfbb857e2f4839be0d07c91b1253b08f02298","observation_id":"20bccfb9-4877-4a43-b559-9ebdb18fb992","resolution":{"observed_at":"2026-08-07T12:06:23.221420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.304958Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.304958Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:7cba76a6ad2a1ea428594e38c7bcf674d9e96f27d62c69c859406455c4b39d79","observation_id":"f594e74e-224f-4981-9282-bd10e27b7abf","resolution":{"observed_at":"2026-08-07T12:06:23.304958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.371194Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.371194Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:ea89a1ad6336b1daa58c0e325c6e8122f07b7f3b0779447e9fed1ab7ecd41b42","observation_id":"a47004b4-f751-4580-b781-7c44d05fe6d7","resolution":{"observed_at":"2026-08-07T12:06:23.371194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.458474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.458474Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:aec83ce95d9e5cd4cb62ba30f4893fd08e215943b6d7866439d77941ea11b1e7","observation_id":"e0ab41ef-a1e7-45b9-b01d-c65cdff037d7","resolution":{"observed_at":"2026-08-07T12:06:23.458474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05902","last_updated":"2025-05-31T13:35:55Z","snapshot_observed_at":"2026-08-14T21:51:57.627557Z","submitted_at":"2024-11-08T17:15:12Z","title":"Autoregressive Models in Vision: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05902","snapshot_observed_at":"2026-08-07T12:06:23.551098Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.551098Z"},"links":{"cited_paper":"/paper/2411.05902","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:6b56dd28af224f5b3e25072c5af077aa71de4afb321cb1a603c4030af47aa9b7","observation_id":"b9586c45-5905-4b34-b0da-3be87381ae11","resolution":{"observed_at":"2026-08-07T12:06:23.551098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07680","last_updated":"2024-05-13T12:10:57Z","snapshot_observed_at":"2026-08-14T21:31:48.020591Z","submitted_at":"2024-05-13T12:10:57Z","title":"Establishing a Unified Evaluation Framework for Human Motion Generation: A Comparative Analysis of Metrics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07680","snapshot_observed_at":"2026-08-07T12:06:23.640596Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.640596Z"},"links":{"cited_paper":"/paper/2405.07680","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:c2b05e48748810e1cc2ed81d2c2126cd15253d0d6929f4540d6c5b752f97f97d","observation_id":"1994f956-62b6-4bee-8ec1-6c82a35b458b","resolution":{"observed_at":"2026-08-07T12:06:23.640596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v33i01.33012580","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Human Motion Prediction via Learning Local Structure Representations and Temporal Dependencies,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"6a1ab7b3-a61e-4020-bfa6-022958ab4c64","year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.704571Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:99b839594ed4a14728fd30d2be4f66ce94d21391d6872bd8697b838904a2fd30","observation_id":"d7071761-49f3-496c-bcda-d3476de2ed81","resolution":{"observed_at":"2026-08-07T12:06:47.061660Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.806665Z","title":"RNN -based Human Motion Prediction via Differ- ential Sequence Representation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.806665Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:5dcae625031969502f204b0d104172b7615290ae557158f2105fc4d65b669ef9","observation_id":"6be4e856-3e85-4a78-8a2a-e5a4b13dd457","resolution":{"observed_at":"2026-08-07T12:06:23.806665Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:23.917544Z","title":"On Human Motion Prediction Using Recurrent Neural Net- works,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:23.917544Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:515f690764b9ca3947d82a1582a00ba23b84fd9229d6528c23febd8540017a76","observation_id":"56bc4c6e-194a-4be6-ba8a-64c44fee2e5c","resolution":{"observed_at":"2026-08-07T12:06:23.917544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.00271","last_updated":"2015-09-29T01:28:23Z","snapshot_observed_at":"2026-08-14T22:37:59.774736Z","submitted_at":"2015-08-02T18:59:52Z","title":"Recurrent Network Models for Human Dynamics","version":2},"cited_work":{"arxiv_id":"1508.00271","doi":"10.48550/arxiv.1508.00271","metadata_source":"pith","pith_arxiv_id":"1508.00271","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Recurrent Network Models for Human Dynamics","venue":"cs.CV","work_id":"57fdf5c4-b848-4c96-9a20-082dda96f393","year":2015},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.008739Z"},"links":{"cited_paper":"/paper/1508.00271","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:16db84f4bd6d70886099666330aeebc0a000d1103cc9859797739eee0851c12d","observation_id":"bbcc2031-6df2-41c3-a316-263f1038b1c4","resolution":{"observed_at":"2026-08-07T12:06:46.869200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s00371-019-01692-9","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Efficient convolutional hierarchical autoencoder for human motion prediction,","venue":"The Visual Computer","work_id":"021c92d6-aa1d-46c7-99b6-23041002f64d","year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.117047Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:8b997df6ac66b6dd9416c31f8920c54298755b2797aaf678cfa412580aa7b527","observation_id":"773d1723-d372-41c7-a55b-fcc0900825d0","resolution":{"observed_at":"2026-08-07T12:06:46.646971Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10674","last_updated":"2021-07-12T07:09:23Z","snapshot_observed_at":"2026-08-13T19:55:19.360283Z","submitted_at":"2021-03-19T07:58:16Z","title":"Learning Multiscale Correlations for Human Motion Prediction","version":2},"cited_work":{"arxiv_id":"2103.10674","doi":"10.48550/arxiv.2103.10674","metadata_source":"pith","pith_arxiv_id":"2103.10674","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Learning Multiscale Correlations for Human Motion Prediction","venue":"cs.CV","work_id":"7822cddc-8c06-4e84-843b-f920869a84ed","year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.158539Z"},"links":{"cited_paper":"/paper/2103.10674","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:866950ef7f6fae7f035c631c834b7e4ec829fbe9e777186a31df1e3ae6e57ebc","observation_id":"2c66f0c2-8f4c-409b-a20a-316d36e13e91","resolution":{"observed_at":"2026-08-07T12:06:46.506915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v35i3.16321","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Aggregated Multi-GANs for Controlled 3D Human Motion Prediction,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"d536f5c5-2d59-4668-b460-69ad54eb088c","year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.293110Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:a97069aaa137d3effb18f276e978a5d79dfc92c9f46864b87ad2fb3f6125d5a6","observation_id":"67a06ab6-3135-4bd1-a4ae-91b8c6694c1c","resolution":{"observed_at":"2026-08-07T12:06:46.367621Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09336","last_updated":"2021-06-17T09:09:24Z","snapshot_observed_at":"2026-08-13T19:02:17.817125Z","submitted_at":"2021-06-17T09:09:24Z","title":"THUNDR: Transformer-based 3D HUmaN Reconstruction with Markers","version":1},"cited_work":{"arxiv_id":"2106.09336","doi":"10.48550/arxiv.2106.09336","metadata_source":"pith","pith_arxiv_id":"2106.09336","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"THUNDR: Transformer-based 3D HUmaN Reconstruction with Markers","venue":"cs.CV","work_id":"d95715ab-bfd3-4952-9ada-023e82eae005","year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.370710Z"},"links":{"cited_paper":"/paper/2106.09336","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:650787cd7ef2f56ad608667dd1dd8476c42188bfa7e9f1a1f9374b22c19c64b1","observation_id":"92f9d3aa-ffc4-49ff-b58a-b569c23a939c","resolution":{"observed_at":"2026-08-07T12:06:46.188225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11726","last_updated":"2024-07-01T05:20:37Z","snapshot_observed_at":"2026-08-13T12:20:05.914173Z","submitted_at":"2023-03-21T10:30:43Z","title":"3D Human Mesh Estimation from Virtual Markers","version":4},"cited_work":{"arxiv_id":"2303.11726","doi":"10.48550/arxiv.2303.11726","metadata_source":"pith","pith_arxiv_id":"2303.11726","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"3D Human Mesh Estimation from Virtual Markers","venue":"cs.CV","work_id":"cba2b2de-5520-463e-bca1-d5649fefeb86","year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.589433Z"},"links":{"cited_paper":"/paper/2303.11726","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:33e98d8f6c301674b1898faa21bc3437ab1e543f8bcaa5cfb1e1f344eb6a8c5b","observation_id":"600f0e1e-07e9-482c-8cbb-3b039f83120b","resolution":{"observed_at":"2026-08-07T12:06:46.018632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:24.650274Z","title":"SMPL: a skinned multi-person linear model,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.650274Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:162966d178fd1d71dc9c9989d1651e73e9ef89eff212076244f3926b5b036967","observation_id":"0c922472-bc00-4dce-b299-99ac7e051fda","resolution":{"observed_at":"2026-08-07T12:06:24.650274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05866","last_updated":"2019-04-11T17:47:37Z","snapshot_observed_at":"2026-08-14T21:51:56.566034Z","submitted_at":"2019-04-11T17:47:37Z","title":"Expressive Body Capture: 3D Hands, Face, and Body from a Single Image","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.05866","snapshot_observed_at":"2026-08-07T12:06:24.719631Z","title":"Expressive Body Capture: 3D Hands, Face, and Body from a Single Image,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.719631Z"},"links":{"cited_paper":"/paper/1904.05866","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:2a606ea2f12d1b93eee72623c36764531b7adbb401a0042b2fdb73e93c12f76a","observation_id":"d1fc15a5-8d8c-4a24-8c3c-08b59cff3333","resolution":{"observed_at":"2026-08-07T12:06:24.719631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.08535","last_updated":"2020-08-19T16:27:55Z","snapshot_observed_at":"2026-08-15T03:08:21.173475Z","submitted_at":"2020-08-19T16:27:55Z","title":"STAR: Sparse Trained Articulated Human Body Regressor","version":1},"cited_work":{"arxiv_id":"2008.08535","doi":"10.48550/arxiv.2008.08535","metadata_source":"pith","pith_arxiv_id":"2008.08535","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"STAR: Sparse Trained Articulated Human Body Regressor","venue":"cs.CV","work_id":"73392f42-6748-406c-9b73-f4dc9f898ad4","year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.784695Z"},"links":{"cited_paper":"/paper/2008.08535","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:79415f139b7522792629c9a3c81e4eb4275a982ae9fa244f7c65d9dbefe27ad1","observation_id":"91255947-6af5-4b45-994e-088c14ed64df","resolution":{"observed_at":"2026-08-07T12:06:45.814624Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.06485","last_updated":"2018-07-31T20:45:13Z","snapshot_observed_at":"2026-08-14T19:14:30.704833Z","submitted_at":"2018-05-16T18:38:37Z","title":"QuaterNet: A Quaternion-based Recurrent Model for Human Motion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.06485","snapshot_observed_at":"2026-08-07T12:06:24.976580Z","title":"QuaterNet: A Quaternion-based Recurrent Model for Human Motion,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:24.976580Z"},"links":{"cited_paper":"/paper/1805.06485","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:9cc687150a947855796e1c36713784c8feb12bcb3d1472ce242467ee532ae006","observation_id":"bae170c3-58a7-405c-80dc-5b53ecadf76a","resolution":{"observed_at":"2026-08-07T12:06:24.976580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:25.071921Z","title":"Towards Natural and Accurate Future Motion Prediction of Humans and Animals,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.071921Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:c7f7df423fd8efca37cae0552eb07304d1ccd8a20bf91a67af5f46b11bd83680","observation_id":"142cbeb9-2ba4-47d9-b11e-792ee5a85a88","resolution":{"observed_at":"2026-08-07T12:06:25.071921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:25.201890Z","title":"Motion Prediction via Joint Dependency Modeling in Phase Space,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.201890Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:2d3ec41b653ae8be38ffda9fbe710bb1c247562dc41bd48db4c7ffd0e6830138","observation_id":"ee9af585-2bd0-4aea-ba2d-7f9a39abd8b1","resolution":{"observed_at":"2026-08-07T12:06:25.201890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:25.268257Z","title":"Multiscale Spatio-Temporal Graph Neu- ral Networks for 3D Skeleton-Based Motion Prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.268257Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:aa126b2ebd395434308db9dc64e1d478f2a5c13875e527ebab88422e83770df6","observation_id":"d82ca877-6a48-4cf5-a99a-63cbc8995fb8","resolution":{"observed_at":"2026-08-07T12:06:25.268257Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:25.407435Z","title":"Vedaldi, Computer Vision - ECCV 2020: 16th European Conference, Glasgow, UK, August 23-28, 2020, Proceedings, Part XIV","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.407435Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:79879a6af04fff3eafacc7ee3388784b8ff17b21a190cc7b0af49263500bc124","observation_id":"63bfb4f6-dcc4-44d5-8245-0616ce5b9b07","resolution":{"observed_at":"2026-08-07T12:06:25.407435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:25.605984Z","title":"Dynamic Multiscale Graph Neural Net- works for 3D Skeleton Based Human Motion Prediction,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.605984Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:c6889bd430aa9840964a2cceef6e89db3e83242c128f294bc13d735e28f56958","observation_id":"728b9a2b-0e04-421e-88f1-fd21be47ec5b","resolution":{"observed_at":"2026-08-07T12:06:25.605984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:25.741161Z","title":"Learning Trajectory Dependencies for Human Motion Prediction,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.741161Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:d7841ee78c1a7156b27f8f1ec9bd2d8ef64886fc7c7ecf8e5e3dcdb3a571d5a9","observation_id":"8d5e1525-e4af-4e97-a47d-5b0b05115410","resolution":{"observed_at":"2026-08-07T12:06:25.741161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:25.866172Z","title":"TrajectoryCNN: A New Spatio-Temporal Feature Learning Network for Human Motion Prediction,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.866172Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:aef329c871c56924454f310dd57f49fc29f13e5f4ac9f1b5a4179f3ef230a658","observation_id":"3586a050-0011-4ee9-a22c-89aca53976d4","resolution":{"observed_at":"2026-08-07T12:06:25.866172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2016.573","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Structural-RNN: Deep Learning on Spatio-Temporal Graphs,","venue":null,"work_id":"7acafd82-7d68-4188-8cf1-a7cc791d413b","year":2016},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:25.955249Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:2f6e724bb1d2cfd15a0fbd408eeb928156ff6dea19e85e0714aa3ace31a0ed45","observation_id":"7f23e423-8057-4d4f-8181-3c7ac6d8d975","resolution":{"observed_at":"2026-08-07T12:06:45.650071Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:26.061435Z","title":"Towards Accurate 3D Human Motion Prediction from Incomplete Observations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:26.061435Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:a0c3f4afa50cdc55eb49f7fc18c66570d97ceb19d9999c49cfe911b886459ec3","observation_id":"87b14e4b-eb27-486f-9223-260020e8d0a5","resolution":{"observed_at":"2026-08-07T12:06:26.061435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:26.194950Z","title":"Ferrari, Computer Vision - ECCV 2018: 15th European Conference, Munich, Germany, September 8-14, 2018, Proceedings, Part IV","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:26.194950Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:7e24e98734133005e497455e22cd6025b6e76cfb2ed2cf8ecb6fb566dff9fab1","observation_id":"8c3fe62d-0bc6-48d6-a736-0a0c436bbc93","resolution":{"observed_at":"2026-08-07T12:06:26.194950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:26.326501Z","title":"word2vec, node2vec, graph2vec, X2vec: Towards a Theory of Vector Embeddings of Struc- tured Data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:26.326501Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:8b3ab35f5d5cf3bfc12e869675ae237b778aa3f1916343197ef87630af7b74e7","observation_id":"958d27c2-e134-4548-a124-e415d1b73f23","resolution":{"observed_at":"2026-08-07T12:06:26.326501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:26.425085Z","title":"Glove: Global Vectors for Word Representation,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:26.425085Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:9bf72491cf1f7c4665028dc23d2e443f0855f094fd37b57f0b6b62034ad82c82","observation_id":"7605699e-f50c-48e9-963f-6c1bbe7ba55c","resolution":{"observed_at":"2026-08-07T12:06:26.425085Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.11943","last_updated":"2021-03-22T15:34:39Z","snapshot_observed_at":"2026-08-10T10:17:45.578054Z","submitted_at":"2021-03-22T15:34:39Z","title":"BERT: A Review of Applications in Natural Language Processing and Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.11943","snapshot_observed_at":"2026-08-07T12:06:26.581033Z","title":"BERT: A Review of Applications in Natural Language Processing and Understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:26.581033Z"},"links":{"cited_paper":"/paper/2103.11943","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:a9c4c55c67f76868e7bd9ecc4ab3b9e375dcc0e7644a76ec2385705944a874ee","observation_id":"7b866843-6d62-4103-93c0-1538de30373b","resolution":{"observed_at":"2026-08-07T12:06:26.581033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v38i7.28567","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"MotionGPT: Finetuned LLMs Are General-Purpose Motion Generators,","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"3e874de8-1d6a-4515-8dfe-b5ddb42d67f0","year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:26.922146Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:bf5e1627e18513462ef82c97197eacbffe2d00d19860f78308e5be1789677dd9","observation_id":"3f1e0456-e292-4540-bbb8-ef559443b772","resolution":{"observed_at":"2026-08-07T12:06:45.497625Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:27.004400Z","title":"Human3.6M: Large Scale Datasets and Pre- dictive Methods for 3D Human Sensing in Natural Environments,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.004400Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:328921d66ced2e16e6f0573c226ed5db9678825426fef7d4028c540d8133d9eb","observation_id":"ee452053-d3f6-4a7a-a089-75ec260d286a","resolution":{"observed_at":"2026-08-07T12:06:27.004400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:27.081942Z","title":"MoSh: motion and shape capture from sparse markers,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.081942Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:09d4bf69a7e391c61822f90de581e075d6c3c2c64af80511c554d824fc121f79","observation_id":"488e99bc-d330-4522-a983-f4db3d224f50","resolution":{"observed_at":"2026-08-07T12:06:27.081942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05754","last_updated":"2019-05-14T17:59:20Z","snapshot_observed_at":"2026-08-14T16:32:22.390742Z","submitted_at":"2019-05-14T17:59:20Z","title":"Learnable Triangulation of Human Pose","version":1},"cited_work":{"arxiv_id":"1905.05754","doi":"10.48550/arxiv.1905.05754","metadata_source":"pith","pith_arxiv_id":"1905.05754","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Learnable Triangulation of Human Pose","venue":"cs.CV","work_id":"ae0e776f-1f2a-4f0c-96b9-61f788b87ab4","year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.189700Z"},"links":{"cited_paper":"/paper/1905.05754","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:46be6322e74bf8fe50dc679edec98a5c0601d8e3d9621a71d852bd4d2040bf4a","observation_id":"445f7a2a-a619-45b7-bc15-478df0af7306","resolution":{"observed_at":"2026-08-07T12:06:45.348477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.06239","last_updated":"2020-08-24T11:01:32Z","snapshot_observed_at":"2026-07-06T09:12:04.401235Z","submitted_at":"2020-04-13T23:50:01Z","title":"VoxelPose: Towards Multi-Camera 3D Human Pose Estimation in Wild Environment","version":4},"cited_work":{"arxiv_id":"2004.06239","doi":"10.48550/arxiv.2004.06239","metadata_source":"pith","pith_arxiv_id":"2004.06239","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"VoxelPose: Towards Multi-Camera 3D Human Pose Estimation in Wild Environment","venue":"cs.CV","work_id":"a16adbf7-4e8b-46e1-8cd9-e146a44b701a","year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.266415Z"},"links":{"cited_paper":"/paper/2004.06239","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:4ac99115e7d9ba0c5e3dbdd044f577bdbfaf3f267d41458fecd9f19710837e3b","observation_id":"0d70f13c-4667-4e52-aeb1-aeefe7d47be4","resolution":{"observed_at":"2026-08-07T12:06:45.261157Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10955","last_updated":"2022-07-22T09:10:01Z","snapshot_observed_at":"2026-08-13T14:58:59.241882Z","submitted_at":"2022-07-22T09:10:01Z","title":"Faster VoxelPose: Real-time 3D Human Pose Estimation by Orthographic Projection","version":1},"cited_work":{"arxiv_id":"2207.10955","doi":"10.48550/arxiv.2207.10955","metadata_source":"pith","pith_arxiv_id":"2207.10955","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Faster VoxelPose: Real-time 3D Human Pose Estimation by Orthographic Projection","venue":"cs.CV","work_id":"475f5866-3e31-4e8e-9bc8-f923c0c5175c","year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.364094Z"},"links":{"cited_paper":"/paper/2207.10955","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:a01bb6f48ccf49fa9268f517037216ac6ee6cd0c7f2e67fc3fd5c9419ad755f7","observation_id":"499474bf-2ec4-4e6c-9108-359432b69bc6","resolution":{"observed_at":"2026-08-07T12:06:45.045955Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.08050","last_updated":"2017-04-14T00:19:18Z","snapshot_observed_at":"2026-08-14T21:28:52.688227Z","submitted_at":"2016-11-24T01:58:16Z","title":"Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.08050","snapshot_observed_at":"2026-08-07T12:06:27.478160Z","title":"Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.478160Z"},"links":{"cited_paper":"/paper/1611.08050","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:9963a8b24c073ff545abb66be7b814701abeb7089f626456bb0720eab2a0f845","observation_id":"25b95c6b-ba99-4675-bf73-1c44c5830da0","resolution":{"observed_at":"2026-08-07T12:06:27.478160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.11742","last_updated":"2019-03-29T13:36:46Z","snapshot_observed_at":"2026-08-14T17:51:50.682168Z","submitted_at":"2018-11-28T18:56:36Z","title":"3D human pose estimation in video with temporal convolutions and semi-supervised training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.11742","snapshot_observed_at":"2026-08-07T12:06:27.547419Z","title":"3D human pose estimation in video with tem- poral convolutions and semi-supervised training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.547419Z"},"links":{"cited_paper":"/paper/1811.11742","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:abb10108effe339a7209a22bfb8da8dea57d6bff872ab30302d2850144a94c9b","observation_id":"8feb8379-d6de-4dee-ab55-c1557ba06cfd","resolution":{"observed_at":"2026-08-07T12:06:27.547419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14828","last_updated":"2023-12-22T17:02:45Z","snapshot_observed_at":"2026-08-15T04:27:49.896093Z","submitted_at":"2023-12-22T17:02:45Z","title":"Plan, Posture and Go: Towards Open-World Text-to-Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14828","snapshot_observed_at":"2026-08-07T12:06:27.627762Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.627762Z"},"links":{"cited_paper":"/paper/2312.14828","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:01030b942d5c5c8ab684b681e81664210a699402e70582d0d83fee62b5f3da0f","observation_id":"cd58c398-135e-40b1-b40b-fa6eeef2a84f","resolution":{"observed_at":"2026-08-07T12:06:27.627762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:27.694203Z","title":"Recovering 3D Human Mesh From Monocular Images: A Survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.694203Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:5299c24a38d5d0ef7ec3920b21e5f1081cbe8c7e490ab772c5172b5b1cd21df0","observation_id":"45cfe79d-9c51-4dc7-825b-7b333f6dae65","resolution":{"observed_at":"2026-08-07T12:06:27.694203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-07T12:06:27.824016Z","title":"H., Tan, H., Bansal, M., Rohrbach, A., Chang, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.824016Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:e97de5788fec373505d94fe9255336138adace39ef7ac90b5a360719fa190862","observation_id":"30a20d7a-f05e-4890-8a86-9b15808cf933","resolution":{"observed_at":"2026-08-07T12:06:27.824016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-14T13:54:28.489740Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-07T12:06:27.907738Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.907738Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:592f7be8bfae2383398067355de626970c8b71a5dc3b3b702bdd9e1ff7e7349f","observation_id":"8ce634ec-3c2a-48dc-938a-0d2ab47f9bc8","resolution":{"observed_at":"2026-08-07T12:06:27.907738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:27.997678Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.997678Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:7911f995e6886390810f926ed1d45b00d6991d4c7d16fef822724cfaf86983ed","observation_id":"040ec999-c7df-4fb4-83ec-b962cd859aea","resolution":{"observed_at":"2026-08-07T12:06:27.997678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16468","last_updated":"2023-11-28T04:10:07Z","snapshot_observed_at":"2026-08-13T05:15:46.448313Z","submitted_at":"2023-11-28T04:10:07Z","title":"AvatarGPT: All-in-One Framework for Motion Understanding, Planning, Generation and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16468","snapshot_observed_at":"2026-08-07T12:06:28.094059Z","title":"AvatarGPT: All-in-One Framework for Motion Understanding, Plan- ning, Generation and Beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.094059Z"},"links":{"cited_paper":"/paper/2311.16468","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:ba123233c55cf8a4885df6b3d7421981b99192c1d76beeb634e8c0209d843fc8","observation_id":"502250e9-bde4-468f-88cb-5466b62721b0","resolution":{"observed_at":"2026-08-07T12:06:28.094059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14795","last_updated":"2023-07-20T03:39:19Z","snapshot_observed_at":"2026-08-14T21:52:01.760111Z","submitted_at":"2023-06-26T15:53:02Z","title":"MotionGPT: Human Motion as a Foreign Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14795","snapshot_observed_at":"2026-08-07T12:06:28.152584Z","title":"MotionGPT: Human Motion as a Foreign Lan- guage,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.152584Z"},"links":{"cited_paper":"/paper/2306.14795","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:ceef94b7b08788012903905d48c42b90ec985a56c36a96364998dfd5144e96a7","observation_id":"6e3bef74-a2eb-4fe8-a693-fe1248f45551","resolution":{"observed_at":"2026-08-07T12:06:28.152584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:28.265008Z","title":"MotionGPT: Human Motion Synthesis with Improved Diversity and Realism via GPT-3 Prompting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.265008Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:de1e12b9994d2a372d44999c8fba2420884693e9829ba3a923a8b1f53f1e4d78","observation_id":"50c1635f-2585-4b9c-8e07-2a8487878aa6","resolution":{"observed_at":"2026-08-07T12:06:28.265008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:28.383888Z","title":"MotionScript: Natural Language Descriptions for Ex- pressive 3D Human Motions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.383888Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:6dbaf659a89763bd6cfd00c1413b400033ea39a03aff8e6b612a83ff7e82530c","observation_id":"3558bc2c-3da9-4a07-88bb-556a15cba86b","resolution":{"observed_at":"2026-08-07T12:06:28.383888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.06052","last_updated":"2023-09-24T17:00:32Z","snapshot_observed_at":"2026-08-14T21:52:30.271797Z","submitted_at":"2023-01-15T09:34:42Z","title":"T2M-GPT: Generating Human Motion from Textual Descriptions with Discrete Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.06052","snapshot_observed_at":"2026-08-07T12:06:28.489373Z","title":"T2M-GPT: Generating Human Motion from Textual Descriptions with Dis- crete Representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.489373Z"},"links":{"cited_paper":"/paper/2301.06052","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:5c3a85a7294e8cb764c07484fd16553f45d7da095a2feb8d9f1661715a5f3fe9","observation_id":"2f6a3af9-82b8-498e-a5f3-f83eb2d47eb4","resolution":{"observed_at":"2026-08-07T12:06:28.489373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01700","last_updated":"2024-04-03T06:40:46Z","snapshot_observed_at":"2026-08-14T09:16:19.240721Z","submitted_at":"2024-04-02T07:09:29Z","title":"MotionChain: Conversational Motion Controllers via Multimodal Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01700","snapshot_observed_at":"2026-08-07T12:06:28.567393Z","title":"MotionChain: Conversational Motion Controllers via Multimodal Prompts,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.567393Z"},"links":{"cited_paper":"/paper/2404.01700","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:0071a4dce66dcc87b8912a3219bc0056bd1755cc2f5e1fe130a9cb73bd8f2781","observation_id":"035b9ed1-0a80-4c28-8ce0-53791a4d412f","resolution":{"observed_at":"2026-08-07T12:06:28.567393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00352","last_updated":"2024-08-01T07:44:11Z","snapshot_observed_at":"2026-08-12T23:10:27.445462Z","submitted_at":"2024-08-01T07:44:11Z","title":"Autonomous LLM-Enhanced Adversarial Attack for Text-to-Motion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00352","snapshot_observed_at":"2026-08-07T12:06:28.675110Z","title":"Autonomous LLM-Enhanced Adversarial Attack for Text-to-Motion,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.675110Z"},"links":{"cited_paper":"/paper/2408.00352","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:6ba92b2fcc15a40af1b56d99a82a20ffd0183d1c9cf6a419542eb673f91cddeb","observation_id":"2ea36143-97b6-4700-accb-66580434c5bd","resolution":{"observed_at":"2026-08-07T12:06:28.675110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:28.796649Z","title":"Walk-the-Talk: LLM driven pedestrian motion generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.796649Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:3d60ce7afa24e15980abb8a0a5de48d399976be7f934a29c7f35008d0da60971","observation_id":"add17343-1f9b-4cd8-9cbc-e5044adb7097","resolution":{"observed_at":"2026-08-07T12:06:28.796649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13518","last_updated":"2024-03-26T11:16:47Z","snapshot_observed_at":"2026-08-14T21:51:59.460903Z","submitted_at":"2024-03-20T11:38:30Z","title":"Motion Generation from Fine-grained Textual Descriptions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13518","snapshot_observed_at":"2026-08-07T12:06:28.892843Z","title":"Motion Generation from Fine-grained Textual Descriptions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:28.892843Z"},"links":{"cited_paper":"/paper/2403.13518","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:88d5352e6a7c85b60a84ef787764bac06630dbe261dffecb197a12c4e5c4623b","observation_id":"acfd999a-72ba-4b6a-a228-bedb46c6a46d","resolution":{"observed_at":"2026-08-07T12:06:28.892843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14745","last_updated":"2025-06-28T11:36:30Z","snapshot_observed_at":"2026-08-13T00:24:07.817008Z","submitted_at":"2024-04-23T04:54:32Z","title":"You Think, You ACT: The New Task of Arbitrary Text to Motion Generation","version":6},"cited_work":{"arxiv_id":"2404.14745","doi":"10.48550/arxiv.2404.14745","metadata_source":"pith","pith_arxiv_id":"2404.14745","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"You Think, You ACT: The New Task of Arbitrary Text to Motion Generation","venue":"cs.CV","work_id":"378d15b9-d190-4bbf-bf8b-92ad7a0fef10","year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.003812Z"},"links":{"cited_paper":"/paper/2404.14745","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:416a329306527b54f7392553516c7a205b37c569c82963cc1bab68cc92a06e37","observation_id":"e8e9b62a-cdc8-47ae-bd76-d2dbc6d6cd92","resolution":{"observed_at":"2026-08-07T12:06:44.852595Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:29.123955Z","title":"(2024, September)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.123955Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:9f07d7ac6e4be7ca6be48019f7c9b5023e3fc7c75d1a36ae2289448f4981737f","observation_id":"547b63ae-cc68-4953-9bd8-9236d2fa494a","resolution":{"observed_at":"2026-08-07T12:06:29.123955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:29.250145Z","title":"Generation of Walking Motions Based on Whole-Body Poses and QP Control,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.250145Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:c25acdc79bc5e75be00f11308bd8f248eb686c62a5eb8ae0a26e502e8923b2c4","observation_id":"a31c0f4f-a545-4696-a162-acccf311d244","resolution":{"observed_at":"2026-08-07T12:06:29.250145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04582","last_updated":"2024-04-12T03:33:31Z","snapshot_observed_at":"2026-08-14T21:52:30.151374Z","submitted_at":"2023-10-06T20:48:43Z","title":"Universal Humanoid Motion Representations for Physics-Based Control","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04582","snapshot_observed_at":"2026-08-07T12:06:29.320581Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.320581Z"},"links":{"cited_paper":"/paper/2310.04582","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:f425c3b29da8f4fc5a060001b65c332d14961c9b3e61841d7f6928cd6df0b02b","observation_id":"65aa7bbf-9220-4e96-9849-e9b5c987dc6c","resolution":{"observed_at":"2026-08-07T12:06:29.320581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:29.425167Z","title":"FineMoGen: Fine-Grained Spatio-Temporal Motion Generation and Editing,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.425167Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:dc1f3aa05909e0026c99ae28eedccf2b0057d5c91461c554e84b89f6fae32e52","observation_id":"12de1640-8760-4e47-b774-ce6c55b0bbdd","resolution":{"observed_at":"2026-08-07T12:06:29.425167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3390/s20092653","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"A., Dashtipour, K., Zahid, A., Abbasi, Q","venue":"Sensors","work_id":"27f3cfb2-d69e-4151-b465-b49851355f40","year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.517159Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:78de42121df520e9cb54e15a372fc0f0a0de40045f7a017aa91da7fb6b7621fe","observation_id":"1e8cb9f0-b4cc-455f-9885-286d358f61f4","resolution":{"observed_at":"2026-08-07T12:06:44.715554Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:29.607449Z","title":"Generative adversarial networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.607449Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:b85abdf80c28521c92b02b24cf764c9bf9fe732be068a48dbe05b2b82938ccc5","observation_id":"8abf7560-10be-43ea-9c4d-22e6592f5dd9","resolution":{"observed_at":"2026-08-07T12:06:29.607449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.07706","last_updated":"2022-11-23T05:27:11Z","snapshot_observed_at":"2026-08-11T15:52:14.717512Z","submitted_at":"2022-03-15T07:50:12Z","title":"ActFormer: A GAN-based Transformer towards General Action-Conditioned 3D Human Motion Generation","version":2},"cited_work":{"arxiv_id":"2203.07706","doi":"10.48550/arxiv.2203.07706","metadata_source":"pith","pith_arxiv_id":"2203.07706","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"ActFormer: A GAN-based Transformer towards General Action-Conditioned 3D Human Motion Generation","venue":"cs.CV","work_id":"936c3aa3-bdda-4bea-b6a0-9e6eb011296c","year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.680364Z"},"links":{"cited_paper":"/paper/2203.07706","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:67b5059d061378f8b90d75f9ba92a355ebb7ab924fbbb2c29267e3d7e26372e4","observation_id":"0f42e6a0-6e47-4248-b15e-aa28d27a65d6","resolution":{"observed_at":"2026-08-07T12:06:44.619111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.08264","last_updated":"2018-04-23T07:07:20Z","snapshot_observed_at":"2026-08-14T19:23:12.716428Z","submitted_at":"2018-04-23T07:07:20Z","title":"To Create What You Tell: Generating Videos from Captions","version":1},"cited_work":{"arxiv_id":"1804.08264","doi":"10.48550/arxiv.1804.08264","metadata_source":"pith","pith_arxiv_id":"1804.08264","snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"To Create What You Tell: Generating Videos from Captions","venue":"cs.CV","work_id":"5d69da83-e8ff-4d2d-9b1e-649d38e4a7bb","year":2018},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.764472Z"},"links":{"cited_paper":"/paper/1804.08264","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:80a8542b850c4e954d313a4c021fb665920a46792d83e943fd17ef2767c02cff","observation_id":"1623039b-a542-4786-95b6-9e93ed77790a","resolution":{"observed_at":"2026-08-07T12:06:44.439365Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2019/307","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"IRC-GAN: Introspective Recurrent Convolutional GAN for Text-to-video Generation,","venue":null,"work_id":"21647b7c-ac90-41cf-971e-64de3f0198a1","year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.872229Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:9848826bff2e6d5246ffef5ac76edbee8334702f52124093384bc120fc135a21","observation_id":"19c5543a-3a15-41b6-a155-ea208e796a4a","resolution":{"observed_at":"2026-08-07T12:06:44.299463Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06434","last_updated":"2016-01-07T23:09:39Z","snapshot_observed_at":"2026-08-12T18:43:14.431633Z","submitted_at":"2015-11-19T22:50:32Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06434","snapshot_observed_at":"2026-08-07T12:06:29.975643Z","title":"Unsupervised Representation Learning with Deep Convolu- tional Generative Adversarial Networks,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:29.975643Z"},"links":{"cited_paper":"/paper/1511.06434","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:965af9663aa6a4a3be521de81539791faab254d1daf12dbd0f4483f9d1fac4ce","observation_id":"f6bf029a-3e09-4889-a790-94b16f87278c","resolution":{"observed_at":"2026-08-07T12:06:29.975643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.10196","last_updated":"2018-02-26T15:33:34Z","snapshot_observed_at":"2026-08-15T04:29:56.166616Z","submitted_at":"2017-10-27T15:28:35Z","title":"Progressive Growing of GANs for Improved Quality, Stability, and Variation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.10196","snapshot_observed_at":"2026-08-07T12:06:30.065913Z","title":"Progressive Growing of GANs for Improved Quality, Stability, and Variation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.065913Z"},"links":{"cited_paper":"/paper/1710.10196","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:3bc8234551d04e458d45fbdf6d0a6ccfd6e688ce931b651731301f8eab2205a1","observation_id":"b7d8cb2f-9664-4298-825e-16dd0ee75eb7","resolution":{"observed_at":"2026-08-07T12:06:30.065913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03525","last_updated":"2025-09-02T07:47:30Z","snapshot_observed_at":"2026-08-14T05:10:22.042618Z","submitted_at":"2023-10-05T13:19:48Z","title":"Vehicle-to-Everything Cooperative Perception for Autonomous Driving","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03525","snapshot_observed_at":"2026-08-07T12:06:30.153165Z","title":"C., Azghadi, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.153165Z"},"links":{"cited_paper":"/paper/2310.03525","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:1756f27e4ea25a56b111fc9d15c769f1ee43051845416077a0be54fff1468cb5","observation_id":"d5859b0d-a854-422b-874f-5ca1e8a595a8","resolution":{"observed_at":"2026-08-07T12:06:30.153165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:30.250657Z","title":"A Style-Based Generator Architecture for Generative Adversarial Networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.250657Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:1bce804417ccd403378227c41e91aff195994bbfbaefaa5b09ccd41c22b16340","observation_id":"2c4610ea-8f03-49e2-8914-59561190b9c1","resolution":{"observed_at":"2026-08-07T12:06:30.250657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.04958","last_updated":"2020-03-23T17:21:07Z","snapshot_observed_at":"2026-08-11T01:44:55.174462Z","submitted_at":"2019-12-03T11:44:01Z","title":"Analyzing and Improving the Image Quality of StyleGAN","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.04958","snapshot_observed_at":"2026-08-07T12:06:30.344455Z","title":"Analyzing and Improving the Image Quality of StyleGAN,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.344455Z"},"links":{"cited_paper":"/paper/1912.04958","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:27a9fcde342f75992253bf358717b79c7bad77c32af5be03ce7ee535328e91cf","observation_id":"cb24eafc-e863-4f99-8bb8-6fe256fc3470","resolution":{"observed_at":"2026-08-07T12:06:30.344455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:06:30.470834Z","title":"Anatomically-Informed Vector Quantization Variational Auto-Encoder for Text to Motion Generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.470834Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:aeb0bf54b90e45a1d77ea75fe1793321f4c3e2867a95acec999d038d937daeba","observation_id":"7aaf507c-fefd-4ab2-a693-b284580cd764","resolution":{"observed_at":"2026-08-07T12:06:30.470834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1117/12.3029447","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Human motion generation with StyleGAN,","venue":null,"work_id":"71416ac4-3ee7-4ccd-b60a-556cb363c03e","year":2024},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.576497Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:4f82c3e8588f4028c976f1ac33dd5aeb1ef4b6efa184d3822236d0c48e15b126","observation_id":"5688a39e-7312-48d5-90c6-5d7c2f3871c8","resolution":{"observed_at":"2026-08-07T12:06:44.036202Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05298","last_updated":"2017-10-24T06:32:52Z","snapshot_observed_at":"2026-08-14T20:23:45.212323Z","submitted_at":"2017-10-15T07:51:01Z","title":"Text2Action: Generative Adversarial Synthesis from Language to Action","version":2},"cited_work":{"arxiv_id":"1710.05298","doi":"10.48550/arxiv.1710.05298","metadata_source":"pith","pith_arxiv_id":"1710.05298","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Text2Action: Generative Adversarial Synthesis from Language to Action","venue":"cs.LG","work_id":"92d75b03-a44b-467c-a21e-f7c698f89b1d","year":2017},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":102,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.717999Z"},"links":{"cited_paper":"/paper/1710.05298","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:82fffb714e313891abf09aa1c024adf8d0a0774fbc19df7d3a17436d3de287fb","observation_id":"9a527ddb-3112-44d7-b1d2-154ab9c71596","resolution":{"observed_at":"2026-08-07T12:06:43.867483Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.14675","last_updated":"2023-01-23T11:17:09Z","snapshot_observed_at":"2026-08-14T22:39:18.257401Z","submitted_at":"2021-03-26T18:23:29Z","title":"Synthesis of Compositional Animations from Textual Descriptions","version":6},"cited_work":{"arxiv_id":"2103.14675","doi":"10.48550/arxiv.2103.14675","metadata_source":"pith","pith_arxiv_id":"2103.14675","snapshot_observed_at":"2026-08-07T18:16:16.850658Z","title":"Synthesis of Compositional Animations from Textual Descriptions","venue":"cs.CV","work_id":"86ad53b1-03d9-4a98-8718-f0b63c848464","year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.799022Z"},"links":{"cited_paper":"/paper/2103.14675","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:3f5c97d158ab62a092f8035fb4238b7299855dc6211e11835b8b1c08b9df0b6a","observation_id":"6679e2f6-7030-4251-8bf5-4fcd2c3eebc3","resolution":{"observed_at":"2026-08-07T12:06:43.729758Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1117/12.2668277","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"TransCGan-based human motion generator,","venue":null,"work_id":"e08ac7fb-9f14-4e4e-a5a4-6f2b0f5e682c","year":2022},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":104,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:30.858202Z"},"links":{"citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:7af8ade5450682935fbff31358cb0f6039abc7733a9ecf02175f340435c3d36c","observation_id":"69650bb8-d6ba-4bae-bcf4-0e68f41f404e","resolution":{"observed_at":"2026-08-07T12:06:43.551186Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T22:38:35.387883Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":4,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":69,"verified_exact":27,"verified_fuzzy":0},"total_outbound_references":215},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 215 outbound references and 1 inbound Pith citation observation for arXiv:2506.03191."}