{"as_of":"2026-08-10T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5a06ed18487cfc84bb4dedfddcd023a90639a2820fa086058a047f8a908f264c","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T20:17:37.389126Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T09:59:02.669525Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T10:01:23.551556Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2603.22282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.22282","snapshot_observed_at":"2026-06-30T02:16:16.535924Z","title":"UniMotion: A unified framework for motion-text-vision understanding and generation","venue":null,"work_id":"2808abbd-7441-4790-b3a9-f40fc80d4a48","year":2026},"citing_paper":{"arxiv_id":"2605.19578","last_updated":"2026-05-21T10:01:47Z","snapshot_observed_at":"2026-07-06T23:30:16.094579Z","submitted_at":"2026-05-19T09:21:57Z","title":"Lens Privacy Sealing: A New Benchmark and Method for Physical Privacy-Preserving Action Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-20T05:48:27.584643Z"},"links":{"cited_paper":"/paper/2603.22282","citing_paper":"/paper/2605.19578"},"observation_digest":"sha256:0fc9e49a02c977d7373f5c56719cb5ffbd442d8e0d3dc3976bd3d4d647d7c773","observation_id":"8dfbacd9-d64f-4e89-8bc3-0a455f53b855","resolution":{"observed_at":"2026-06-30T02:16:16.535924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2603.22282","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.22282","snapshot_observed_at":"2026-06-30T02:16:16.535924Z","title":"UniMotion: A unified framework for motion-text-vision understanding and generation","venue":null,"work_id":"2808abbd-7441-4790-b3a9-f40fc80d4a48","year":2026},"citing_paper":{"arxiv_id":"2605.19578","last_updated":"2026-05-21T10:01:47Z","snapshot_observed_at":"2026-07-06T23:30:16.094579Z","submitted_at":"2026-05-19T09:21:57Z","title":"Lens Privacy Sealing: A New Benchmark and Method for Physical Privacy-Preserving Action Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-22T09:59:02.669525Z"},"links":{"cited_paper":"/paper/2603.22282","citing_paper":"/paper/2605.19578"},"observation_digest":"sha256:34e7d6cf8a831368520654ae4f54edd9be36549037ef36c2d2c481134832f79d","observation_id":"a2b27680-57d8-4c97-9401-87f2f65f1f26","resolution":{"observed_at":"2026-06-30T02:16:16.535924Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.22282/citation-record","integrity":"/paper/2603.22282/integrity","json":"/paper/2603.22282/citation-record.json","paper":"/paper/2603.22282"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: SIGGRAPH Asia 2024 Conference Papers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:b38784bc750f149ab8750879e78dea7ae1a159c9977c64da249ba3c53f267f9d","observation_id":"915c29f4-2d75-437a-9f3d-a369c5aee5f8","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:6d365972a42cd9dbed754afae7c25d8e1a5f6839e2abce1d23eeb33edac55dbf","observation_id":"0124634b-d250-4b73-9f9f-e467a4689ed6","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Advances in neural information processing systems33, 1877–1901 (2020)","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:4c53da456147f336c81292646c3e2a7c36c3fb8f29f5919d209982bc86ef0c1b","observation_id":"bc57b51e-0739-424f-8406-f0c81f1e4ff8","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"IEEE Transactions on Pattern Analysis and Machine Intelligence (2019)","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:ab6fcdbd0cc378da9881f8254f90af9b5006ebb745f596eb34c4938978732ffc","observation_id":"070f560e-a438-45a0-8580-6dfbe9c73825","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-09T07:42:51.616278Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2405.20340 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:130e9f9ba589722947fd3edef2f821a1f2d0916298c77c82e19bfe81e2c06662","observation_id":"ca3d3740-6eab-443e-9fd9-2dfdf2a49c07","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2501.17811 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:ef746a91005af7a73b0a5477fa27daeb649c157f331f79dae25e516bbc2ae844","observation_id":"f3820cfb-d8c8-4a15-8c80-ce49a1844bd1","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:baacda256dd14cce04e26d9b3716ec1f20e1250f761b50a87ef929e0a6d2af8c","observation_id":"b00df07d-b247-4537-adbb-9a96cb52dad0","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: CVPR","venue":null,"work_id":null,"year":2093},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:36d8f85be541d5b74f0544dac0467714282c287ee1431db06b8ef4e504b83077","observation_id":"065994f0-26ff-4c22-b302-64d7afc53ddf","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: CVPR","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:3457553af12b8bb3b05650da7738d0ee3d634c9162979a923bb0b9e7bfd2e53c","observation_id":"2f81c7bb-d9fa-4140-a81b-ac759056c364","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-08-09T05:23:26.365677Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:1706.02677 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:993e0874fcdbac6632223361844a705660c5e64a336cdc1f749b103cebcf1d3b","observation_id":"c8cac93d-4b73-4cb7-88c3-8dd9e8e61852","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:96983921d8a831676e461808ab709678bccf88aac7d9fe183b5be0fd73d800e9","observation_id":"93ab1e8c-8cb9-45a7-9269-c1a332c01390","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:e78911468f8607b34be86fc456fe0032ffec2ccfe835ef10f03a5d506f4814a7","observation_id":"b9d64f48-b25b-4cd7-95c5-bae069b0c18a","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:ac78126b4d7e0bf4f0bd06df7012f1cf6b7299b655f025f6a2d465290b059eef","observation_id":"642dbc86-3ba8-473a-bba5-9a8a796a3486","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: ECCV (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:562d68ff3fbbe534715b51ee8652b3eb134bbdf0d401e832856a93a1b1ca4270","observation_id":"0f85450c-7789-47de-ad3b-30f8d530b145","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2511.01463 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:2663a2109f2892698d93ae39684ed24fe96b64f8100f569e7789c981b208aff3","observation_id":"873edb0b-4d20-40bb-b118-0942dae978ea","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"6m: Large scale datasets and predictive methods for 3d human sensing in natural environments","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:308e7f87e878dc334d78ea47b14ea7c2018fe29a6f3ded41f7ab6aecf425026d","observation_id":"e61a25c6-dc12-479f-a3b4-9f2dfc0cf14b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Advances in Neural Information Processing Systems36, 20067–20079 (2023) 16 Z","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:64458a0d664d994df9395d2052680f5cdba168356e94ce1a025708817808b7b1","observation_id":"15530285-8d16-40b5-9a0f-fe30d5a507ff","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: CVPR","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:ee2396127751b3dfe315907e2287870816ab1e4e2174c26069f34d2056c308ad","observation_id":"cdc66fd3-16eb-4474-b0d7-e46e645a9b67","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:1312.6114 (2013)","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:fc44afbe9694ab77133299b957c1ac499ae30b84c24a2253d5deefedaa5c19ba","observation_id":"b1f7d776-1da7-4e33-abb4-74c06b0c3026","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:2957088954fa903fafb758d9561b407691d974f2046857c5964583fe2c2ea444","observation_id":"2236f21a-25b6-4746-93a2-e218199341d7","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:3acb220adf4295f98c36b7180ecaabc1c2248d774dd540d4b67463b9a1c29d64","observation_id":"75f3b044-ea93-4136-a94f-cf04e93b6c93","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07093","last_updated":"2025-03-08T06:09:23Z","snapshot_observed_at":"2026-07-06T19:30:34.984716Z","submitted_at":"2024-10-09T17:33:03Z","title":"LaMP: Language-Motion Pretraining for Motion Generation, Retrieval, and Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07093","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2410.07093 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2410.07093","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:aabef51a8f2e561c904538e28a9e229f527bb6a597e09cd75fd7edb5d5d0f16b","observation_id":"721eba4e-311c-440f-acf6-8d9098bca509","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: The Eleventh International Conference on Learning Representations (2023),https://openreview.net/forum?id=PqvMRDCJT9t","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:1ce85f92086d495174aa8f1aafde9d5ed73bd7900e93a954d607dd70ee4ddbb6","observation_id":"3a5f1131-5251-4981-b2d3-e3224be30e6c","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: NeurIPS (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:4f4954be7df09aa365cbad32ad7640c605af6de9f96e85467418257b40fa39bb","observation_id":"ae0b6daf-3124-4e00-b576-d85c73c1bd94","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01372","last_updated":"2023-09-04T05:43:48Z","snapshot_observed_at":"2026-07-06T16:13:53.775220Z","submitted_at":"2023-09-04T05:43:48Z","title":"DiverseMotion: Towards Diverse Human Motion Generation via Discrete Diffusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01372","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2309.01372 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2309.01372","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:3287edb75b194f311422b6ceee05b79f488e2a133d4aef3bf2acbdc801e7cb7c","observation_id":"06f6a21e-d3fa-4d45-bda3-95f8b77ecef8","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:c67e26eb7794d86c8a490f57ee8230b6737f8d541e1734524eaa5db7fd7bea23","observation_id":"9705b47c-40dc-495d-9167-9077bc0604c2","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2405.09818 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:2f5d1707eb6c0dfe1c247c29b532ba4986f0f130a6821e4e864b0b73f31863c0","observation_id":"aad96bf6-8b56-4bf8-90e4-cd091c3b4a55","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14916","last_updated":"2022-10-03T09:17:41Z","snapshot_observed_at":"2026-07-06T13:57:50.746457Z","submitted_at":"2022-09-29T16:27:53Z","title":"Human Motion Diffusion Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14916","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2209.14916 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2209.14916","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:c02b883f441d9a8b4f65f4ce1e91397c2f5d0dc6c1868ea5d3f8f1a5f8130519","observation_id":"5c98c56a-9cd8-4d50-b9e7-cd6276b7ef8d","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:40ccc8d6caeffb4d1fc11ee0eab53e0221fd8daa49d2a2234db66e057d3a630f","observation_id":"5e3a59dd-2c50-4361-b5d3-cfa90305a6c5","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the European conference on computer vision (ECCV)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:00118ecf0e8aac217130ca4d8f7b4178b91d2fad586f76d06fd4aa296b08c667","observation_id":"9b80089e-93f7-459b-a49e-4d4183ec29d0","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2503.20314 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:a95dc8530f1a50ff8257e5fb7ddc58a487c312308bc74614705f3b91a77bf993","observation_id":"47d103d0-969f-4f46-89df-357d5997a92f","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: ICCV","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:60a185292234ec4bc462874b7722b53479ca04839ede8362a8c00cd3e8d3085c","observation_id":"05856026-1fc7-42eb-a869-ce2b4fb0ea1f","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:5c6dd3088d6445e93b8a0d3d51831ffdd61e0061326e54aceb8c45d08a0271fe","observation_id":"2e4fc8f9-bb0e-47e0-a51f-87d9f8ae542a","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:eea7d1b6326816bd3317a375f994711c169dcce49af93fd8a6964c99f720586d","observation_id":"2ce0eaed-8352-46c5-80b1-3d38f983364e","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13848","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2410.13848 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2410.13848","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:0d7a5531fd965f527064d307d7d6b1c135ead6853f2323cb8080a2b7f57f69d0","observation_id":"7ff31501-b9df-43b6-abaa-e49adcb39273","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Forty-first International Conference on Machine Learning (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:a445c53fdc2bfdc65e940d684aae4a871dd8a0362e0baeda9e91056e9ba1633b","observation_id":"c94facd2-3b48-4d3a-985e-e7823a624574","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:5ddbcf0a596661313a83d05fba33bc1ab60f40907b874b0a0a17519caa10f5a1","observation_id":"1989b446-0f0e-4eab-ae86-783c43f4fb40","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.15564","last_updated":"2025-09-22T01:24:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T15:39:15Z","title":"Show-o2: Improved Native Unified Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.15564","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"arXiv preprint arXiv:2506.15564 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2506.15564","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:ef56f8e6fd4769a803d4d4d51aa6ec56beb0ddce4602b8a247523e18968df2ed","observation_id":"54c9d718-9e24-4a32-9b0c-10b8a5bc5cea","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (June 2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:babb04071d13e9558289a613cab78780f036d011d84646cd31aa3caebe8b9d66","observation_id":"bbbfa3fa-2821-4680-9807-d4efca35c01b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"TPAMI (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:10b24008fbe19c0acc65deb7a11c6c774da5cddf6fbe4bb5fd826e22b834f6c1","observation_id":"8dd0f463-2e15-49c1-bb22-79ade85648ef","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:81c085f64c4211f34f86f648f29c88a4e836dfe3e39390ff098eacd340c26c79","observation_id":"1940e890-17cd-4f67-921d-eaa4b75325fb","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: ICCV (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:f7cf634e34c319233aa25edd76b9333505fdb6c62217b808365b899f88c8e832","observation_id":"23e9ce0c-d0b2-40bf-b0d6-e0aa84d1b98b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:377ce438bd31637a9e25d6bebacdd41f08355c84b590fc8ba7b1c631b1454f13","observation_id":"81864847-37ea-4227-af7c-f748d5ae8405","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:eb390a695f18589c305fd8b7f8670b8285c88a1f86220d5fb8e4b8ae003be5f4","observation_id":"a0f2fb61-b208-490f-ac5e-d50b8b9c0ef1","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"IEEE transactions on pattern analysis and machine intelligence46(6), 4115–4128 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:8dc56a39cbf033dac9d446224a771d47971f4bcb773edb6823ae423d5880719c","observation_id":"515b0ede-a67e-4249-acf9-30e8916015a7","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11039","last_updated":"2024-08-20T17:48:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-20T17:48:20Z","title":"Transfusion: Predict the Next Token and Diffuse Images with One Multi-Modal Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11039","snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"with his hands out","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"cited_paper":"/paper/2408.11039","citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:bb0f93a6f91bfd78814b1a4de4cbd37667844f90d2091326872bc845e7e19436","observation_id":"b456d4e3-ea94-492b-a221-7f09eefe9bb4","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:d2719231fbd44ada601c95c916a1fb10aae44e86406759418b8d200e3b287f0a","observation_id":"203868c6-5b7f-408f-b963-9a0e4e67fb0b","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:dfeaff95c7214dbb9e1629ba5fca79921431181d8451a0a865c9457c09466f59","observation_id":"1a0d2bb6-2e58-4e25-97d6-c62c16fad172","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:9c9de922adb55d97190c9f907208bc7dadfb82363d9077fe849d2f4c07633d87","observation_id":"44f58876-ee07-466d-a344-793806d11eb9","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:f9cb27a334e1c19f0527e614f1e40013a5260b80a0f31cf1fe79083fef83613c","observation_id":"07be66af-f3e0-41d6-a823-724a407eea5f","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"7.Global orientation (continuous 6D form): 6-dim","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:d67ca5c596e37d696ed4cd3a8a642dc3cd426e994d1d7445887952944876fb75","observation_id":"8f02bf4f-2425-4f89-b225-2543d7c6d112","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:2401c792928425d53c5590b6d8e9a1a3d427d1e9e305f8ba9848e7e0a8c40c31","observation_id":"e6b0ba6d-5773-41e4-aa64-62324a8bd102","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T20:17:37.389126Z","title":"Describe the motion","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-13T20:17:37.389126Z"},"links":{"citing_paper":"/paper/2603.22282"},"observation_digest":"sha256:d43d9efe6064cff9ec6ee60bbaa2674ba3747bd46c709c7e6dc09af2689a9bcd","observation_id":"b9ca36a0-a1db-4315-9030-895059ad7ac5","resolution":{"observed_at":"2026-07-13T20:17:37.389126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.22282","last_updated":"2026-06-27T20:51:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T21:38:50.961426Z","submitted_at":"2026-03-23T17:59:48Z","title":"UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2603.22282."}