{"as_of":"2026-08-14T01:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e651b8835fca2edbbcf7d73daaf783f5b6cf6234e53870eeab8e05b12e661cbd","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T21:55:03.686435Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:39:25.303896Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T13:47:57.512626Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07863","snapshot_observed_at":"2026-08-03T17:06:54.531502Z","title":"Being-m0","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-14T01:08:58.555106Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:54.531502Z"},"links":{"cited_paper":"/paper/2508.07863","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:778acdb808863611e33ea5ad1fdd1d882b01949dd156e5e446bbab036fa8ce1e","observation_id":"f3f0f2b1-ba20-4233-91d7-cb8d54d2cfd2","resolution":{"observed_at":"2026-08-03T17:06:54.531502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"cited_work":{"arxiv_id":"2508.07863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07863","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Being-m0","venue":null,"work_id":"42fd4146-0990-40ec-b381-15079338824a","year":2025},"citing_paper":{"arxiv_id":"2601.10632","last_updated":"2026-04-10T16:10:59Z","snapshot_observed_at":"2026-08-10T21:01:10.829067Z","submitted_at":"2026-01-15T17:52:29Z","title":"CoMoVi: Co-Generation of 3D Human Motions and Realistic Videos","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T13:43:26.460480Z"},"links":{"cited_paper":"/paper/2508.07863","citing_paper":"/paper/2601.10632"},"observation_digest":"sha256:1bfde6ad5af86cbfd020f71fad27c4a48f699dfebda895eb928f006f2894f92b","observation_id":"76dac94f-3c6c-4fa7-b748-124078c28352","resolution":{"observed_at":"2026-05-16T13:47:57.514056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.07863","snapshot_observed_at":"2026-08-12T00:39:25.303896Z","title":"5: A real-time controllable vision-language-motion model , author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07993","last_updated":"2026-08-08T08:02:37Z","snapshot_observed_at":"2026-08-13T23:22:44.884887Z","submitted_at":"2026-08-08T08:02:37Z","title":"MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T00:39:25.303896Z"},"links":{"cited_paper":"/paper/2508.07863","citing_paper":"/paper/2608.07993"},"observation_digest":"sha256:2241b6bdacc5660d572c98c77e974b9cf4aebe824145c64ed7d54b82579e2b61","observation_id":"5fa7384a-329a-43d7-9e3c-f6db91017093","resolution":{"observed_at":"2026-08-12T00:39:25.303896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07863/citation-record","integrity":"/paper/2508.07863/integrity","json":"/paper/2508.07863/citation-record.json","paper":"/paper/2508.07863"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.061147Z","title":"Momask: Generative masked modeling of 3d human motions","venue":null,"work_id":null,"year":1900},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.061147Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:be8767ec8cb9fe58e6d1ea3abf1330d1f97afb81997471291d88a7da43475526","observation_id":"dece0443-f9d0-4aed-8a4b-fb9ee5b6a50c","resolution":{"observed_at":"2026-08-05T21:54:57.061147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.194279Z","title":"Motiongpt: Human motion as a foreign language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.194279Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:c8bbc3992a93407d8a02015594c8ebf8386cf65895735f146e34ad597342d8ca","observation_id":"e7f6a5fe-b310-4021-88d5-e9b0c9f65b11","resolution":{"observed_at":"2026-08-05T21:54:57.194279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.356942Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.356942Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:6440256f6be43e2f34edaf1a7a83390099c87b1fee340c64fca34902ae511ee5","observation_id":"dff48fa4-f852-4f2c-843c-a6a25f92051e","resolution":{"observed_at":"2026-08-05T21:54:57.356942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:11.023145Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset.Advancesin Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"0980e49f-42c1-4d24-900c-4e0fa715ad23","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.480981Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3ada19220c57f364374cc6796916e098eec5f8849f99a30fab60bb57fd7c1278","observation_id":"fa0611e9-d169-49ac-8e34-ebb202c2a7a7","resolution":{"observed_at":"2026-08-05T21:55:11.071203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.627224Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.627224Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:21db331bf46fc8142b98ef662d30d3eafd0a560be148d490fae113a57375d9c0","observation_id":"8b3db17c-7c61-421d-81f4-80040385add2","resolution":{"observed_at":"2026-08-05T21:54:57.627224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:57.739675Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.739675Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:8d8804ef2b8b982c3b2397a721491587e5bf0dc79569c5ba81f0e063de8aafd4","observation_id":"1c21bda0-ecc1-410b-b15d-9684fde545d4","resolution":{"observed_at":"2026-08-05T21:54:57.739675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:10.755104Z","title":"A large-scale rgb-d database for arbitrary-view human action recognition","venue":null,"work_id":"9306ff84-7fee-4fd8-a72d-0782af1dac03","year":2018},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:57.899801Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:a703f4c069af7e6b7458708e1888f38a5fd6546947caabd396146d9e8cd21e65","observation_id":"be59e44c-9ed1-4551-8228-2bee0d92fc49","resolution":{"observed_at":"2026-08-05T21:55:10.900308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16273","last_updated":"2024-11-02T04:39:28Z","snapshot_observed_at":"2026-08-12T23:58:05.996476Z","submitted_at":"2024-05-25T15:21:59Z","title":"M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation","version":5},"cited_work":{"arxiv_id":"2405.16273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16273","snapshot_observed_at":"2026-08-05T21:55:04.461224Z","title":"M$^3$GPT: An Advanced Multimodal, Multitask Framework for Motion Comprehension and Generation","venue":"cs.CV","work_id":"56cf877f-819c-479c-b9b9-1289329896ff","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.024126Z"},"links":{"cited_paper":"/paper/2405.16273","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:cca0aa21a0e97b2395141419b9b4132e6015c1d0aaab425ff07410d308ea67e1","observation_id":"5113d07b-6e8d-48e6-b842-1a78fd74b251","resolution":{"observed_at":"2026-08-05T21:55:04.531949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:10.393111Z","title":"Scaling large motion models with million-level human motions","venue":null,"work_id":"64e0ca1a-8385-49cd-aef4-6c50b071773a","year":2025},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.170476Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:4192e0c89c4866718b7b4df898f0ad2972b4254adff1743e464db671a5d68d00","observation_id":"74225f25-b5f1-48d9-a88a-24eecdcaf43f","resolution":{"observed_at":"2026-08-05T21:55:10.589979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:58.286611Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.286611Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:62c66d615a93c36bf0aa4642c52d8448a4df67d098da6da8a0ce0d9748015bd7","observation_id":"2fe7aa93-f7bd-4160-a6be-71415b12f3f5","resolution":{"observed_at":"2026-08-05T21:54:58.286611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.977213Z","title":"Temos: Generating diverse human motions from textual descriptions","venue":null,"work_id":"8bead382-61d9-406a-a120-64815148a547","year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.404718Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d1c0b6f69c5ced3c3e8d650bdac604eb81ca2d3b600f48561889bdddd2623cf4","observation_id":"01277ddf-1995-4ea3-b713-52a20ec98685","resolution":{"observed_at":"2026-08-05T21:55:10.171990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.697258Z","title":"Language2pose: Natural language grounded pose forecasting","venue":null,"work_id":"15292b36-d021-42c3-9844-77427c19b6ef","year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.488840Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:2b6070cf7efd0396fe8b91eb6284cfd594cf5c3e136cacdf4f7bffb876c47ab6","observation_id":"c7e44568-127d-4782-b635-1021a5a3175c","resolution":{"observed_at":"2026-08-05T21:55:09.830066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.381310Z","title":"Motiongpt: Finetuned llms are general-purpose motion generators","venue":null,"work_id":"3a605480-55a9-4165-8e11-f4468c73fc23","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.572722Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:875208ef4990f1f21c41c45ac9568006c85d41f5ced4188c367fd382c31ea1c9","observation_id":"41af36a7-045a-4bf5-b95d-ddffd17f0d17","resolution":{"observed_at":"2026-08-05T21:55:09.518557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21747","last_updated":"2026-06-08T02:14:45Z","snapshot_observed_at":"2026-08-12T22:13:07.514751Z","submitted_at":"2024-10-29T05:25:34Z","title":"MotionGPT-2: A General-Purpose Motion-Language Model for Motion Generation and Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21747","snapshot_observed_at":"2026-08-05T21:54:58.674215Z","title":"Motiongpt-2: A general-purpose motion-language model for motion generation and understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.674215Z"},"links":{"cited_paper":"/paper/2410.21747","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:83ebdca2e45c4250e4a6ff9cdb5960e82958d39d1affa3b0e4a5b8fff482da14","observation_id":"6f82544c-813a-4c9c-b787-9e4c43a67498","resolution":{"observed_at":"2026-08-05T21:54:58.674215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:09.069824Z","title":"Recurrent network models for human dynamics","venue":null,"work_id":"e91d78bc-1512-4d38-97fa-70b337f150ea","year":2015},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.788216Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:760eee2ca13ec948fee3c95c00433b535c84a26b14d1db7413dff877d36fd34f","observation_id":"b5109d80-5552-4ce4-8338-eef799e9e219","resolution":{"observed_at":"2026-08-05T21:55:09.209540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:08.727845Z","title":"A neural temporal model for human motion prediction","venue":null,"work_id":"bc5a27c8-de83-4ad2-a18c-c8d4f92a3da5","year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.901849Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:74b5f8cd200800af9803f0dae58de4370e231c2dc145ac824cfa85fbfe72ee84","observation_id":"34812253-a8e0-43bf-ad8c-09a39ec1b6b2","resolution":{"observed_at":"2026-08-05T21:55:08.899001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:08.345193Z","title":"A stochastic conditioning scheme for diverse human motion prediction","venue":null,"work_id":"17669fd1-bf3e-4ec6-9592-bee0d81c6f68","year":2020},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:58.988702Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d95a15efd866bcfa29268aa0d34e5157e6790db4428a0066e40fa481203f1283","observation_id":"add6134e-aa7e-4f2e-996d-651df9ac534f","resolution":{"observed_at":"2026-08-05T21:55:08.524160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:08.022035Z","title":"Learning diverse stochastic human-action generators by learning smooth latent transitions","venue":null,"work_id":"3848eba4-0b78-4a3e-b865-8c642559198c","year":2020},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.102481Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:014c01bb6280f32a70198e203896360c0f22b21c7bd4139d7352643248d2bc22","observation_id":"f2a32cee-4d38-4827-9e1b-3a6acd8c1de7","resolution":{"observed_at":"2026-08-05T21:55:08.190878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01700","last_updated":"2024-04-03T06:40:46Z","snapshot_observed_at":"2026-08-13T00:39:33.081269Z","submitted_at":"2024-04-02T07:09:29Z","title":"MotionChain: Conversational Motion Controllers via Multimodal Prompts","version":2},"cited_work":{"arxiv_id":"2404.01700","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01700","snapshot_observed_at":"2026-08-05T21:55:04.315765Z","title":"MotionChain: Conversational Motion Controllers via Multimodal Prompts","venue":"cs.CV","work_id":"5e3248be-2079-4447-9adb-f9d24cc1222d","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.216321Z"},"links":{"cited_paper":"/paper/2404.01700","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:5b5d1d5094e218d6de7d96788e031b67850f5c8c9404bd2074fe68cd3362fc42","observation_id":"3a35875b-133f-408f-856e-523ea6a1330b","resolution":{"observed_at":"2026-08-05T21:55:04.395699Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20340","last_updated":"2024-05-30T17:59:50Z","snapshot_observed_at":"2026-08-14T00:54:56.814837Z","submitted_at":"2024-05-30T17:59:50Z","title":"MotionLLM: Understanding Human Behaviors from Human Motions and Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20340","snapshot_observed_at":"2026-08-05T21:54:59.349922Z","title":"Motionllm: Understanding human behaviors from human motions and videos.arXiv preprint arXiv:2405.20340, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.349922Z"},"links":{"cited_paper":"/paper/2405.20340","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d746aed15a0b7a5d0c4d3c3f71a3fd371cb429c3e8aed172291c43ebafeb6bfb","observation_id":"c0d45bf0-6888-4ddc-82c2-125238f37983","resolution":{"observed_at":"2026-08-05T21:54:59.349922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:07.791583Z","title":"Large motion model for unified multi-modal motion generation","venue":null,"work_id":"0af26456-33ae-4506-a46a-6a28d3e53dbf","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.472583Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:b836e2ba73e60124c481e817e9fdbf9370f851735b6de4da2db5e2f7907121cc","observation_id":"e8293c10-4cb8-43e5-b917-088f5d8a3fb0","resolution":{"observed_at":"2026-08-05T21:55:07.920463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:59.555702Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.555702Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:225302b500bf8283ed44c706fdef237e994877450b6b333f23e8e9313d79ad60","observation_id":"1dda8c6c-d1f5-4128-9e8f-1cc6bfa07b58","resolution":{"observed_at":"2026-08-05T21:54:59.555702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:59.654282Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.654282Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:067cac0bfa7d1b590654ae0d988b580b3ac56b37a59db0bc6999f932ff1c348f","observation_id":"341ddcb9-d858-4868-aabf-0b7c45401c19","resolution":{"observed_at":"2026-08-05T21:54:59.654282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T21:54:59.795393Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.795393Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:b42b9af7c74ff7ec83e29bbd89c4d486d64ac671fadb4c555f7ecc1fb513f160","observation_id":"1b49001d-75f1-408a-997f-aed91bd5b1ed","resolution":{"observed_at":"2026-08-05T21:54:59.795393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T21:54:59.894391Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic.arXiv preprint arXiv:2306.15195, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.894391Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:75a51d61ae360db58505379fae2e6a4156c662934234bfe11b3cc9767c22fa10","observation_id":"20663abe-3cae-4f82-a4be-36d4943a4bcd","resolution":{"observed_at":"2026-08-05T21:54:59.894391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:54:59.990725Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T21:54:59.990725Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:9560b2023954b8fe8be3e511a13a708ffb77cbad5b856224d0e783bc0ce2f334","observation_id":"e480fb9c-08b8-4a63-ac25-0bbcf0bddad0","resolution":{"observed_at":"2026-08-05T21:54:59.990725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:00.076186Z","title":"Neural discrete representation learning.Advancesin neural information processing systems, 30, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.076186Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:14776ee786be204ad35ea3646c2ccab061cdc417e57f58d36296e709b4623d28","observation_id":"efa3ce64-3ad0-41e3-b8c0-f154ae49a476","resolution":{"observed_at":"2026-08-05T21:55:00.076186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:07.549527Z","title":"Locally hierarchical auto-regressive modeling for image generation.Advances in Neural Information Processing Systems, 35:16360–16372, 2022","venue":null,"work_id":"57d2e6e3-c315-4feb-b10f-5c17f5d97438","year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.164563Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:87c8e6409ddead540d6ac758b98b527846190eb6b495f0026b7211677e4ef3b0","observation_id":"ce96e7aa-98de-4a25-b0fe-a707dd9a63cf","resolution":{"observed_at":"2026-08-05T21:55:07.655546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05737","last_updated":"2024-03-29T17:44:41Z","snapshot_observed_at":"2026-08-02T18:23:02.746177Z","submitted_at":"2023-10-09T14:10:29Z","title":"Language Model Beats Diffusion -- Tokenizer is Key to Visual Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05737","snapshot_observed_at":"2026-08-05T21:55:00.299651Z","title":"Language model beats diffusion–tokenizer is key to visual generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.299651Z"},"links":{"cited_paper":"/paper/2310.05737","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:6502781fe278cdff6fbb43e4ca705d89eeba324fb9a6fbb3c074594393a3a470","observation_id":"085c8fec-7879-4d83-9ba4-3c5a4fa9332b","resolution":{"observed_at":"2026-08-05T21:55:00.299651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15505","last_updated":"2023-10-12T07:55:05Z","snapshot_observed_at":"2026-07-06T16:24:17.829828Z","submitted_at":"2023-09-27T09:13:40Z","title":"Finite Scalar Quantization: VQ-VAE Made Simple","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15505","snapshot_observed_at":"2026-08-05T21:55:00.438317Z","title":"Finite scalar quantization: Vq-vae made simple","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.438317Z"},"links":{"cited_paper":"/paper/2309.15505","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:69900c143651ccea6157ad1f5ca389558491ea7d9ad10e401c095f8d601eb63c","observation_id":"a7c21b9c-1ed6-46bd-a882-91d9cc60f152","resolution":{"observed_at":"2026-08-05T21:55:00.438317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10523","last_updated":"2024-12-13T19:33:48Z","snapshot_observed_at":"2026-08-11T15:50:50.414341Z","submitted_at":"2024-12-13T19:33:48Z","title":"The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion","version":1},"cited_work":{"arxiv_id":"2412.10523","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.10523","snapshot_observed_at":"2026-08-05T21:55:04.154322Z","title":"The Language of Motion: Unifying Verbal and Non-verbal Language of 3D Human Motion","venue":"cs.CV","work_id":"4a0f7dc5-cb38-473d-85fc-28ee26244449","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.545792Z"},"links":{"cited_paper":"/paper/2412.10523","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:bbde6505fa9457bc892e93bc4576f4043709a31617ccdb178da1a87306f54014","observation_id":"19116fe6-42eb-4ba8-9981-4744899a9c44","resolution":{"observed_at":"2026-08-05T21:55:04.212186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12978","last_updated":"2023-10-19T17:59:46Z","snapshot_observed_at":"2026-08-13T11:56:19.737423Z","submitted_at":"2023-10-19T17:59:46Z","title":"HumanTOMATO: Text-aligned Whole-body Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12978","snapshot_observed_at":"2026-08-05T21:55:00.655357Z","title":"Human- tomato: Text-aligned whole-body motion generation.arXiv preprint arXiv:2310.12978, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.655357Z"},"links":{"cited_paper":"/paper/2310.12978","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:ae039266670221a5d6432509dcf3cbe1ac68d4eb44cfdeeab7db6545bb779efa","observation_id":"37024144-556a-4f56-b275-8c5f52378f5e","resolution":{"observed_at":"2026-08-05T21:55:00.655357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-05T21:55:00.759463Z","title":"Video instruction tuning with synthetic data.arXiv preprint arXiv:2410.02713, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.759463Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:2d2b3dfdcbddd1c398fa7f0a5b8fc0d23cf67fbd284287f9120db52c004c7d42","observation_id":"3ed91865-da65-4d6e-a1db-a804263ec9bb","resolution":{"observed_at":"2026-08-05T21:55:00.759463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:00.851447Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.851447Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:76d08f27719975d0b8e613020f0f9f0de4bd2bc9dea4feb3effc6306fc6d13fb","observation_id":"d1bf1a21-a541-42d9-9561-b1a77cfae242","resolution":{"observed_at":"2026-08-05T21:55:00.851447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:00.957517Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:00.957517Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:f5a7b9511d97b2ae7a9b9a992daf0508ab185b1db24cbfda00126f078546cf49","observation_id":"0dd5e36c-bab4-44e7-aca4-8ca3ae7de1e4","resolution":{"observed_at":"2026-08-05T21:55:00.957517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.067511Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.067511Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:12e277b7b59208dafbee1a56b367e6644bb12a5fd76cbbbff3d427c95e61750a","observation_id":"07474f84-7df4-418b-832d-84842521fee3","resolution":{"observed_at":"2026-08-05T21:55:01.067511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T21:55:01.153815Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.153815Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:965156665f80b8d1f6af9711adb8a1261fc9ae800e33965d3aba1ad4929b9e79","observation_id":"d0cc928d-8f53-4146-9b96-1e97f4d9a744","resolution":{"observed_at":"2026-08-05T21:55:01.153815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:07.223086Z","title":"Smpl: A skinned multi-person linear model","venue":null,"work_id":"4c06b1f4-7e87-4644-899d-88cb6432c97c","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.246734Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:edae5583b850981e66981bcfe595a66126d7a1e698dbcee01a9fc6fd272b9836","observation_id":"831fad93-aa76-4d93-82c8-7cf4f39ea056","resolution":{"observed_at":"2026-08-05T21:55:07.365209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14559","last_updated":"2024-12-19T06:22:19Z","snapshot_observed_at":"2026-08-11T12:05:31.054026Z","submitted_at":"2024-12-19T06:22:19Z","title":"ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation Model","version":1},"cited_work":{"arxiv_id":"2412.14559","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14559","snapshot_observed_at":"2026-08-05T21:55:03.978993Z","title":"ScaMo: Exploring the Scaling Law in Autoregressive Motion Generation Model","venue":"cs.CV","work_id":"00325b11-1e6c-45fc-938c-0263b8291837","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.311777Z"},"links":{"cited_paper":"/paper/2412.14559","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d5460113b8d0769db8058fd9d9ec65c98b4dc41973df06fc966d395d934d0646","observation_id":"4ae44264-f948-4cca-937d-02e8bf0a804b","resolution":{"observed_at":"2026-08-05T21:55:04.023236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.439383Z","title":"You only look once: Unified, real-time object detection","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.439383Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3cdac57b80273771da0b16d8b53b08f9d03c837748922bbc868990b6259a93cb","observation_id":"d9f424e3-a602-4eb6-bb9f-bff04676e6e3","resolution":{"observed_at":"2026-08-05T21:55:01.439383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.545093Z","title":"Wham: Reconstructing world-grounded humans with accurate 3d motion","venue":null,"work_id":null,"year":2070},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.545093Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:1df79b1ae94ead8b45cd4aca530b9a9df7d17ba87cb65400b822e2a29d2c4881","observation_id":"16abd518-9938-4017-989e-04af108538c1","resolution":{"observed_at":"2026-08-05T21:55:01.545093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:01.629310Z","title":"Perpetual humanoid control for real-time simulated avatars","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.629310Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:51320b36a841eb6bd9302e455813b338f1a01c7d9b1d2074956400a9a67785f6","observation_id":"1ef57ef7-c289-471c-9781-0d3376cbafff","resolution":{"observed_at":"2026-08-05T21:55:01.629310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13790","last_updated":"2024-10-17T17:31:24Z","snapshot_observed_at":"2026-08-12T22:20:43.170420Z","submitted_at":"2024-10-17T17:31:24Z","title":"MotionBank: A Large-scale Video Motion Benchmark with Disentangled Rule-based Annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13790","snapshot_observed_at":"2026-08-05T21:55:01.735535Z","title":"Motionbank: A large-scale video motion benchmark with disentangled rule-based annotations.arXiv preprint arXiv:2410.13790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.735535Z"},"links":{"cited_paper":"/paper/2410.13790","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:1f376494e5480291fb49caf3b7506e54b7bdb2044e91a0f065184b4fff4b9db5","observation_id":"a4e663f2-0d61-4a5d-acaf-797a31be13c3","resolution":{"observed_at":"2026-08-05T21:55:01.735535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-05T21:55:01.847632Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.847632Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d9cc0ec0a3f2bf0c489727864ccb1d6879c7ae85953712ae693030c737307404","observation_id":"519ee99e-1e62-4771-9393-ceb389115477","resolution":{"observed_at":"2026-08-05T21:55:01.847632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.956698Z","title":"Posescript: Linking 3d human poses and natural language.IEEE transactions on pattern analysis and machine intelligence, 2024","venue":null,"work_id":"5f14951c-8c75-4c39-b415-af1e67c5e46e","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:01.922185Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:18a10d3f94d4bb0bae8269c956436a9c1085d009bcabf6c469c0ea29799c1414","observation_id":"8e52c3ca-4481-48e3-b569-1d8350ff632b","resolution":{"observed_at":"2026-08-05T21:55:07.069823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16781","last_updated":"2025-03-29T03:35:20Z","snapshot_observed_at":"2026-08-12T13:22:49.924005Z","submitted_at":"2024-11-25T08:06:30Z","title":"UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing","version":2},"cited_work":{"arxiv_id":"2411.16781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.16781","snapshot_observed_at":"2026-08-05T21:55:03.803275Z","title":"UniPose: A Unified Multimodal Framework for Human Pose Comprehension, Generation and Editing","venue":"cs.CV","work_id":"d26bddf2-af31-4e56-a001-7fc08c7b9161","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.001344Z"},"links":{"cited_paper":"/paper/2411.16781","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d8e30dc510b36154daa7a7b813a0c3b0885c7d2b0fea6d383dd3144b4d906002","observation_id":"f031606a-9685-4d35-967b-9da7383f2d0e","resolution":{"observed_at":"2026-08-05T21:55:03.873453Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.765776Z","title":"The kit motion-language dataset.Big data, 4(4):236– 252, 2016","venue":null,"work_id":"2efd5fb6-f394-4307-95d7-ae17d4ac23bd","year":2016},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.083256Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3cf4cc9592907cb0465bd142884a6af12e0ac89127c69987f0d743e9b86fd490","observation_id":"26d89571-6974-453b-96e8-826bd48f83a2","resolution":{"observed_at":"2026-08-05T21:55:06.837633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:02.186443Z","title":"Amass: Archive of motion capture as surface shapes","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.186443Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:425faaac739241fc3aab7f0d1f16d4ad395b97d8543adb6895bd5b9c94df370a","observation_id":"c88c3d4d-616c-42ec-b458-2c6cfc015bd6","resolution":{"observed_at":"2026-08-05T21:55:02.186443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.650814Z","title":"Recovering accurate 3d human pose in the wild using imus and a moving camera","venue":null,"work_id":"571a6533-97fa-4467-936b-89dd0491b151","year":2018},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.270194Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:a9f52edfe49279545be0c915e2126a0f50bd66c383c839fc59b3771fe5d69f25","observation_id":"e600edf6-3a56-4126-bdd1-9dcb55995bc4","resolution":{"observed_at":"2026-08-05T21:55:06.713662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.540097Z","title":"Motion-x: A large-scale 3d expressive whole-body human motion dataset.Advancesin Neural Information Processing Systems, 36:25268–25280, 2023","venue":null,"work_id":"d31b73ab-5a7a-4a15-b74b-6dd74d3a4f62","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.345136Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d2463a80a29a04dc66831675dadfcdba822e27057e034520f871bd1b807a29b7","observation_id":"95a54321-6915-4f40-b11e-4f536679466a","resolution":{"observed_at":"2026-08-05T21:55:06.590197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T21:55:02.419755Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.419755Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:3a1eaf6447bba5e940370d5901d642aba3a7195ff547e7e624b80d069da19c01","observation_id":"ac2b0286-e91c-4598-8878-12aa803647ed","resolution":{"observed_at":"2026-08-05T21:55:02.419755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.382842Z","title":"Executing your commands via motion diffusion in latent space","venue":null,"work_id":"514d816f-2e4b-460d-bf5f-f9943cb74a7f","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.501633Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:6d6a353091ede64dff7b38b3c044cf2c92d8dfebb2a2c697bee0dc76e04458c5","observation_id":"4b1eb614-d23a-4f42-9002-67d3e549c225","resolution":{"observed_at":"2026-08-05T21:55:06.463606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-13T14:35:06.773752Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-05T21:55:02.580215Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model.arXiv preprint arXiv:2208.15001, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.580215Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:2fbb9431f418966cc21682b1f7ffb673ebadbbf5b6861e00bfa6d3076deb86c4","observation_id":"2938cc62-ac40-4c9e-b2d1-53d03875db61","resolution":{"observed_at":"2026-08-05T21:55:02.580215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.229834Z","title":"Generating human motion from textual descriptions with discrete representations","venue":null,"work_id":"86b231d0-3ad3-4174-9955-b203b2e256b7","year":2023},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.747962Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:77ca1226233fd9e8f882d7be04452ce92159d8a2b3c85b9b4d5f6e98ba77ac6c","observation_id":"159b2500-41a7-49cc-ac83-ec77fdb8669a","resolution":{"observed_at":"2026-08-05T21:55:06.313231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17013","last_updated":"2024-10-06T13:46:47Z","snapshot_observed_at":"2026-08-12T23:57:17.922885Z","submitted_at":"2024-05-27T09:57:51Z","title":"Motion-Agent: A Conversational Framework for Human Motion Generation with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17013","snapshot_observed_at":"2026-08-05T21:55:02.826806Z","title":"Motionllm: Multimodal motion-language learning with large language models.arXiv preprint arXiv:2405.17013, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.826806Z"},"links":{"cited_paper":"/paper/2405.17013","citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:444c31b9069110ea97bc47a9c113c9f6f197ac7f713b2ff1a59f011236216ae3","observation_id":"63b8103f-e63b-4970-bbd4-3bcc41f92c0e","resolution":{"observed_at":"2026-08-05T21:55:02.826806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:06.038987Z","title":"Avatargpt: All-in-one framework for motion understanding planning generation and beyond","venue":null,"work_id":"a52c3f4f-5bcf-4dd1-ac14-470632e6751e","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.910283Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:18d4289f3d0e09fb0cecea0fb722dacdfdf859f0e3f94e4d42244881921a8144","observation_id":"5c5c879b-afdd-482a-875b-d6ae4e2c782f","resolution":{"observed_at":"2026-08-05T21:55:06.135640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.808781Z","title":"llamacpp.https://github.com/ggml-org/llama.cpp, 2024","venue":null,"work_id":"7838cf53-7cc6-4382-a3db-c8b6a65857ff","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:02.982817Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:01f7200fbf9776a27e9d7d08c1a5e506b01b41d6695ef0248c3cfdfdf552a4ae","observation_id":"63da06a9-a3db-4858-89f5-3acdbde51454","resolution":{"observed_at":"2026-08-05T21:55:05.927027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.633090Z","title":"Parco: Part- coordinating text-to-motion synthesis","venue":null,"work_id":"e4d7b9bd-f291-4584-9e1a-0ec142fd38b1","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.075835Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:93a29c750636d8947e76a8233498a2c19fdfa69868d02f2583814aebfdfbeaf7","observation_id":"60cd66d7-ba14-42f0-8102-68c5edc2b3df","resolution":{"observed_at":"2026-08-05T21:55:05.745015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.491995Z","title":"Fg-t2m++: Llms-augmented fine-grained text driven human motion generation.International Journal of Computer Vision, pages 1–17, 2025","venue":null,"work_id":"77486527-64d5-49ff-91d7-2d162b11514f","year":2025},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.191406Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:e8cfeb5ba84c390647af864b3ab4cc2344a74b5b6ee74fc5501564dcc2e0e33a","observation_id":"b5ff2380-7174-4532-9f71-1442afa78375","resolution":{"observed_at":"2026-08-05T21:55:05.563158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.322594Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model.IEEE transactions on pattern analysis and machine intelligence, 46(6):4115–4128, 2024","venue":null,"work_id":"9154da34-24b4-4e1a-8330-52a21150f01d","year":2024},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.264774Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:7af408228e61cec0f7623cfb0da75f5c87d7aa3f1a9fb258047b051d58b7dd71","observation_id":"f4fe6324-23d1-49cd-8c34-8ab627fa4359","resolution":{"observed_at":"2026-08-05T21:55:05.397712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:03.339648Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.339648Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:de329e77cffce7256d47fefcec9653d955922ed332f9259261c9ed2772924456","observation_id":"e8dd1cb8-d25d-4708-83cc-06817a31f57f","resolution":{"observed_at":"2026-08-05T21:55:03.339648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:05.145129Z","title":"Posetrack: A benchmark for human pose estimation and tracking","venue":null,"work_id":"05f29955-1901-41c0-bfc3-6c02f8d280b0","year":2018},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.411500Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:83f018475102fd727748ebd6672060228ff21fda83639d897c91f3add4790b96","observation_id":"359e48f1-c9e6-47d1-8b3e-316920fdb2b0","resolution":{"observed_at":"2026-08-05T21:55:05.229691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:04.965717Z","title":"Resolving 3d human pose ambiguities with 3d scene constraints","venue":null,"work_id":"b46bab63-d752-40ba-9c8c-2806839a3037","year":2019},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.476511Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:7b86b934256c7b9695f3ca44b7570c13a0a29de1a56274db21f322e2e9e98218","observation_id":"4d4680ae-0b05-493f-b552-7d70fa057295","resolution":{"observed_at":"2026-08-05T21:55:05.051157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:04.795320Z","title":"Behave: Dataset and method for tracking human object interactions","venue":null,"work_id":"ffb3281d-1275-4809-a712-2d19a6c7ad45","year":2022},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.555056Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:bac20aecab9dfa9f09eae15bf4a90c33ec4e62689e64f72f9eb9a8ffa8960a30","observation_id":"a18f99fb-b686-4ff0-9033-a97193bf97dd","resolution":{"observed_at":"2026-08-05T21:55:04.881522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T21:55:04.635965Z","title":"the left hand is positioned below the right hand","venue":null,"work_id":"3ea2ae6c-23bb-4619-92c8-f5ad16957599","year":2021},"citing_paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-05T21:55:03.686435Z"},"links":{"citing_paper":"/paper/2508.07863"},"observation_digest":"sha256:d3c3da7a17f0a5cbf8b8f7284f04f80b70db87888044099812023dccaae1465f","observation_id":"a0088ee7-8b45-4f9a-9ff4-ac15d6d8754c","resolution":{"observed_at":"2026-08-05T21:55:04.677201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.07863","last_updated":"2025-08-11T11:26:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T07:38:32.540416Z","submitted_at":"2025-08-11T11:26:10Z","title":"Being-M0.5: A Real-Time Controllable Vision-Language-Motion Model"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":5,"verified_fuzzy":28},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 3 inbound Pith citation observations for arXiv:2508.07863."}