{"as_of":"2026-08-21T19:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cfa1cf799d445b202f85362241ab277b647abc5cbd6de3d6836d7c66edf6c086","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T05:52:13.242838Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:44:29.327801Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T22:08:36.251284Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-08-15T23:44:29.327801Z","title":"Mote: Learning motion-text diffusion model for multiple generation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04660","last_updated":"2025-05-07T02:30:33Z","snapshot_observed_at":"2026-08-20T20:50:15.751304Z","submitted_at":"2025-05-07T02:30:33Z","title":"AI-Generated Fall Data: Assessing LLMs and Diffusion Model for Wearable Fall Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T23:44:29.327801Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2505.04660"},"observation_digest":"sha256:10a33b61b28ee12fd5d8e8bd9af79d4d1ca957166808b67a54ba7133f5ec1e35","observation_id":"858df5a9-f3f3-4252-a366-c667601f7480","resolution":{"observed_at":"2026-08-15T23:44:29.327801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-08-03T17:06:58.070074Z","title":"Mote: Learning motion-text diffusion model for multiple generation tasks.arXiv preprint arXiv:2411.19786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.10730","last_updated":"2026-07-04T09:34:06Z","snapshot_observed_at":"2026-08-21T11:34:51.111103Z","submitted_at":"2025-12-11T15:16:06Z","title":"IRG-MotionLLM: Interleaving Motion Generation, Assessment and Refinement for Text-to-Motion Generation","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-03T17:06:58.070074Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2512.10730"},"observation_digest":"sha256:09f7b5583730a8a5b736c0c1d3b976c598a9276280e00a91235ec9c1d364ac8b","observation_id":"18d31264-d99b-489d-a295-4f7e87275235","resolution":{"observed_at":"2026-08-03T17:06:58.070074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":"2411.19786","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mote: Learning motion-text diffusion model for multiple generation tasks","venue":null,"work_id":"1effbb49-5132-46eb-b1bf-d4c864d27e76","year":2024},"citing_paper":{"arxiv_id":"2512.14234","last_updated":"2026-04-14T19:54:15Z","snapshot_observed_at":"2026-08-11T06:36:50.773707Z","submitted_at":"2025-12-16T09:41:21Z","title":"ViBES: A Conversational Agent with Behaviorally-Intelligent 3D Virtual Body","version":2},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-16T22:04:07.403410Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2512.14234"},"observation_digest":"sha256:ec92e31d63c1053d2a30c12b69e0bd8d5dc0329fafe7fd1c71a2704df464b846","observation_id":"2e468f55-0f87-4456-bae5-6685c26b69db","resolution":{"observed_at":"2026-05-16T22:08:36.253141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":"2411.19786","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mote: Learning motion-text diffusion model for multiple generation tasks","venue":null,"work_id":"1effbb49-5132-46eb-b1bf-d4c864d27e76","year":2024},"citing_paper":{"arxiv_id":"2602.12370","last_updated":"2026-04-16T20:43:03Z","snapshot_observed_at":"2026-08-14T11:55:14.305551Z","submitted_at":"2026-02-12T20:02:21Z","title":"LLaMo: Scaling Pretrained Language Models for Unified Motion Understanding and Generation with Continuous Autoregressive Tokens","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-16T05:01:11.880003Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2602.12370"},"observation_digest":"sha256:7cbee8c6e58bdd3285f247dedf0587923c44761de472e73a73a6627b32734919","observation_id":"4d048991-0494-448a-bf11-fe22d1859185","resolution":{"observed_at":"2026-05-16T05:02:19.797149Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":"2411.19786","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mote: Learning motion-text diffusion model for multiple generation tasks","venue":null,"work_id":"1effbb49-5132-46eb-b1bf-d4c864d27e76","year":2024},"citing_paper":{"arxiv_id":"2604.21668","last_updated":"2026-05-27T10:29:03Z","snapshot_observed_at":"2026-08-17T21:38:57.919943Z","submitted_at":"2026-04-23T13:33:28Z","title":"Encoder-Free Human Motion Understanding via Structured Motion Descriptions","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-09T22:03:49.029939Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2604.21668"},"observation_digest":"sha256:a55f63cfea4b11599b531ca753623d380e3bd137ba5a56407934ba7338a15e7e","observation_id":"df34b9c4-3719-4282-8039-2c5e1fea2e1b","resolution":{"observed_at":"2026-05-11T14:21:04.380355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-08-01T05:19:21.180225Z","title":"arXiv preprint arXiv:2411.19786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27581","last_updated":"2026-08-06T19:52:54Z","snapshot_observed_at":"2026-08-17T21:40:50.582023Z","submitted_at":"2026-07-30T01:55:51Z","title":"MUGEN: A Unified Framework for Efficient Motion Understanding and Generation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T05:19:21.180225Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2607.27581"},"observation_digest":"sha256:ba0ef64cc547d55c88da7c86b187705150632da6d2c062aeeab50c6dca6f380d","observation_id":"f08ce8ca-eaa7-45a0-8a24-23bd51ccce74","resolution":{"observed_at":"2026-08-01T05:19:21.180225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19786","snapshot_observed_at":"2026-08-12T00:39:25.254936Z","title":"arXiv preprint arXiv:2411.19786 , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.07993","last_updated":"2026-08-08T08:02:37Z","snapshot_observed_at":"2026-08-14T11:11:02.404005Z","submitted_at":"2026-08-08T08:02:37Z","title":"MRBench: A Comprehensive Benchmark for Human Motion-Text Retrieval","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T00:39:25.254936Z"},"links":{"cited_paper":"/paper/2411.19786","citing_paper":"/paper/2608.07993"},"observation_digest":"sha256:8f2ce9642c82194111890740ce268b97ec4629b8f60f953189f6dd4f720b8e1b","observation_id":"2c10617f-ac15-4d3a-b230-d47cc55430d8","resolution":{"observed_at":"2026-08-12T00:39:25.254936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19786/citation-record","integrity":"/paper/2411.19786/integrity","json":"/paper/2411.19786/citation-record.json","paper":"/paper/2411.19786"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.047042Z","title":"High- resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.047042Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:92d76e6ac4bee7f77e6ab857bd168b1babfe9cf55c5f73e5e1cced396fa2f4c4","observation_id":"0b629d2c-9a3d-4146-9130-fef736dbf0e0","resolution":{"observed_at":"2026-08-12T05:52:13.047042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.941234Z","title":"Dreamfusion: Text- to-3d using 2d diffusion,","venue":null,"work_id":"bca28fa6-f887-4d56-b04d-8bdf7e46b648","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.052198Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:576862b4681e7a671dc5c5f43718e24691b95cfdc7e4d5da4234cf5c0f73c97d","observation_id":"b1d601ec-a8d1-4d25-a2f3-b1cd9f21f40f","resolution":{"observed_at":"2026-08-12T05:52:13.945790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.924085Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":"816c8e09-726b-4917-932b-42643b0d2184","year":2020},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.057196Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:510fcff4ee2cd88867752139b1fea50edc260579bfa2f458312652eab6e4f81c","observation_id":"2c5f955d-48b8-4a1f-b6b5-45c71f3b8938","resolution":{"observed_at":"2026-08-12T05:52:13.928662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.908868Z","title":"Generative modeling by estimating gradients of the data distribution,","venue":null,"work_id":"7757812b-877f-43aa-84ba-88234abe76cd","year":2019},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.061836Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:6b0913de0ec2487d016433d79b836b960f6af88af7f9f0ca1b325456bb1aa844","observation_id":"76596414-0756-4c69-83b8-52330fccb102","resolution":{"observed_at":"2026-08-12T05:52:13.913799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.892675Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":"e8505053-5587-45fd-aaf7-9aa22374007f","year":2021},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.066371Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:107615149bdbf344a772f5b52fc777e60be318537ff9004e8692471fd33b8e67","observation_id":"2fe49b92-a640-499f-9602-3753bc73d4eb","resolution":{"observed_at":"2026-08-12T05:52:13.897948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.878128Z","title":"Human motion diffusion model,","venue":null,"work_id":"a48f8680-c1b5-4866-8668-35e2a1666d69","year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.070825Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:ee5746cfcf0cb52e0861a61ac03e3a6b38ec26a0905bd725571e6e416a59555f","observation_id":"538d97fe-ebf0-4f5d-aa45-39bc8898a01d","resolution":{"observed_at":"2026-08-12T05:52:13.882810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.15001","last_updated":"2022-08-31T17:58:54Z","snapshot_observed_at":"2026-08-16T16:35:36.335456Z","submitted_at":"2022-08-31T17:58:54Z","title":"MotionDiffuse: Text-Driven Human Motion Generation with Diffusion Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.15001","snapshot_observed_at":"2026-08-12T05:52:13.075861Z","title":"Motiondiffuse: Text-driven human motion generation with diffusion model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.075861Z"},"links":{"cited_paper":"/paper/2208.15001","citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:d8826e0df7f55e5012d4847020c2a3f9649d8d536e7943b1d9307f404e44fd3a","observation_id":"c2a61631-56fc-4e89-87e4-49c1caef5d4d","resolution":{"observed_at":"2026-08-12T05:52:13.075861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.863037Z","title":"Executing your commands via motion diffusion in latent space,","venue":null,"work_id":"e5c3bca9-c099-4ffe-9e5e-a838ac5e8fc7","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.080305Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:54de0931dc9dcce1aec0133aefee322d2c06f47089d38c077516e2968f588663","observation_id":"97cff239-508f-478d-be41-0ea0dabdf2f3","resolution":{"observed_at":"2026-08-12T05:52:13.867947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.845772Z","title":"T2m-gpt: Generating human motion from textual descriptions with discrete representations,","venue":null,"work_id":"984f1d93-b130-4886-aac9-2aabf8bd3794","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.084855Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:6263871fa88a29621d1e3d80a9ce454f8961eed4443be2da2af4cf362b9cd8a3","observation_id":"ad73abdd-10e2-4a7f-9845-1ad64954df48","resolution":{"observed_at":"2026-08-12T05:52:13.851397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.828882Z","title":"Tm2t: Stochastic and tokenized modeling for the reciprocal generation of 3d human motions and texts,","venue":null,"work_id":"7e424955-53d9-41f4-9417-15d5127907d8","year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.089395Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:c92a5d83b4f61771e697c4252160404e4f7b6ab7a3ada8704b16e4cb1240f2f6","observation_id":"18dd5306-cdcf-439e-8dd5-e8e43a1d79ed","resolution":{"observed_at":"2026-08-12T05:52:13.833912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.813452Z","title":"Motiongpt: Human motion as a foreign language,","venue":null,"work_id":"dd0ce50d-8802-47ed-bd0f-8b0aee1b5bb6","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.093718Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:902865f1af143ec74f4e2faa5ceea47d5929ef6afb9e2ad8ad8ebacd6b5493a2","observation_id":"816eed48-f234-4697-a6c7-5c6f33869717","resolution":{"observed_at":"2026-08-12T05:52:13.818484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.799022Z","title":"Action-conditioned 3d human motion synthesis with transformer V AE,","venue":null,"work_id":"dace5e35-478e-47df-9e98-71b3573c59e6","year":2021},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.098600Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:6de6969d2f733e2a2c6b8c108335f25d430da321c8171e3826d4e56a7379da72","observation_id":"c0381cc0-50e2-4687-a9fd-a03fbe246e0f","resolution":{"observed_at":"2026-08-12T05:52:13.803721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.784606Z","title":"Generating diverse and natural 3d human motions from text,","venue":null,"work_id":"37a21109-837c-48c6-a556-9a67ea1d912e","year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.102731Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:e809d44cff9a3686808722d1e893bad6879745d124893defdb9bd5d1e4474e07","observation_id":"9227a4cc-b078-4651-a79b-570e966861c3","resolution":{"observed_at":"2026-08-12T05:52:13.789156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.769622Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++,","venue":null,"work_id":"371188c4-662f-4a1a-9963-81413f4deda3","year":2021},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.106868Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:6a151f1349399134cafc50352810655d923c256ccf6e27fa6b2ae36edcfaeaea","observation_id":"76a6828a-2288-4956-bc74-258039c2a1c4","resolution":{"observed_at":"2026-08-12T05:52:13.774534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.111345Z","title":"Learning a bidirectional mapping between human whole-body motion and natural language using deep recurrent neural networks,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.111345Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:5d311b1777217074a4a115a47efcc5e04bfa2a29431119607dc47b09ad34119e","observation_id":"15e93ff4-bffe-4c01-9d22-5f0fb14eb114","resolution":{"observed_at":"2026-08-12T05:52:13.111345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.741817Z","title":"Temos: Generating diverse human motions from textual descriptions,","venue":null,"work_id":"93b494d9-4f18-4d91-b8b2-594d21852e6e","year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.116972Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:ab8c436e87df397afd29b7d9c46588d3b983c6d11bb40c4979bc1494bff2394d","observation_id":"2dfc77b6-ba03-43fd-ba42-7cf3aa5ecc76","resolution":{"observed_at":"2026-08-12T05:52:13.746973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.727308Z","title":"Linguistic descriptions of human motion with generative adversarial seq2seq learning,","venue":null,"work_id":"5b9b85d3-b1ed-4242-93af-f83e2163c254","year":2021},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.121395Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:65850abbf07b40e84965e94c95e4a845e56dfed14b5a9a4fad0dec78303161ea","observation_id":"00c411e7-cd4f-46bf-86eb-9769a044d2bc","resolution":{"observed_at":"2026-08-12T05:52:13.731906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.713822Z","title":"Fg-t2m: Fine- grained text-driven human motion generation via diffusion model,","venue":null,"work_id":"1739275e-bac1-49f9-a993-4dc85df6e906","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.125557Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:8f2f3bd52ce915b9ef41e8fa9a2c9f9e0ccfb5a40354b3fe09aba1830da5906a","observation_id":"9b058caf-2ce2-4b12-bff9-85123d7ceec6","resolution":{"observed_at":"2026-08-12T05:52:13.718462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.699619Z","title":"Paired recurrent autoencoders for bidirectional translation between robot actions and linguistic descrip- tions,","venue":null,"work_id":"ed9ba5b2-9cd3-4ef2-a4b8-c33eeffa5d37","year":2018},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.129942Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:1ac669f7e0eb76297ef222b796e05f02f97f1539eac5c6c8e3c9b8eb6ae2e660","observation_id":"a36e7c80-1eff-4eb8-85e2-0bc4dec77284","resolution":{"observed_at":"2026-08-12T05:52:13.704203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-08-18T19:51:48.688199Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-12T05:52:13.134606Z","title":"Scaling instruction-finetuned language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.134606Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:1d2728d8b82a4929633a5a365ca8fc316977121bd8dc91c3d543c691e81c78ea","observation_id":"2724f12c-55d6-4253-8c7b-0891979348aa","resolution":{"observed_at":"2026-08-12T05:52:13.134606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-12T05:52:13.139336Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.139336Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:6089eae1b710a13862fc3a92a18d27aaa6e13381b512028e6dd3e3f7717fcfcd","observation_id":"27c27e14-62ce-41cb-b80b-76fa27b9dd05","resolution":{"observed_at":"2026-08-12T05:52:13.139336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17448","last_updated":"2024-07-28T09:17:08Z","snapshot_observed_at":"2026-08-18T12:05:15.742048Z","submitted_at":"2023-09-29T17:58:06Z","title":"SMPLer-X: Scaling Up Expressive Human Pose and Shape Estimation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17448","snapshot_observed_at":"2026-08-12T05:52:13.144053Z","title":"Smpler-x: Scaling up expressive human pose and shape estimation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.144053Z"},"links":{"cited_paper":"/paper/2309.17448","citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:75aba7c811f5346eca1cac3f0ee847212af08f3ff6924bf7c1a6c31d16445bf9","observation_id":"9658c6fb-6cd7-42ac-91ad-34dca0279a29","resolution":{"observed_at":"2026-08-12T05:52:13.144053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-16T16:37:39.300058Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-12T05:52:13.148876Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.148876Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:829463d138529dc27e3be5c2f0ac608f052ee20de2dcea5f3b053f71f14f6d6e","observation_id":"a96f0d06-617e-46a7-9251-cd4b091a1fce","resolution":{"observed_at":"2026-08-12T05:52:13.148876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.684545Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"c16bfc6f-4cc2-4541-8555-9d6423c89c44","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.153475Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:98b3eb9a5ff2ffdf5a7cf2cad8b3ca7b8da55657398f0a4e4167411c46579459","observation_id":"6a47e63b-7aeb-4a43-b772-47b738dfea4c","resolution":{"observed_at":"2026-08-12T05:52:13.689629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.670020Z","title":"Mm-diffusion: Learning multi-modal diffusion models for joint audio and video generation,","venue":null,"work_id":"4f18d8ae-5c86-4c3a-b3b9-7b8b8c9eb6de","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.157727Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:fd202b2f1bc1d0df046ef6688f0dcea062f99ca286bf6622143635ec5485b05e","observation_id":"b2108a1a-b7a5-4d6e-8014-684dbe14b4b6","resolution":{"observed_at":"2026-08-12T05:52:13.674626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.655673Z","title":"One transformer fits all distributions in multi-modal diffusion at scale,","venue":null,"work_id":"89fe4147-ede4-47cd-bc26-1b8db91ac423","year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.162202Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:0fac1d481bdbff773141f6a246ce242da702888b79394241500d68302130619a","observation_id":"405e59fe-d1a7-42d2-8738-72f94624b9db","resolution":{"observed_at":"2026-08-12T05:52:13.660469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.640515Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":"7e8a8944-6d72-477f-8fd8-17a5db842463","year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.166574Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:4bd34feafb64e0cb986546211a3332b04266a3c0c751a3f8be5d262b87e471ad","observation_id":"d1eaf926-d43f-4f39-a598-0a7abe75fa1a","resolution":{"observed_at":"2026-08-12T05:52:13.645839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-20T12:00:24.760146Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-12T05:52:13.171240Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.171240Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:85968663c1f80689442ffee8606bc3d3657a5369402455dc7c4eef76f3066582","observation_id":"ef9f9af7-5ad0-4756-befd-c5c4039c7f6c","resolution":{"observed_at":"2026-08-12T05:52:13.171240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-12T05:52:13.175692Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.175692Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:334c2cfd88069582543682b66a44a574baf2ea1541850fc186951b8b0bbc6a7f","observation_id":"54fd7be5-824b-45b0-b9a5-03c0a5b5a574","resolution":{"observed_at":"2026-08-12T05:52:13.175692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.626075Z","title":"Improved denoising diffusion proba- bilistic models,","venue":null,"work_id":"de936cb4-de27-4c44-a256-6e0e2fe45bbc","year":2021},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.180170Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:46941e6880d145ec53c97be6927566654369459b2c9ff93cccd7b874384545fd","observation_id":"013937f0-d7c9-4e4b-895e-3d0673c3eb1c","resolution":{"observed_at":"2026-08-12T05:52:13.631117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.610245Z","title":"Motionclip: Exposing human motion generation to CLIP space,","venue":null,"work_id":"1f218fd3-6f37-491b-bdde-1895d190209e","year":2022},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.184514Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:436d475fbc4049763165eeb619220721d676df88ec7e05883b97601b110a507c","observation_id":"1e3e28b9-0fb0-4428-843b-874e7776a81c","resolution":{"observed_at":"2026-08-12T05:52:13.616164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.188715Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.188715Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:508d8db98504ca78a94683b8371d8c165802c6c5a46aadc2e66aa8121cbe0371","observation_id":"4cfa8e18-3109-4a53-aac8-d565338ad23a","resolution":{"observed_at":"2026-08-12T05:52:13.188715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.586204Z","title":"Attention is all you need,","venue":null,"work_id":"1b1d97fa-e9fc-4071-895a-2a2896c8602d","year":2017},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.193008Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:781aff4d7456a623e68d4918476687b84985abd2f37e78ba4d6e8bd528a60006","observation_id":"e36e5725-e577-40cf-b8d6-943c81844dd2","resolution":{"observed_at":"2026-08-12T05:52:13.590622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.571544Z","title":"A style-based generator architecture for generative adversarial networks,","venue":null,"work_id":"14534069-6e2e-41c3-8be3-42c46202dca1","year":2021},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.197528Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:4c753b26881e4d900812d1ecd2a5716d499b24a7ae67db5d002c3f55aa20ab2d","observation_id":"417c5097-5110-4e2c-829a-b3cbb4b10f5e","resolution":{"observed_at":"2026-08-12T05:52:13.576361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.201820Z","title":"Classifier-free diffusion guidance,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.201820Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:be282c2c17014f46823c7e91176361b3ecbaee3d4ffffa3015f9b8f4d2244d93","observation_id":"4f75b23c-44a4-49de-8d34-da62737508d2","resolution":{"observed_at":"2026-08-12T05:52:13.201820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.547258Z","title":"Bleu: a method for automatic evaluation of machine translation,","venue":null,"work_id":"20aef118-4a2e-4afe-882e-38fb58e1cdf5","year":2002},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.206756Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:ebb55bac9c4a89a69a06502425bd25e58b786a6b240b76d129322dc274d410ad","observation_id":"878afcdb-0196-41df-8c40-ac1aa34aa1b2","resolution":{"observed_at":"2026-08-12T05:52:13.552079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.211097Z","title":"Rouge: A package for automatic evaluation of summaries,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.211097Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:f1d78091a19e8b82914abba3ab64290c5c6868ebd704c6ad4f15522a3093eed1","observation_id":"b884c5ff-60dc-4a35-89f3-d87f9381cabe","resolution":{"observed_at":"2026-08-12T05:52:13.211097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.523296Z","title":"Cider: Consensus-based image description evaluation,","venue":null,"work_id":"8ae3644f-e9db-495b-ae71-7c813f4d9fc4","year":2015},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.215594Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:b63b580398bdc374eafd6ac1580d77510d2ed3a8728f202264c1173775020cac","observation_id":"c859f280-f889-47cd-9856-ab71d3252a93","resolution":{"observed_at":"2026-08-12T05:52:13.528297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.220087Z","title":"Bertscore: Evaluating text generation with BERT,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.220087Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:b9800c2944dddacae2905682ca77f1de462a0d87a384720b4dca58237aa19bc0","observation_id":"90621055-0ae4-42e4-b31e-873df0a3da8f","resolution":{"observed_at":"2026-08-12T05:52:13.220087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.498895Z","title":"SGDR: stochastic gradient descent with warm restarts,","venue":null,"work_id":"b3bfd16f-d6e0-4dbf-a940-f8dfb8fbab41","year":2017},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.224383Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:171fd4382a7f2dac866e1138490ee89e5f855f0b8576f362a56f468f9b728f5c","observation_id":"b538b436-b80f-4704-8914-6508e48ffca8","resolution":{"observed_at":"2026-08-12T05:52:13.503937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.483175Z","title":"Hutumotion: Human-tuned navigation of latent motion diffusion models with minimal feedback,","venue":null,"work_id":"0b2531f8-706c-4781-8ee0-a3e13b07166a","year":2024},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.228705Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:e2a6e586c892442f4ca11cd2d0cb4c9564c811f7958dc232c5af66626792df43","observation_id":"d1daaf47-3535-4b82-accb-64fbf2b41f8b","resolution":{"observed_at":"2026-08-12T05:52:13.488005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.233165Z","title":"Remodiffuse: Retrieval-augmented motion diffusion model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.233165Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:fd1239b7fc527289731dea02cc63127829bd4839cc97a340784e77c13c022a13","observation_id":"0929dd87-8ca2-4431-96d1-037f33542f8b","resolution":{"observed_at":"2026-08-12T05:52:13.233165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.468854Z","title":"Digital life project: Autonomous 3d characters with social intelligence,","venue":null,"work_id":"831c0be6-11fd-4204-8254-139b5878b3eb","year":2024},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.237866Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:9d10cc30bd0acede94c00ca3c2f206f25e9cf53ddcf458edf068969ea6af49de","observation_id":"19fd68b8-a457-41bf-a89c-ffc6768e0b38","resolution":{"observed_at":"2026-08-12T05:52:13.473565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T05:52:13.452640Z","title":"Momask: Generative masked modeling of 3d human motions,","venue":null,"work_id":"a7fca5fd-1d54-4868-95c9-e48384066019","year":2024},"citing_paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:13.242838Z"},"links":{"citing_paper":"/paper/2411.19786"},"observation_digest":"sha256:0dcaa365df2c255c2614b2b300c9c0d0ceba61a117e86962896283e767185b47","observation_id":"33edda76-76c3-4fee-b406-9ed37793acdc","resolution":{"observed_at":"2026-08-12T05:52:13.458886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19786","last_updated":"2024-11-29T15:48:24Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T21:37:59.381130Z","submitted_at":"2024-11-29T15:48:24Z","title":"MoTe: Learning Motion-Text Diffusion Model for Multiple Generation Tasks"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":30},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 7 inbound Pith citation observations for arXiv:2411.19786."}