{"as_of":"2026-08-10T13:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e37b04f5ceede65ce07a4c8de757d72da91d7ea168ee88ab1a0f08bd4bc6475","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T22:06:54.887927Z","state":"measured"},{"denominator":70,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":70,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T16:24:07.533226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T03:06:29.692095Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18898","snapshot_observed_at":"2026-08-03T16:24:07.533226Z","title":"Gesturelsm: Latent shortcut based co-speech gesture generation with spatial-temporal modeling.arXiv preprint arXiv:2501.18898, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.13840","last_updated":"2026-07-13T14:30:21Z","snapshot_observed_at":"2026-08-08T16:03:16.377859Z","submitted_at":"2025-12-15T19:22:40Z","title":"MoLingo: Motion-Language Alignment for Text-to-Human Motion Generation","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T16:24:07.533226Z"},"links":{"cited_paper":"/paper/2501.18898","citing_paper":"/paper/2512.13840"},"observation_digest":"sha256:96ed31e26083a8e7b795a62502c4c2675a9ee10fae3ae8a58665d89a196e5938","observation_id":"fd85416b-08b0-41ab-b5ea-7b50414bd5c9","resolution":{"observed_at":"2026-08-03T16:24:07.533226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"cited_work":{"arxiv_id":"2501.18898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18898","snapshot_observed_at":"2026-07-02T03:06:29.692095Z","title":"arXiv preprint arXiv:2501.18898 , year=","venue":null,"work_id":"ad325c60-8037-4d7d-83df-0981f98b980f","year":2025},"citing_paper":{"arxiv_id":"2605.06063","last_updated":"2026-05-09T20:43:51Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T11:46:15Z","title":"Reality Check: How Avatar and Face Representation Affect the Perceptual Evaluation of Synthesized Gestures","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-08T03:39:22.419881Z"},"links":{"cited_paper":"/paper/2501.18898","citing_paper":"/paper/2605.06063"},"observation_digest":"sha256:280e674480ee600d7d708dcb1ebc22fcedcb41eabc9edb81b41fe9859c5dc508","observation_id":"ddea5203-9589-4bda-8c20-036c43049e49","resolution":{"observed_at":"2026-05-11T22:01:11.047976Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"cited_work":{"arxiv_id":"2501.18898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18898","snapshot_observed_at":"2026-07-02T03:06:29.692095Z","title":"arXiv preprint arXiv:2501.18898 , year=","venue":null,"work_id":"ad325c60-8037-4d7d-83df-0981f98b980f","year":2025},"citing_paper":{"arxiv_id":"2605.06063","last_updated":"2026-05-09T20:43:51Z","snapshot_observed_at":"2026-07-06T23:18:36.537416Z","submitted_at":"2026-05-07T11:46:15Z","title":"Reality Check: How Avatar and Face Representation Affect the Perceptual Evaluation of Synthesized Gestures","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T02:19:11.967579Z"},"links":{"cited_paper":"/paper/2501.18898","citing_paper":"/paper/2605.06063"},"observation_digest":"sha256:706c7a186a9dae246b2310bf32f79b3ccf24bf428c00426e235fad20552f83b2","observation_id":"7f4801b6-c754-4a63-8bd7-c4e8186e4b7d","resolution":{"observed_at":"2026-05-12T02:21:16.775911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"cited_work":{"arxiv_id":"2501.18898","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.18898","snapshot_observed_at":"2026-07-02T03:06:29.692095Z","title":"arXiv preprint arXiv:2501.18898 , year=","venue":null,"work_id":"ad325c60-8037-4d7d-83df-0981f98b980f","year":2025},"citing_paper":{"arxiv_id":"2606.03874","last_updated":"2026-06-02T16:42:56Z","snapshot_observed_at":"2026-08-06T19:57:46.440518Z","submitted_at":"2026-06-02T16:42:56Z","title":"DyaPlex: Full-Duplex Speech-Motion Model for Dyadic Interaction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T10:22:30.431160Z"},"links":{"cited_paper":"/paper/2501.18898","citing_paper":"/paper/2606.03874"},"observation_digest":"sha256:71224c42f218a5e0d261c8e39ee0ebacc3340b9fb5a615ec41356ded0d78f8f2","observation_id":"7afbf16e-15e8-4d16-a9d1-74406252815a","resolution":{"observed_at":"2026-07-02T03:06:29.694605Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.18898/citation-record","integrity":"/paper/2501.18898/integrity","json":"/paper/2501.18898/citation-record.json","paper":"/paper/2501.18898"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.632864Z","title":"Stable Video Diffusion: Scaling Latent Video Diffusion Models to Large Datasets, 2023","venue":null,"work_id":"5a5c2c21-fc49-46ae-875f-c57a5701f263","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.686959Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:1280f53ccc43e8851c79a8b96c3e35580244988276e2e7859a6e6181a89dfe4b","observation_id":"637d77c7-32b8-4076-8cc1-0a86675c8eb2","resolution":{"observed_at":"2026-08-09T22:06:55.636490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.623472Z","title":"Nonver- bal Behaviors, Persuasion, and Credibility","venue":null,"work_id":"e7a2694b-6ecc-4bad-b70c-28508e898e1a","year":1990},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.690773Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:e7c4cb5aa681a8ee66ad4d9c7ab4296586bc56534a5a42d4019ecffed82c4944","observation_id":"5a082a49-65e1-458c-9e3e-62e226cec4a3","resolution":{"observed_at":"2026-08-09T22:06:55.626822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.613374Z","title":"Everybody Dance Now","venue":null,"work_id":"6231039f-3f2e-4626-a4d3-aa6363f0a3ba","year":2019},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.694173Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:14d034bfb5d27e5bf6d7f37df3d4d0b6c10d2b7e9fb935275b36eb9ae5f08293","observation_id":"6ed24e08-0c2d-4564-bd19-19e250ce5e0d","resolution":{"observed_at":"2026-08-09T22:06:55.616756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.603538Z","title":"Enabling synergistic full-body control in prompt-based co-speech motion generation","venue":null,"work_id":"54fbe888-7ea1-4b8a-a471-5ce361050417","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.697466Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:7686ea8132916a2baefe4b6943fb4ff17b8c9129b2ec8d250f120326ecad4c6e","observation_id":"3bf10411-b2dd-4e33-b467-ef1915b5701c","resolution":{"observed_at":"2026-08-09T22:06:55.607020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.700476Z","title":"DiffSHEG: A Diffusion-Based Ap- proach for Real-Time Speech-driven Holistic 3D Expression and Gesture Generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.700476Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:30c5146ca8712af5bcec401ead8fecfc596a1f38b049a9018eae35dd60d44049","observation_id":"841495ec-0992-4e87-8bbc-4a0821c32dd3","resolution":{"observed_at":"2026-08-09T22:06:54.700476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.587156Z","title":"WavLM: Large-Scale Self- Supervised Pre-Training for Full Stack Speech Processing","venue":null,"work_id":"d9e014fb-b4ae-4956-b060-cf6c922c6f65","year":2022},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.703474Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:8a2c8092c7c6a835bfa15feffb6262c8868b850a1237fadf7be4b8e362fd83d2","observation_id":"30eaaba3-2f89-4121-bfb3-748b25a7f51d","resolution":{"observed_at":"2026-08-09T22:06:55.590944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19759","last_updated":"2024-12-30T08:43:06Z","snapshot_observed_at":"2026-08-08T11:19:10.130010Z","submitted_at":"2024-04-30T17:59:47Z","title":"MotionLCM: Real-time Controllable Motion Generation via Latent Consistency Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19759","snapshot_observed_at":"2026-08-09T22:06:54.706587Z","title":"Motionlcm: Real-time control- lable motion generation via latent consistency model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.706587Z"},"links":{"cited_paper":"/paper/2404.19759","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:34f0fce536b3ef0a9877169b4942204a45de31ebcb37013538c38adfdc00250a","observation_id":"d83ab87a-ddfb-4016-9034-716a51e5215f","resolution":{"observed_at":"2026-08-09T22:06:54.706587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.577220Z","title":"The Interplay Between Gesture and Speech in the Production of Referring Expressions: Investigating the Tradeoff Hypothe- sis","venue":null,"work_id":"4497c407-7bd3-477d-87ba-d9211f58588a","year":2012},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.710168Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:c6a7cb892caaa0d00e82aefb75cfae6aa1ed91407cecaddfa290b4dceee38c62","observation_id":"54765c55-b93f-493a-a6d8-df82b0501609","resolution":{"observed_at":"2026-08-09T22:06:55.580515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.567486Z","title":"Diffusion-based co-speech gesture genera- tion using joint text and audio representation","venue":null,"work_id":"97ccd0a0-5697-47c6-962e-e1bc0154f222","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.713193Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:a9d136f63594f54316d10b959094d5729b8023eb07c8ea64a4a3020b27eaf3eb","observation_id":"aaf16f7d-bf14-4d5d-bfe0-7a3bb08be096","resolution":{"observed_at":"2026-08-09T22:06:55.570947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T22:06:54.716207Z","title":"BERT: Pre-Training of Deep Bidirectional Transformers for Language Understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.716207Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:df12b8ca7ab5231530c56bb069f86084f76d1524e5dcd2715867a36a1c08daef","observation_id":"44f4a4f2-2708-457a-84be-272c892807b3","resolution":{"observed_at":"2026-08-09T22:06:54.716207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.719776Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.719776Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:fa20f44eb8ee1bc51faa3ea5e30e5aa673054da259d8e88c7649073690aaf648","observation_id":"f726766b-00e7-4829-a445-30510941293c","resolution":{"observed_at":"2026-08-09T22:06:54.719776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.551717Z","title":"Scaling rectified flow trans- formers for high-resolution image synthesis, 2024","venue":null,"work_id":"ae652b14-58bc-40fa-b419-30940c76c2cb","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.722759Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:76bb256c895b86f76699df39ad7712e785ed3b34b34e9025f5c1f44ce52a820e","observation_id":"9837a269-ab17-49c2-8f2e-7f3c5c4f49b4","resolution":{"observed_at":"2026-08-09T22:06:55.555274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.542720Z","title":"One step diffusion via shortcut models, 2024","venue":null,"work_id":"6a4a8532-4280-409e-b47a-0af91b212cf9","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.725469Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:1a6197369b3c6e1e69f4ae401134684b2a3b194044a201d9af8d12849720d62c","observation_id":"c77b73ec-b354-4ef2-8416-a64ea7e21b20","resolution":{"observed_at":"2026-08-09T22:06:55.545844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.533675Z","title":"Eraseanything: Enabling concept erasure in rectified flow transformers","venue":null,"work_id":"17c7d8ca-49dc-49d7-b718-b364201848a6","year":2025},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.728178Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:4731db61c34c9323984de634c93d2c000472aad93cf2967579e0f799a3f4ec24","observation_id":"fdb0bb53-f0c6-4e5f-83bf-f1c4e5f6df8a","resolution":{"observed_at":"2026-08-09T22:06:55.536960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.524400Z","title":"Ginosar, A","venue":null,"work_id":"9ed67977-cfdf-44d3-9623-1a66590482b6","year":2019},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.731020Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:8694af7a37225f5dc1dd909612254ef32223d8ea82d82be0b592237a941738b9","observation_id":"9ed8d118-8a65-45e0-834f-004c4b279f97","resolution":{"observed_at":"2026-08-09T22:06:55.527499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.515203Z","title":"Momask: Generative masked model- ing of 3d human motions","venue":null,"work_id":"09a297db-d2f7-4e69-817f-321fed5838e2","year":1900},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.734221Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:aa141562e4593817747e8f7c9faf7767a36a48548ebd1f2050d02bc51ebeb487","observation_id":"81ad22ba-4613-4a10-a304-c74e5b2a7576","resolution":{"observed_at":"2026-08-09T22:06:55.518538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.06837","last_updated":"2021-02-13T01:05:39Z","snapshot_observed_at":"2026-07-06T10:41:00.261938Z","submitted_at":"2021-02-13T01:05:39Z","title":"Learning Speech-driven 3D Conversational Gestures from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.06837","snapshot_observed_at":"2026-08-09T22:06:54.737193Z","title":"Learning speech-driven 3d conversational gestures from video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.737193Z"},"links":{"cited_paper":"/paper/2102.06837","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:55eae3c3e4998aaf10c77cb8bccf82968ea017e382275c3f5d6752c9f9ef6623","observation_id":"d7427ef7-a4e0-45fe-8ef1-539d07cb259c","resolution":{"observed_at":"2026-08-09T22:06:54.737193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.506193Z","title":"Denoising diffu- sion probabilistic models, 2020","venue":null,"work_id":"b92b6e75-8da7-461f-a6ca-141e06dad93d","year":2020},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.740672Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:bcd393d1a92aa93faee0cef1c612f0169512c90a1879a9e38c4b903ef28e9032","observation_id":"ac5f981c-7fa8-4f31-b20c-9ef6b0c7b640","resolution":{"observed_at":"2026-08-09T22:06:55.509139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17117","last_updated":"2024-06-13T06:37:20Z","snapshot_observed_at":"2026-08-10T11:04:27.014526Z","submitted_at":"2023-11-28T12:27:15Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17117","snapshot_observed_at":"2026-08-09T22:06:54.744241Z","title":"Animate Anyone: Consistent and Controllable Image-to-Video Synthesis for Character Animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.744241Z"},"links":{"cited_paper":"/paper/2311.17117","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:6157230c92710386a31fd1950eb0852f0989bdb448506f528591bb2f599b78cd","observation_id":"a8af7099-0f85-4b23-a505-55a1750477b3","resolution":{"observed_at":"2026-08-09T22:06:54.744241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.496413Z","title":"Modeling and driving human body soundfields through acoustic primitives, 2024","venue":null,"work_id":"3550f1d3-b397-4628-a46c-a43fb3981237","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.747430Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:94a6370999e8c01df7bd217ec04d63e9a20797a9b4878b6add79f06d0fb5bead","observation_id":"68f4e74c-0cd4-42ae-904a-31b33401b8ac","resolution":{"observed_at":"2026-08-09T22:06:55.500361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.483662Z","title":"Autoregressive Image Generation Using Residual Quantization, 2022","venue":null,"work_id":"13fcbf95-86e5-4ff1-b6ea-1658029397a3","year":2022},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.750470Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:535661286ed41769cdfcc397441c0577850993e90380a26942629a94a2dfe99e","observation_id":"379df774-178b-4bd2-90ad-7b1cb603be65","resolution":{"observed_at":"2026-08-09T22:06:55.487530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.473432Z","title":"Improving the training of rectified flows, 2024","venue":null,"work_id":"a00c1a68-1dab-4f86-abf2-f830b78711c6","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.753381Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:21bb09c016fb4a350aba87ec8bf3e69c894d55cd8f6c11717bd487fda019170a","observation_id":"56ae1ec7-820e-467d-8131-3a731be96359","resolution":{"observed_at":"2026-08-09T22:06:55.476806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.463959Z","title":"Audio2gestures: Generating diverse gestures from speech audio with conditional varia- tional autoencoders","venue":null,"work_id":"321f31f7-360c-4f45-a3ee-6085fc458f0b","year":2021},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.756284Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:d37627f4511df841e70531a7bd4daba756bd6db84771ef5835ea16e75fa375ef","observation_id":"568cde0b-d341-4d88-9b57-c3a7b85ee2fc","resolution":{"observed_at":"2026-08-09T22:06:55.467114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.454086Z","title":"Set you straight: Auto-steering denoising trajectories to sidestep unwanted concepts, 2025","venue":null,"work_id":"4ac2ed2b-c7d8-4de3-ba66-0983aab2ce50","year":2025},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.759464Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:dba5bc1d0d1e360e41aba05cb61f18ada6c8b76986b29109410f75917bc748c4","observation_id":"0d24deb0-2043-419d-8bbb-7fbe14c42eb8","resolution":{"observed_at":"2026-08-09T22:06:55.457255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.444587Z","title":"AI Choreographer: Music Conditioned 3D Dance Generation with AIST++","venue":null,"work_id":"19fb4106-696d-47c8-89e1-4e4656a2c9dd","year":2021},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.762454Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:e37e9bfe4761e800ec26deed91c7740b170479802490d240d4410c13b8d0ace4","observation_id":"58f91817-ed80-4501-b264-21215d60d3cc","resolution":{"observed_at":"2026-08-09T22:06:55.447926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-02T18:24:58.914589Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-09T22:06:54.765513Z","title":"Flow Matching for Generative Modeling","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.765513Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:5a7f4b3c1f4b3763f8beea5a6c55318b8d3a640d698988b918b0c275f7baa7d4","observation_id":"1728fd61-8f87-4d1b-929e-8b309d1735e0","resolution":{"observed_at":"2026-08-09T22:06:54.765513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.435278Z","title":"DisCo: Disentan- gled Implicit Content and Rhythm Learning for Diverse Co- Speech Gestures Synthesis","venue":null,"work_id":"d91a101f-aa9a-46fb-9e50-09d221f4407c","year":null},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.769338Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:9667d0dbadc4e5c50de6fccd517e3136ffad52b165e0138621c58ee62413ff22","observation_id":"5116fdc1-5a4c-4075-9583-401ecb747f3a","resolution":{"observed_at":"2026-08-09T22:06:55.438437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05297","last_updated":"2022-09-20T05:44:29Z","snapshot_observed_at":"2026-07-06T12:46:23.306134Z","submitted_at":"2022-03-10T11:19:52Z","title":"BEAT: A Large-Scale Semantic and Emotional Multi-Modal Dataset for Conversational Gestures Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05297","snapshot_observed_at":"2026-08-09T22:06:54.772799Z","title":"9 BEAT: A Large-Scale Semantic and Emotional Multi-Modal Dataset for Conversational Gestures Synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.772799Z"},"links":{"cited_paper":"/paper/2203.05297","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:a825f9853b1a1738309b52aae8e00a1e9fc1c9ef88db0345552688499bac010a","observation_id":"422ac153-a138-4a25-9f3a-4540f888768c","resolution":{"observed_at":"2026-08-09T22:06:54.772799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00374","last_updated":"2024-03-30T04:15:34Z","snapshot_observed_at":"2026-08-07T04:03:42.224009Z","submitted_at":"2023-12-31T02:25:41Z","title":"EMAGE: Towards Unified Holistic Co-Speech Gesture Generation via Expressive Masked Audio Gesture Modeling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00374","snapshot_observed_at":"2026-08-09T22:06:54.776187Z","title":"EMAGE: Towards Unified Holistic Co- Speech Gesture Generation via Masked Audio Gesture Mod- eling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.776187Z"},"links":{"cited_paper":"/paper/2401.00374","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:8167cc330aee5db0880a9d4061d58c0255b8a25511b16c38d750cb99c6b67cd0","observation_id":"d896c8ca-c937-4397-864d-99078a18186e","resolution":{"observed_at":"2026-08-09T22:06:54.776187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04221","last_updated":"2024-10-05T16:30:46Z","snapshot_observed_at":"2026-07-06T19:28:26.436468Z","submitted_at":"2024-10-05T16:30:46Z","title":"TANGO: Co-Speech Gesture Video Reenactment with Hierarchical Audio Motion Embedding and Diffusion Interpolation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04221","snapshot_observed_at":"2026-08-09T22:06:54.779538Z","title":"Tango: Co-speech gesture video reenactment with hi- erarchical audio motion embedding and diffusion interpola- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.779538Z"},"links":{"cited_paper":"/paper/2410.04221","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:2aecf4a426e4bd4ff5ac75bb7f642253a4ec03afa72b92e49003cb5bc33c6f0b","observation_id":"69adc1e6-d90a-4afc-8edb-c2a8677e7f93","resolution":{"observed_at":"2026-08-09T22:06:54.779538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.783050Z","title":"Semges: Semantics-aware co-speech gesture genera- tion using semantic coherence and relevance learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.783050Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:2c59b8f72de34a8722e28be8f85e764788c6ceb3ccc0b09e52ec2608aba5f5d3","observation_id":"ba3e63c8-5161-4386-83a7-5733a2b0a3ff","resolution":{"observed_at":"2026-08-09T22:06:54.783050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.415362Z","title":"Intentional gesture: Deliver your intentions with gestures for speech, 2025","venue":null,"work_id":"bb633bee-05ce-4bb1-9c33-2797ca0217b7","year":2025},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.786015Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:21bbc5727940a1c2e536114e7486c7514da3e9ad4c51e96ad7fc2ea998cf05ff","observation_id":"54e4a74d-be3d-43ee-b232-bdd70226a08a","resolution":{"observed_at":"2026-08-09T22:06:55.418618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.404062Z","title":"Contextual gesture: Co- speech gesture video generation through context-aware ges- ture representation, 2025","venue":null,"work_id":"8d09ebb0-915d-4455-af41-0f9569fd0f6e","year":2025},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.789045Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:983608cc961e8565f3c7868e103025ffa6d7e61e44f6dacdc9430cafaf985a27","observation_id":"fa9593b5-2b2a-4cda-9240-ca5ce3d395c5","resolution":{"observed_at":"2026-08-09T22:06:55.407651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.394344Z","title":"Flow straight and fast: Learning to generate and transfer data with rectified flow, 2022","venue":null,"work_id":"f7d7fb46-a7a0-4c55-8276-c8a277a9a49b","year":2022},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.791964Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:52d38a9c916c7a69533ab75508124feb0aadd2fc28671ab07bcf0b1fae9a880a","observation_id":"182f8e85-7274-4125-9388-f8fb9c00d6b5","resolution":{"observed_at":"2026-08-09T22:06:55.397456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.384972Z","title":"Learning Hierarchical Cross-Modal Association for Co-Speech Gesture Generation","venue":null,"work_id":"e045cbec-0a19-4624-898a-c3036360bb0a","year":2022},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.794981Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:e7641a240738e7986480013c1c501dd48e718894f97bf9ea2d9a6604e5895867","observation_id":"1eb41990-733d-432d-b42f-3ed6cb5766a9","resolution":{"observed_at":"2026-08-09T22:06:55.388270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.797819Z","title":"Instaflow: One step is enough for high-quality diffusion- based text-to-image generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.797819Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:ae87984bb0eb29d8e71fc1fbf69e3563fb746025e12405ec447e1adfefb45edf","observation_id":"ca132df2-8a79-4611-98b8-11cd3bc42eec","resolution":{"observed_at":"2026-08-09T22:06:54.797819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00368","last_updated":"2024-04-15T11:18:00Z","snapshot_observed_at":"2026-07-30T12:23:29.730861Z","submitted_at":"2024-03-30T13:41:57Z","title":"Towards Variable and Coordinated Holistic Co-Speech Motion Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00368","snapshot_observed_at":"2026-08-09T22:06:54.800710Z","title":"Towards variable and coordinated holistic co-speech motion generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.800710Z"},"links":{"cited_paper":"/paper/2404.00368","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:c75e842b2435d4e4aa407729a0c814bd41a2e28e7f184be1ec104d604fe7fa03","observation_id":"c26b7603-ec1b-4614-9746-d89b6c0a0df7","resolution":{"observed_at":"2026-08-09T22:06:54.800710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.369699Z","title":"Tf-icon: Diffusion-based training-free cross-domain image composi- tion","venue":null,"work_id":"1f916a48-0d64-45a6-a846-987329b56b2b","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.803883Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:a820776e33b5e1f3223f235a5cac5a7002757d63ea1c22a240c9c2ab2f5a3733","observation_id":"0c84542d-725c-42eb-a9fb-d58fba833d90","resolution":{"observed_at":"2026-08-09T22:06:55.372749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.360613Z","title":"Mace: Mass concept erasure in diffusion models","venue":null,"work_id":"c4d0fa67-1ee0-41f1-bbbb-664ffe3572fc","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.806870Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:fda38c78f59d5baa554047e4997fb4930c99544f17980244a26e07fe41dc4752","observation_id":"2944c756-ae37-4293-ac49-ad9df169b087","resolution":{"observed_at":"2026-08-09T22:06:55.363735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18775","last_updated":"2025-03-15T02:23:29Z","snapshot_observed_at":"2026-08-08T00:19:54.445400Z","submitted_at":"2024-10-24T14:28:32Z","title":"Robust Watermarking Using Generative Priors Against Image Editing: From Benchmarking to Advances","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18775","snapshot_observed_at":"2026-08-09T22:06:54.809929Z","title":"Robust watermarking using generative pri- ors against image editing: From benchmarking to advances","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.809929Z"},"links":{"cited_paper":"/paper/2410.18775","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:e2b88be84010ca99b1545845789f28a2d2981694cbf12beda30151298bb9472b","observation_id":"07fcb2ac-0a53-417f-a035-6933fb22f84c","resolution":{"observed_at":"2026-08-09T22:06:54.809929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04378","last_updated":"2023-10-06T17:11:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-06T17:11:58Z","title":"Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04378","snapshot_observed_at":"2026-08-09T22:06:54.813050Z","title":"Latent consistency models: Synthesizing high- resolution images with few-step inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.813050Z"},"links":{"cited_paper":"/paper/2310.04378","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:91613cd78e11c07967135dd759717d1f7032163c135007ff790810e442cfea61","observation_id":"d8d5f3d5-3454-423e-a64f-1bcd3178db41","resolution":{"observed_at":"2026-08-09T22:06:54.813050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15032","last_updated":"2025-05-30T15:03:44Z","snapshot_observed_at":"2026-08-09T12:51:24.259479Z","submitted_at":"2024-12-19T16:44:01Z","title":"DCTdiff: Intriguing Properties of Image Generative Modeling in the DCT Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15032","snapshot_observed_at":"2026-08-09T22:06:54.816203Z","title":"Dctdiff: Intriguing properties of im- age generative modeling in the dct space","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.816203Z"},"links":{"cited_paper":"/paper/2412.15032","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:16406e5f579eea79db98c8e43832e99bf21fb7076727f56e6dd43454e5b8c1d2","observation_id":"d39aa1b6-656e-47b5-a7ec-5e9b119384a2","resolution":{"observed_at":"2026-08-09T22:06:54.816203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.350495Z","title":null,"venue":null,"work_id":"d44131ab-b06b-465f-a7b3-0df5c405d135","year":2019},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.819510Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:745ec56839e53c2769a674d0437947349610def3a07bd4d202f2eaf1106dbe42","observation_id":"d3e1d58f-dcdc-4c86-99a4-6d57577bb4cf","resolution":{"observed_at":"2026-08-09T22:06:55.353523Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.340511Z","title":"MM-Diffusion: Learning Multi-Modal Diffusion Models for Joint Audio and Video Generation","venue":null,"work_id":"ba93fa9d-53ee-40ea-a58d-7aaa77dc1029","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.822378Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:5257b95ba6cb7b6da5e3cba93e521aaed084be3d0f71eee0a2af125a62e0ec56","observation_id":"2209d4d5-50e2-4571-a7bf-79ab993047ac","resolution":{"observed_at":"2026-08-09T22:06:55.343642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.330566Z","title":"Fast high- resolution image synthesis with latent adversarial diffusion distillation","venue":null,"work_id":"7d55a201-458c-40f1-8b00-10c8855420be","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.825093Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:e86c0aacd34a9245d339a2487f53117e72902289e223a83dc184d46cb569c190","observation_id":"b0f3a893-4573-4d70-bea3-53d438d6984b","resolution":{"observed_at":"2026-08-09T22:06:55.333948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.320546Z","title":"Talking face video generation with editable expression","venue":null,"work_id":"ef1a8d7c-8fb2-4252-9f8a-898b9abc6a6b","year":2021},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.827824Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:b0855f51524c2bb13bd8893ca416e4098e725bd62c4fb3f9a530af6e57e83147","observation_id":"d99ad8c5-b5fd-4c17-9887-06c79f954712","resolution":{"observed_at":"2026-08-09T22:06:55.323884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.311234Z","title":"Fsft-net: face transfer video generation with few-shot views","venue":null,"work_id":"6feb84c3-6dfb-4043-9d5f-899743d7a137","year":2021},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.830773Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:a8f03504702a181edd8f0b3d962e2313686a686e3492ed4063090cb3a66e254e","observation_id":"e28b0df6-1c6b-45c8-9190-83ca8a846444","resolution":{"observed_at":"2026-08-09T22:06:55.314573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.301526Z","title":"Emotional listener portrait: Neural lis- tener head generation with emotion","venue":null,"work_id":"568fd9d9-109c-44c6-88a3-1359cd98f876","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.833651Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:223c97fc8420953f4c84419bdca2b7a200c08f518c4561f842a4d6e953fc4645","observation_id":"e3d5744c-14a3-4117-8015-8f5437e7659c","resolution":{"observed_at":"2026-08-09T22:06:55.304564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.292173Z","title":"Texttoon: Real-time text toonify head avatar from single video","venue":null,"work_id":"9b1fbb3b-4192-4c3f-8950-48cc9e03a8de","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.836452Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:478e4387c3c58637bb664378a60901df99a0c5f57e10d5ef2e88a3a8c711e64e","observation_id":"179a2de4-7b0f-4bf7-b714-6e502b61acfc","resolution":{"observed_at":"2026-08-09T22:06:55.295521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.282211Z","title":"Tri 2-plane: Thinking head avatar via fea- ture pyramid","venue":null,"work_id":"f3ae90ce-4ae4-4e99-8045-4f9b7c61a15b","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.839250Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:17c294834e16ef7b28fe8843cfc0d701b53c6bd9b7f95c77da6ac32b047a0c45","observation_id":"4ed8c51d-25b6-4447-a1d9-0742cd9d9add","resolution":{"observed_at":"2026-08-09T22:06:55.285873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.270681Z","title":"Adaptive super resolution for one-shot talking-head genera- tion","venue":null,"work_id":"dfb4097d-002b-4d1e-8de8-d26e9b0f8f11","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.842320Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:3b3f1e17d9edc788bbd333b75a58be8d19688aa6152575337bae35c97b56d777","observation_id":"47e1e9da-1858-494a-a880-f463b87a7e61","resolution":{"observed_at":"2026-08-09T22:06:55.274157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01469","last_updated":"2023-05-31T06:17:10Z","snapshot_observed_at":"2026-07-06T14:58:02.852672Z","submitted_at":"2023-03-02T18:30:16Z","title":"Consistency Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01469","snapshot_observed_at":"2026-08-09T22:06:54.845059Z","title":"Consistency models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.845059Z"},"links":{"cited_paper":"/paper/2303.01469","citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:e9a5944ad7a72ba6e32e7b5f5d4d8560b23eaf64a23c1de50a13b2e3873bd273","observation_id":"c68fbbdb-688b-439b-a4b9-d23e3876dab3","resolution":{"observed_at":"2026-08-09T22:06:54.845059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.848096Z","title":"Generative ai for cel- animation: A survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.848096Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:0f14c078fc28246c441571e1f8be0eac55e78278390848b6a2832a4965846fad","observation_id":"6103794e-2834-49a4-a325-fc6be3e0c102","resolution":{"observed_at":"2026-08-09T22:06:54.848096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.260191Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"ac754b53-9b4c-45a4-9de4-716c11017fdc","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.851533Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:14c17484e3cfa4a36f83ee119a991a2c2601a37bc6456313ad77f95fe8e279ea","observation_id":"e82fde43-8164-498b-81e6-04fb3d647794","resolution":{"observed_at":"2026-08-09T22:06:55.263654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.854414Z","title":"Rectified diffusion: Straightness is not your need in rectified flow, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.854414Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:2c30b06789aa0e9556b7657976ef23d430d89a2e9c175115d822cfba488e4ea6","observation_id":"f583dae9-6b0b-4394-8682-ff72135f8e3b","resolution":{"observed_at":"2026-08-09T22:06:54.854414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.242119Z","title":"High-Resolution Im- age Synthesis and Semantic Manipulation with Conditional GANs","venue":null,"work_id":"f1fa2254-7895-4e9e-86e4-0a99068af7a5","year":2018},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.857488Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:ff5f94a6f08727c6376456d586a260e00fbadea1cccd2136b062974f378cdb3a","observation_id":"cbf548e5-b55c-47ec-a3de-dddc717326dc","resolution":{"observed_at":"2026-08-09T22:06:55.245732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.232453Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior","venue":null,"work_id":"fe26ffd1-b85f-4403-87a0-219215f830b8","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.860587Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:4dab5013743e3dffb19c9f42fba2e9a0f1ecb4a2160640f0c8cfb6965ebfdaa9","observation_id":"786cbaae-f059-4f48-9c95-fa881fd781c9","resolution":{"observed_at":"2026-08-09T22:06:55.235619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.863520Z","title":"Chain of generation: Multi-modal gesture synthesis via cascaded conditional control, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.863520Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:932ef9790a4a1bbd4576337ad84f975262cf60b856b1b3d89133f1a1d0f922af","observation_id":"845aa018-0f1b-4530-b1bf-d44075617c81","resolution":{"observed_at":"2026-08-09T22:06:54.863520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.216715Z","title":"Mambatalk: Ef- ficient holistic gesture synthesis with selective state space models, 2024","venue":null,"work_id":"79ac05a6-7aef-4d2b-b1e8-81be364027da","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.866681Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:4f783c5cdb15f134eadcaafbeb7f512fcea1224a2bfcc558cca1e98c2baa18cd","observation_id":"231c510e-48ec-4ce0-b892-cae56c00f4f9","resolution":{"observed_at":"2026-08-09T22:06:55.219864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.207347Z","title":"Generating Holistic 3D Human Motion from Speech","venue":null,"work_id":"76508157-036d-456a-bf5f-3b3c0de8a475","year":2023},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.869588Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:19ee9f3d7aa905d1f8b6f8bf61afa18a7b6e1a431e446fb19aa571accce08770","observation_id":"0496e81e-0b8b-43f1-9a89-0306db409c92","resolution":{"observed_at":"2026-08-09T22:06:55.210578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.872671Z","title":"One-step diffusion with distribution matching distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.872671Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:794a774d3007713e61c89d42364a176fcf68ebdcc1a7b849b9e7717200a257a1","observation_id":"89cb8a26-edeb-4562-97fa-7e438cf976e6","resolution":{"observed_at":"2026-08-09T22:06:54.872671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.189905Z","title":"Speech Ges- ture Generation from the Trimodal Context of Text, Audio, and Speaker Identity","venue":null,"work_id":"3b4a422e-b9fb-49fc-938c-4da0873c54a8","year":2020},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.875804Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:0e633e0d4e3ed8d5e246bba7348ad684f02d3ad43d9ebbd72748ce8f78f0ddd2","observation_id":"20ac6884-6604-479d-a8de-8b4640fc453a","resolution":{"observed_at":"2026-08-09T22:06:55.193366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:54.878794Z","title":"Kinmo: Kinematic-aware human motion understanding and generation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.878794Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:393d9b8028808eeecbe6b68786bd290a1760a329c86e333db1b4502b05423522","observation_id":"d8da7915-5de4-4030-b594-491fa069e379","resolution":{"observed_at":"2026-08-09T22:06:54.878794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.172387Z","title":"Semantic gestic- ulator: Semantics-aware co-speech gesture synthesis, 2024","venue":null,"work_id":"c9047bd0-89ed-434c-94fb-db289059adab","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.881930Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:46e8b54a55311e78664cd0b25e08f0c77d7b812d33fe87c9d11cb39507332902","observation_id":"e51e51d7-7dc0-496b-8b3a-16a497c7d6ff","resolution":{"observed_at":"2026-08-09T22:06:55.175575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.162292Z","title":"Slimflow: Training smaller one-step diffusion models with rectified flow, 2024","venue":null,"work_id":"9f0a4726-694b-4c36-bd7b-38747b256d32","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.884864Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:62bc9dda160d2fca689d1146d159e7ff836b48f7741c9915454a594cdc6b16f0","observation_id":"8f2aef97-122d-4bef-a7b1-91da7177a8f1","resolution":{"observed_at":"2026-08-09T22:06:55.165417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T22:06:55.150235Z","title":"Oftsr: One-step flow for image super- resolution with tunable fidelity-realism trade-offs, 2024","venue":null,"work_id":"15441c62-b789-4d34-8067-ae924cf89752","year":2024},"citing_paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-09T22:06:54.887927Z"},"links":{"citing_paper":"/paper/2501.18898"},"observation_digest":"sha256:8e200addd1c4c2aa4b44245c861e87425a3467867708aedb323b6756215885a2","observation_id":"965b128b-ec83-4191-a037-db4d3d5a7a69","resolution":{"observed_at":"2026-08-09T22:06:55.155249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.18898","last_updated":"2025-08-03T07:25:09Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T11:06:25.270983Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 4 inbound Pith citation observations for arXiv:2501.18898."}