{"as_of":"2026-08-19T21:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f34e36dfca067b16ae918ed76ce52962f362b62b6811d2ad312c0a4b72f3750c","coverage":[{"denominator":72,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":72,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:11:01.223944Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01643/citation-record","integrity":"/paper/2608.01643/integrity","json":"/paper/2608.01643/citation-record.json","paper":"/paper/2608.01643"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.344842Z","title":"ACM Transactions on Graphics (TOG)42(4), 1–20 (2023)","venue":null,"work_id":"d88bcd3f-330e-4e46-b58e-751730f7e89d","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.965741Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:4ccc9dc443cde08f93fda140dbd2e30124d4c538c6d1a2907dade6d58238c0fe","observation_id":"f231a1f8-89c1-42da-837b-44a3fce8a300","resolution":{"observed_at":"2026-08-15T15:11:02.348417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.332892Z","title":"ACM Transactions on Graphics (TOG)42(4), 1–18 (2023)","venue":null,"work_id":"0e303fe3-812d-47d5-b1f6-07ad43d41268","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.969856Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:29fa51d2899030b7adb91f67ffa446ebb89a8f3a942b146c8fb59c3548abb55a","observation_id":"ba958df2-c5ae-4a1d-a856-98cb0fd4ecd2","resolution":{"observed_at":"2026-08-15T15:11:02.336528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:00.973790Z","title":"In: 2022 International Conference on 3D Vision (3DV)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.973790Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:17dbb958b8d0edc85c21f37f844caafb0280872f8b4e2013c4eeb63aafbec37e","observation_id":"ece61bbe-4283-40dc-b2e5-5a9e8cc7eeb2","resolution":{"observed_at":"2026-08-15T15:11:00.973790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.312513Z","title":"In: Proceedings of the 32nd ACM International Conference on Multimedia","venue":null,"work_id":"63d1a773-832e-4d57-81b3-b194eeff9ecb","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.977519Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a8a1d58bed4530f690c833183963be22d60d8ddf7c4c1d3517a9b4c50ff3b525","observation_id":"c314608e-f80f-40da-843b-deb89553bd74","resolution":{"observed_at":"2026-08-15T15:11:02.316102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21904","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.703970Z","title":"arXiv preprint arXiv:2601.21904 (2026)","venue":null,"work_id":"3e436548-5450-437d-8ecb-841245baa4d3","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.981512Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:616dd7b4c4747ca040a6dc50b9d277042238a36fc36487bddd5c69ffc9a569d1","observation_id":"e64a283c-2821-456f-a5ed-3cf4e95c6efb","resolution":{"observed_at":"2026-08-15T15:11:01.710776Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.300336Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"f13dea17-2ef1-4430-942e-60c845618e4c","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.985110Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:cf72118b37157694e965a76b6f688242d9d75f5ab96c3b31a722b9a7aee8cefb","observation_id":"3760eca4-e2ed-4292-a9c0-bdb7b16a9019","resolution":{"observed_at":"2026-08-15T15:11:02.304191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.287459Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"5f556add-9cae-4d9d-9780-2e06152e749a","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.989348Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:6cac50ed65ed5d1387b1678f75fd5657d83a03d0729d524b044e470a487431ac","observation_id":"3a6ceb81-def2-4807-afd2-2aaf7b03539c","resolution":{"observed_at":"2026-08-15T15:11:02.291247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.275296Z","title":"IEEE Journal of Selected Topics in Signal Processing16(6), 1505–1518 (2022)","venue":null,"work_id":"d17d4f3d-755a-4911-a92d-f47ec94dad60","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.993341Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:f259437b78b6e61c0087af75bd84a98deef02a77818fd72ebd5f01b3015d3dea","observation_id":"a3f798fd-f825-424a-94a9-a599b8ce95f6","resolution":{"observed_at":"2026-08-15T15:11:02.279215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.08729","last_updated":"2026-06-29T11:45:55Z","snapshot_observed_at":"2026-08-12T18:43:13.847795Z","submitted_at":"2026-05-09T06:32:54Z","title":"Unison: Harmonizing Motion, Speech, and Sound for Human-Centric Audio-Video Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.08729","snapshot_observed_at":"2026-08-15T15:11:00.997153Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:00.997153Z"},"links":{"cited_paper":"/paper/2605.08729","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:d9fb5011a9b8d526bca2cc322e891678d333709216cb5be58b564f9e371baff5","observation_id":"c14cbf7d-37e6-46ac-a6e1-0cc9aeef611d","resolution":{"observed_at":"2026-08-15T15:11:00.997153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2025.36323","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.623298Z","title":"IEEE Transactions on Circuits and Systems for Video Technology36(4), 4550–4564 (2025).https: //doi.org/10.1109/TCSVT.2025.3632359","venue":null,"work_id":"6ae99fcc-2cc2-4f84-84da-6be91b177f12","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.001193Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:eff0d29d52c52cc1a820598edc79d42019b24644a45c96021824017c78126bd1","observation_id":"09e53e62-e6ce-4c53-a459-3d4c49a54798","resolution":{"observed_at":"2026-08-15T15:11:01.629829Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13229","last_updated":"2025-03-17T14:42:31Z","snapshot_observed_at":"2026-08-18T06:45:54.895248Z","submitted_at":"2025-03-17T14:42:31Z","title":"HoloGest: Decoupled Diffusion and Motion Priors for Generating Holisticly Expressive Co-speech Gestures","version":1},"cited_work":{"arxiv_id":"2503.13229","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.13229","snapshot_observed_at":"2026-08-15T15:11:01.549274Z","title":"HoloGest: Decoupled Diffusion and Motion Priors for Generating Holisticly Expressive Co-speech Gestures","venue":"cs.CV","work_id":"21804a07-b78b-44b9-bed3-5bce1dcf6df2","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.004675Z"},"links":{"cited_paper":"/paper/2503.13229","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:3b84e249c9bfbcf8700ce457fe096724b238c5fd5d249107fa8d69b740b588d5","observation_id":"a025ef98-ebc0-43af-9879-3819e9a4335d","resolution":{"observed_at":"2026-08-15T15:11:01.552966Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.262792Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"b7a275ce-f93e-42d2-affe-252bf6b2d0e2","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.008523Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:418fa9374c187def2e1ebf9fd7cac94aeb960fe62cde45c1290e49dd70a1be4e","observation_id":"2fbf7431-5d0f-439b-904a-aef1fa3d6941","resolution":{"observed_at":"2026-08-15T15:11:02.266879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.250707Z","title":"In: Proceedings of the 21st ACM International Conference on Intelligent Virtual Agents","venue":null,"work_id":"42c50c90-1e8a-40f2-a82e-8179def7b402","year":2021},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.012092Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:ad622900ba33997a8a936c654ffc7e1bb90c3869015e1fd4a285614072576546","observation_id":"cbd23129-9630-4464-a317-5f989bb28840","resolution":{"observed_at":"2026-08-15T15:11:02.254365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.238723Z","title":"ACM SIGGRAPH Computer Graphics21(4), 215–224 (1987)","venue":null,"work_id":"8b061d43-b859-4231-8684-07c77054fbd1","year":1987},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.015298Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:49b02aeac956cd878a912d733e174b9e68eefaa6adf0e8aeb0059776c96713ca","observation_id":"78edb32b-1af9-4970-aa92-ba7bef1c3e5b","resolution":{"observed_at":"2026-08-15T15:11:02.242355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.018640Z","title":"In: Proceedings of the IEEE/CVF conference on com- puter vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.018640Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:8dd8699668f879e9ac93c282e6205957eeff4029a9ab666e6f4a2d7ceabd9715","observation_id":"80808ac3-8dff-4579-9b22-7571cf8a0d3e","resolution":{"observed_at":"2026-08-15T15:11:01.018640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.217938Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"c94610d2-fb41-4e01-8aa3-5da7ef8a6cc8","year":2021},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.021885Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1c9cceaaa64ca83c40da2f8aef5b4d28a0ce1d1126f9130bafc81c4be4cca48c","observation_id":"cac5b2a8-4678-4ffa-92fc-d90df6d8c742","resolution":{"observed_at":"2026-08-15T15:11:02.221988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.206106Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"7a8de860-8ced-4668-a664-5f09eca1df9d","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.025201Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:694af5aa5f50bab0a5ba235395fb0de13c1259c005c6ef90f5ea456f5b27350b","observation_id":"6a2671c4-49c1-4db9-b2ed-9e0c453ce5a4","resolution":{"observed_at":"2026-08-15T15:11:02.209782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.028620Z","title":"In: Proceedings of the IEEE/CVF international conference on computer vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.028620Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:3e4f9c87da128d7bd45a327ae11964e299d317fd39eaf2539a59617b7e50d08b","observation_id":"f0e19a63-a995-4a13-b0ad-d93fc90f18c5","resolution":{"observed_at":"2026-08-15T15:11:01.028620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.05363","last_updated":"2018-07-09T21:23:27Z","snapshot_observed_at":"2026-08-14T20:47:06.603602Z","submitted_at":"2017-07-17T18:45:29Z","title":"Auto-Conditioned Recurrent Networks for Extended Complex Human Motion Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.05363","snapshot_observed_at":"2026-08-15T15:11:01.032190Z","title":"arXiv preprint arXiv:1707.05363 (2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.032190Z"},"links":{"cited_paper":"/paper/1707.05363","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:4eb1dcdd5316336a3fad06aa9cda4e461bc0eb8f4802c574ca699ea1fc1f15c4","observation_id":"302aa36f-5758-475b-8dd4-0e40d3fd5267","resolution":{"observed_at":"2026-08-15T15:11:01.032190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02747","last_updated":"2023-02-08T15:46:05Z","snapshot_observed_at":"2026-08-16T02:30:42.660030Z","submitted_at":"2022-10-06T08:32:20Z","title":"Flow Matching for Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02747","snapshot_observed_at":"2026-08-15T15:11:01.036380Z","title":"arXiv preprint arXiv:2210.02747 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.036380Z"},"links":{"cited_paper":"/paper/2210.02747","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:87384592ddd92d39a9dc8573e90bdad922f170c3d8c7cbb0f53d765dff56fd8f","observation_id":"66e7b7eb-b1cc-4330-8c6b-ca3c1d0915a1","resolution":{"observed_at":"2026-08-15T15:11:01.036380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.185904Z","title":null,"venue":null,"work_id":"2b9dcb7c-6cad-4d39-8021-fac4d176ce6f","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.040092Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:9951f0ec08280687cf95afcb686c52226a6781ed66229edc9bfdd9ffbc3a68b0","observation_id":"7ff06b55-059b-47d7-a51b-7711d5837785","resolution":{"observed_at":"2026-08-15T15:11:02.189539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.173966Z","title":"In: Proceedings of the StreamTalk 17 IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"457198c5-ba36-4e45-a39c-3dd5751eaf11","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.043430Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:aff81834bb51dec77ab1d58565c8a9ed9b81f854dde62d65f5d5905bc9f45c6c","observation_id":"2e231848-a9df-4c73-9e68-766eccb0460a","resolution":{"observed_at":"2026-08-15T15:11:02.177861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.161358Z","title":"In: European conference on computer vision","venue":null,"work_id":"d59236d5-56f8-4cf0-83c7-155ece9b804b","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.047281Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:2cc77e730cef1289c9b480f160e7032cb168b6d25b535726a16d9be456c84ba2","observation_id":"bc724148-f9a2-4069-a269-415d8e82c9d3","resolution":{"observed_at":"2026-08-15T15:11:02.165358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.147198Z","title":"In: Proceed- ings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"1a42efc1-3d10-4086-820b-426ca36ca14d","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.050621Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:765332b71f6d47463d8e54a46260af95c66ccbc9211649a83ae2d387f9033924","observation_id":"8aa37d98-7373-429d-b6bb-8890e3141b72","resolution":{"observed_at":"2026-08-15T15:11:02.152074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18898","last_updated":"2026-08-15T03:16:14Z","snapshot_observed_at":"2026-08-19T20:12:14.543078Z","submitted_at":"2025-01-31T05:34:59Z","title":"GestureLSM: Latent Shortcut based Co-Speech Gesture Generation with Spatial-Temporal Modeling","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18898","snapshot_observed_at":"2026-08-15T15:11:01.054073Z","title":"arXiv preprint arXiv:2501.18898 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.054073Z"},"links":{"cited_paper":"/paper/2501.18898","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:07dd12d030a1c6826e805a0230a551cfc76b538b480577ef60dcac64c7d5eaa8","observation_id":"83c747bf-06e1-44a0-88b9-e0d324969730","resolution":{"observed_at":"2026-08-15T15:11:01.054073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.134325Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"69a846a5-043a-45ac-8e98-24da963722e2","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.058343Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a742b1d45783824fa0767519eb4e7adfeee2b44ff31136dfc9d6211d0af367f1","observation_id":"172cefa1-6e5b-4148-8a2b-7c326c9ff909","resolution":{"observed_at":"2026-08-15T15:11:02.137996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.122080Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Conference","venue":null,"work_id":"12d502ef-71af-4287-b119-865a367fc63b","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.061646Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a0358e280c398458ea9af35f56771bad187bccead031f1f3f7d4f7249c13b655","observation_id":"2efac800-e169-4cd0-9ab9-3da51c326392","resolution":{"observed_at":"2026-08-15T15:11:02.125915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.104170Z","title":"In: IEEE Conference on Computer Vision and Pattern Recognition (2024)","venue":null,"work_id":"d5d5dcf2-7723-49f6-b3d6-5ca782fbcb45","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.065104Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:e7fc807623ae508d45b2c5b29b949d70a82a951e812319de565e77a9caf1c5a0","observation_id":"6f247428-3df1-4fdd-89cd-01e014d5aacc","resolution":{"observed_at":"2026-08-15T15:11:02.109758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.068705Z","title":"arXiv preprint arXiv:2602.18432 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.068705Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:73ce41773a9aaa407f7e07236e8add93ac53fb7a305a087b0c8c7d90394807d9","observation_id":"4e564fe0-bed8-4957-a338-ce6e7fe1677c","resolution":{"observed_at":"2026-08-15T15:11:01.068705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.092186Z","title":"IEEE Transactions on Visualization and Computer Graphics (2024)","venue":null,"work_id":"126f2e95-3b74-4458-b227-c3cc6d16c581","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.073022Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:50b02a1080cd97584d02106e3a2e5c8ad28abe67e641d899cd856b5886642120","observation_id":"33a83c36-f51d-43e6-8794-40176a44826d","resolution":{"observed_at":"2026-08-15T15:11:02.095859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.076322Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.076322Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:2289979df0268f4028ac73e408ea0cb08d932231fc38985935d8af1fceebc1fb","observation_id":"11a82578-a28d-4c20-a860-a9682a674e90","resolution":{"observed_at":"2026-08-15T15:11:01.076322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.080067Z","title":"In: Proceedings of the AAAI conference on artificial intelligence","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.080067Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b4a99c71839d4b940ea17ad16d90214cb6572201d3441b99771591ca5d16625b","observation_id":"c9a055a4-edc4-4fdd-9906-10ef2cd6acd8","resolution":{"observed_at":"2026-08-15T15:11:01.080067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01418","last_updated":"2023-08-30T04:41:10Z","snapshot_observed_at":"2026-08-16T15:51:18.051527Z","submitted_at":"2023-03-02T17:09:27Z","title":"Human Motion Diffusion as a Generative Prior","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01418","snapshot_observed_at":"2026-08-15T15:11:01.083686Z","title":"arXiv preprint arXiv:2303.01418 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.083686Z"},"links":{"cited_paper":"/paper/2303.01418","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:920346b3332ec6a1ee0545bebcdb943672c95b40b7f11e72955ea87bc62c586b","observation_id":"990c04d9-6c12-4c4d-b61a-5e309624f8d3","resolution":{"observed_at":"2026-08-15T15:11:01.083686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.22905","last_updated":"2026-06-30T08:27:33Z","snapshot_observed_at":"2026-08-12T18:44:08.929234Z","submitted_at":"2026-06-22T06:41:17Z","title":"InteractiveAvatar: Real-Time Streaming Video Generation for Consistent and Intent-Aware Avatars","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.22905","snapshot_observed_at":"2026-08-15T15:11:01.087999Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.087999Z"},"links":{"cited_paper":"/paper/2606.22905","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:cd9ffe36f860b385e83b9138cc65da6c24cf3ec8166f2013e57130300dc42585","observation_id":"c0e3a65d-0e78-47c3-8863-7037ae09bc73","resolution":{"observed_at":"2026-08-15T15:11:01.087999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.063829Z","title":"Advances in Neural Information Processing Systems38, 10947–10969 (2026)","venue":null,"work_id":"fba9d915-beb1-4f94-90ab-f70ba614a231","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.091835Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:0c499fa74efb25f2ea4452e1c1e01a9c85e47896b052f390f895cc9c662c3a6f","observation_id":"f963ce7a-d24a-4d1b-af89-070868ffa116","resolution":{"observed_at":"2026-08-15T15:11:02.067738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.095625Z","title":"Advances in neural information processing systems30(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.095625Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:6ade8ffb6fc5f4d1ec2ffc5b9e4e99d00358b34b513de84bc7a334020ca54f4f","observation_id":"04435ae6-e8f2-4ccf-8aee-950e07f405a4","resolution":{"observed_at":"2026-08-15T15:11:01.095625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13204","last_updated":"2023-11-27T15:19:00Z","snapshot_observed_at":"2026-08-16T16:29:36.469852Z","submitted_at":"2022-09-27T07:10:20Z","title":"NEURAL MARIONETTE: A Transformer-based Multi-action Human Motion Synthesis System","version":2},"cited_work":{"arxiv_id":"2209.13204","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.13204","snapshot_observed_at":"2026-08-15T15:11:01.408938Z","title":"NEURAL MARIONETTE: A Transformer-based Multi-action Human Motion Synthesis System","venue":"cs.CV","work_id":"1ec033e5-e28f-4b0d-a77c-870763cc387e","year":2022},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.099403Z"},"links":{"cited_paper":"/paper/2209.13204","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:72af56a1c4b306a8155b14fb6017834c8f227669916b754bcd7ce357c5820c56","observation_id":"d7929c6f-d660-444a-844a-8e6451f65aef","resolution":{"observed_at":"2026-08-15T15:11:01.412771Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.043208Z","title":"IEEE Transactions on Image Processing34, 7079–7092 (2025) 18 X","venue":null,"work_id":"69731d1a-58c2-4e21-9d88-a26178f32ee2","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.103113Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:be696feda073b51e3e72c77e2a7343d16718340aa495aaeacd41fbc56d02c059","observation_id":"ffd72c74-9de1-414e-9d2b-7d4f6360e723","resolution":{"observed_at":"2026-08-15T15:11:02.047071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.031605Z","title":"In: Proceedings of the AAAI Conference on Artificial Intelligence","venue":null,"work_id":"e6aecbdb-c816-49ed-93c3-654c216ff349","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.106561Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:0547536c3e55d150165b19a56bc2744c4e51050332175c351df57df45691a152","observation_id":"94e84148-1337-4bf0-b4c4-43482ad5be8d","resolution":{"observed_at":"2026-08-15T15:11:02.035087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.019776Z","title":"In: 2023 IEEE/CVF Con- ference on Computer Vision and Pattern Recognition (CVPR)","venue":null,"work_id":"20129ec2-715e-491a-b285-2613c2401411","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.110221Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:6e829582f15de629632317232f74e90112b93f92755fd0ad60f9c474bac41a37","observation_id":"d99d0e86-1dde-4a8a-8023-0b681b120ba3","resolution":{"observed_at":"2026-08-15T15:11:02.023888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:02.007942Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"063a9b69-256c-4794-8c00-d1fbb8177d71","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.113422Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:a3af6e7118a5c92cc46bb8230e37ad512be2370ae9e2461bea9529ef1d2e8667","observation_id":"07f28ff5-512b-4ee9-b97b-72f5e7407ed0","resolution":{"observed_at":"2026-08-15T15:11:02.011595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.996285Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"7b8dc63d-6c3d-4fe0-a936-cadfc50f00da","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.117111Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:26f7dd143fff84cd087c2abecbc44bb72efca18a63e27b1e28484994cb5bae17","observation_id":"5ebb00ff-6fa0-4867-8925-78e8843a4539","resolution":{"observed_at":"2026-08-15T15:11:01.999883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.983735Z","title":"Advances in Neural Information Processing Systems37, 20055–20080 (2024)","venue":null,"work_id":"7133484b-af39-45ca-8b83-cbb366263cbb","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.120616Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:dbb8d944c619b6063328da9201070d5be9c2a0144905bb414fd26278272cf8e5","observation_id":"a49d6001-349b-4366-b330-9ed282dd3ce6","resolution":{"observed_at":"2026-08-15T15:11:01.987791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.972729Z","title":"In: Proceedings of the 2024 International Conference on Multimedia Retrieval","venue":null,"work_id":"9010818e-d0c0-4dcf-b2de-c6af895a3f54","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.124144Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:63e9c47e1f1ade10227ceed873f7bc74bfec8a80fcca327bd73fa192ac357d50","observation_id":"6611e9f4-e1d4-47e4-a71b-5f7a32136958","resolution":{"observed_at":"2026-08-15T15:11:01.976092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21029","last_updated":"2026-06-22T20:04:30Z","snapshot_observed_at":"2026-08-19T18:01:27.983951Z","submitted_at":"2025-11-26T03:53:10Z","title":"FlowerDance: MeanFlow for Efficient and Refined 3D Dance Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21029","snapshot_observed_at":"2026-08-15T15:11:01.127888Z","title":"arXiv preprint arXiv:2511.21029 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.127888Z"},"links":{"cited_paper":"/paper/2511.21029","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:d7d8e0823f981a73ad6c871b291c56bc5ae54826aede2b4dde9a5a7f63bb5d4e","observation_id":"d283c3f8-0dc1-4c15-aaa1-bce6bddb0bee","resolution":{"observed_at":"2026-08-15T15:11:01.127888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.960923Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"4b687110-86c7-4e71-8694-d9d4973fd253","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.132084Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1d94f4055f0a5595f1b1e9f399668f258b84dce4581cd2813e00bbad63555a8e","observation_id":"0359ee78-6588-4c50-b455-93edeaa87be8","resolution":{"observed_at":"2026-08-15T15:11:01.964575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.949327Z","title":"In: Proceedings of the 2024 International Conference on Multimedia Retrieval","venue":null,"work_id":"31296b32-4c07-41c0-984d-22ab73169210","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.135950Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:495295045d7f96614f5a4b43702d0b905ecb55caf8e07c8fbbd0c0c364581a17","observation_id":"81e7362a-1ef9-4763-8f08-3b95f075895c","resolution":{"observed_at":"2026-08-15T15:11:01.952923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.30019","last_updated":"2026-06-29T09:23:53Z","snapshot_observed_at":"2026-08-15T12:28:20.577447Z","submitted_at":"2026-06-29T09:23:53Z","title":"OmniDance: Multimodal Driven Dance Video Generation with Large-scale Internet Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.30019","snapshot_observed_at":"2026-08-15T15:11:01.139474Z","title":"arXiv preprint arXiv:2606.30019 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.139474Z"},"links":{"cited_paper":"/paper/2606.30019","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b0be03de58e1e211510996652d535eab84bdbba3d8b9a28b6f9563eb303cd4ed","observation_id":"145fb874-0cbb-4558-8921-d90b8e7ac17f","resolution":{"observed_at":"2026-08-15T15:11:01.139474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.936313Z","title":"In: Proceedings of the Special Interest Group on Com- puter Graphics andInteractive TechniquesConference Conference Papers.pp","venue":null,"work_id":"22a96e93-e414-4500-9341-341bb3039071","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.142867Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:2cf3c785f1858c7510b5c428075c954376c274464c11823829b24a12850cc0d6","observation_id":"1fb09e43-932f-4456-a140-0c928d4583ee","resolution":{"observed_at":"2026-08-15T15:11:01.941033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.923782Z","title":"arXiv e-prints pp","venue":null,"work_id":"73f2a9bf-92a7-4219-be48-5e47e28938ff","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.146195Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:6b9d2eb111e81d88c8472b9fbe73bdb6622e98c967f81a61fadf45ac59f48d93","observation_id":"0f31b0e4-b19d-4e96-ab1a-bdc972a34713","resolution":{"observed_at":"2026-08-15T15:11:01.927655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.912363Z","title":"In: Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":"ab02e071-517e-48b1-a1e8-af60dafef3d1","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.149632Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:20fa2e76d7b394d85c158c2a58cb1743e3aed4f84f0ad4f88ec368e50418d35a","observation_id":"98721acc-3e84-4279-a3e5-e7dac459fb87","resolution":{"observed_at":"2026-08-15T15:11:01.915782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.899057Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"1cc25fd7-d86b-4bad-a236-0cce69a98c40","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.152898Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:bd9a55f3e86e47e3e80c5d2e3d0439fc6ccc67ac8453622fafd85562e5ffe764","observation_id":"5389d848-7425-4ad9-aff5-6f5c90dafc8e","resolution":{"observed_at":"2026-08-15T15:11:01.902937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.887045Z","title":"In: The Thirty-ninth Annual Con- ference on Neural Information Processing Systems (2025)","venue":null,"work_id":"b44693d2-13cd-4d40-8b32-38e8e5a0b402","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.157043Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:016268c435586d001d6a44562abe1083e73eb0e53c0797d5a313a29dcddd2c4e","observation_id":"5e8360c6-6bf5-4706-b312-84a22663c4fd","resolution":{"observed_at":"2026-08-15T15:11:01.890519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.875582Z","title":"ACM Transactions on Graphics (TOG)39(6), 1–16 (2020)","venue":null,"work_id":"51a65075-e412-4ade-86c1-fae5bb41c636","year":2020},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.160297Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:ef269b3af21f11fcef340ea401a00d9aa40c08dc870292156a2ac10e4f1736e1","observation_id":"03f11b8f-b8d4-4a86-aaff-5e93ce21749c","resolution":{"observed_at":"2026-08-15T15:11:01.879135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.864049Z","title":"IEEE Transactions on Visualization and Computer Graphics30(10), 6984–6996 (2024)","venue":null,"work_id":"95693c25-a6d6-4099-b3e5-d29635d3cd4c","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.163593Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:0c47e55fe9d593a877c4a074e0b82f181592c090f884825a7e1451066ed6be2d","observation_id":"613137fd-7eae-4822-bf54-d8b82631cfe2","resolution":{"observed_at":"2026-08-15T15:11:01.867580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.851995Z","title":"In: International Conference on Learning Representations (2024)","venue":null,"work_id":"19748963-d2cb-4920-96c2-a60076b9c416","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.167063Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:7930dde25b61bbd3553632e796f356ec7ec1bc71de7ff4e57cd64cf364693982","observation_id":"9ff9c636-8073-4c45-be5f-2d131682cf06","resolution":{"observed_at":"2026-08-15T15:11:01.855781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.840427Z","title":"In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition","venue":null,"work_id":"15abef6a-6d8f-4a41-b39e-ceb4508a97db","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.170480Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:83150f97494b3725f854a719b82628f63536e27f9c1571375ba38ffa6ec23317","observation_id":"6984bfff-5586-4387-83b0-9f91b54cc2bb","resolution":{"observed_at":"2026-08-15T15:11:01.843970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.174775Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.174775Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:5ce5698ce638b25ade2686390b480b9862bea169b1d3ba44f77234a41a4ac496","observation_id":"b3e178f1-c747-4543-a115-7589959e92cd","resolution":{"observed_at":"2026-08-15T15:11:01.174775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.06064","last_updated":"2026-07-24T02:23:21Z","snapshot_observed_at":"2026-08-13T14:04:21.029473Z","submitted_at":"2026-05-07T11:48:39Z","title":"PersonaGesture: Single-Reference Co-Speech Gesture Personalization for Unseen Speakers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.06064","snapshot_observed_at":"2026-08-15T15:11:01.178337Z","title":"arXiv preprint arXiv:2605.06064 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.178337Z"},"links":{"cited_paper":"/paper/2605.06064","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:6a6d23932b1f5a3705324196a59f469d92ebb44eba857c0c36ab9d3905768499","observation_id":"7864c548-0868-49fc-873d-f2ad21b70d84","resolution":{"observed_at":"2026-08-15T15:11:01.178337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.820376Z","title":"IEEE Transactions on Circuits and Systems for Video Technology35(10), 10410–10422 (2025)","venue":null,"work_id":"22d4a0ea-cf32-4ffe-9209-3d0c150bf340","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.181784Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:0b216e4841db6ff36d372bdb5ba151fd1538a09372d986fb364362ea98561304","observation_id":"32fafcca-5756-4624-be44-b7cd6e670fec","resolution":{"observed_at":"2026-08-15T15:11:01.824108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10076","last_updated":"2026-08-16T15:51:15Z","snapshot_observed_at":"2026-08-19T20:16:34.444345Z","submitted_at":"2025-11-13T08:30:35Z","title":"Mitigating Error Accumulation in Co-Speech Motion Generation via Global Rotation Diffusion and Multi-Level Constraints","version":3},"cited_work":{"arxiv_id":"2511.10076","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":"2511.10076","snapshot_observed_at":"2026-08-18T02:13:22.046252Z","title":"arXiv preprint arXiv:2511.10076 (2025)","venue":null,"work_id":"8edd7ae2-c4a8-4ffb-b5e0-778f4904c1b6","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.185336Z"},"links":{"cited_paper":"/paper/2511.10076","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:9a5b0e2060a56144a8a3d7646e0c591254cc449c74644261d2739a5e3ac2bb44","observation_id":"97f63093-2617-4723-a5fb-9dd0fde1f6ac","resolution":{"observed_at":"2026-08-18T02:13:22.046252Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.809027Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"0b620184-4b31-411d-9752-c4cd1b77ba68","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.188681Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:fe27dd118eec75d628ff93bcdd38a15d594fe8924bba4747789efc641e4f6703","observation_id":"faab9dcc-49c1-446b-84f1-e9e52814b3b7","resolution":{"observed_at":"2026-08-15T15:11:01.812569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.796453Z","title":"In: Pro- ceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"a6fb96e5-3264-4aef-91c5-8c1c979fc74f","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.192071Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:924b2bc1b822026b8842f45270db37edcece4697c2741924726824f85df6ff26","observation_id":"7b5db14c-87dc-47d8-9109-5c45f142ab9a","resolution":{"observed_at":"2026-08-15T15:11:01.800732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.783663Z","title":"ACMTransactionson Graphics (TOG)43(4), 1–17 (2024)","venue":null,"work_id":"f848e612-4132-4e35-a44b-6959fc9cd8e7","year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.195466Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:ca8d57294c0d8ec898f3a3e13b04a2c197bdddafa38ea30c0e768fa40f501c81","observation_id":"614f1b16-b18b-4eae-b22b-8eb088e00d3d","resolution":{"observed_at":"2026-08-15T15:11:01.787511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10061","last_updated":"2024-07-14T03:12:19Z","snapshot_observed_at":"2026-08-16T13:34:26.769167Z","submitted_at":"2024-07-14T03:12:19Z","title":"InfiniMotion: Mamba Boosts Memory in Transformer for Arbitrary Long Motion Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10061","snapshot_observed_at":"2026-08-15T15:11:01.198949Z","title":"arXiv preprint arXiv:2407.10061 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.198949Z"},"links":{"cited_paper":"/paper/2407.10061","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:20618f8d0664ea6e93d6a0f804887d7643d0ad20dc79750a2674ccd5b20030f2","observation_id":"8b1ebfb6-6081-4539-bd80-a47a778c716e","resolution":{"observed_at":"2026-08-15T15:11:01.198949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.771626Z","title":"IEEE Transactions on Mul- timedia (2025)","venue":null,"work_id":"26e66490-8b3d-4fba-b4e1-4d5a6d0220ef","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.203073Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:1efc33b3412c4fd6ab053144a4410a5d258769d4774f8b6b16f9d07f825921e3","observation_id":"75274397-9962-4450-8ccb-75bafbe527cf","resolution":{"observed_at":"2026-08-15T15:11:01.775131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27055","last_updated":"2026-05-26T14:10:12Z","snapshot_observed_at":"2026-08-13T14:05:06.778990Z","submitted_at":"2026-05-26T14:10:12Z","title":"Semantic-Aware Motion Encoding for Topology-Agnostic Character Animation","version":1},"cited_work":{"arxiv_id":"2605.27055","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.27055","snapshot_observed_at":"2026-08-15T15:11:01.256888Z","title":"Semantic-Aware Motion Encoding for Topology-Agnostic Character Animation","venue":"cs.GR","work_id":"d3db774b-268a-4313-be4b-32228ab6578c","year":2026},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.206474Z"},"links":{"cited_paper":"/paper/2605.27055","citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:866adb4b5b5275466435fffc4c815b76035e7c1034eb048ecba1740ad3db15ee","observation_id":"c50f34e1-da7b-46f3-af3f-5f2a270f0dce","resolution":{"observed_at":"2026-08-15T15:11:01.262723Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.759939Z","title":"In: Proceedings of the 33rd ACM International Conference on Multimedia","venue":null,"work_id":"59d188ed-e0e3-40d1-bed0-c43e05f1b47a","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.210254Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:c7bab901b5628ef1b03905b54a38de744e02eb7ba1568c7e5004fae2930ed020","observation_id":"79d3935a-393b-4cbc-9043-3e289b181890","resolution":{"observed_at":"2026-08-15T15:11:01.763549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.748173Z","title":"In: ICASSP 2025 - 2025 IEEE International Conference on Acoustics, Speech and Signal Processing","venue":null,"work_id":"7382a260-b378-4264-b57d-b214fb00cbbf","year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.213749Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b18735c0a6e0f9a492d9024e9fd7fb1f28de5baf581c3e993695b17a7a9ccf0e","observation_id":"1e9a7b9f-5af3-4bc2-b41d-9177cbe0806f","resolution":{"observed_at":"2026-08-15T15:11:01.751880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.736195Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":"d5236780-0ed5-404a-ad2d-b964a4e2823c","year":2023},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.217048Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:b2a0ce8b432920bffb87af8f4973d96a1ad2ead6abde5cff1bfeb1681bfacfd4","observation_id":"2a6bec05-427c-4490-a0a2-7a686abc4a73","resolution":{"observed_at":"2026-08-15T15:11:01.739869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.220574Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.220574Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:456d5e00ddc7dfe22c785a2c0fab6c0cb65088f2a834d875251df04b7c4aec8a","observation_id":"8e539918-30f1-4bcf-bb4d-51f76fa54889","resolution":{"observed_at":"2026-08-15T15:11:01.220574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:11:01.223944Z","title":"In: Proceedings of the IEEE/CVF International Conference on Computer Vision","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T15:11:01.223944Z"},"links":{"citing_paper":"/paper/2608.01643"},"observation_digest":"sha256:dcabd1841f37b9af0a29bb6e9cbcb038bde3e41a4206658af113bc8455e044af","observation_id":"1a02ff99-ec1c-48bd-b6f4-f8fadc624d26","resolution":{"observed_at":"2026-08-15T15:11:01.223944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01643","last_updated":"2026-08-03T03:25:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T09:04:07.649462Z","submitted_at":"2026-08-03T03:25:34Z","title":"StreamTalk: Streaming Co-Speech Gesture Generation with Key-Pose Anchoring"},"reference_resolution":{"displayed":72,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":21,"verified_exact":2,"verified_fuzzy":45},"total_outbound_references":72},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 72 of 72 outbound references and 0 inbound Pith citation observations for arXiv:2608.01643."}