{"as_of":"2026-08-09T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48f402ef476ad92494f61b6279410106d32a3fba9b3e346791a95a1cfed4ab26","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:50:07.536013Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.04522/citation-record","integrity":"/paper/2507.04522/integrity","json":"/paper/2507.04522/citation-record.json","paper":"/paper/2507.04522"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:13.050981Z","title":"GestureDiffu- CLIP: Gesture diffusion model with CLIP latents","venue":null,"work_id":"f41a10f1-3b79-43ed-9920-8aebbc93f2f4","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.629393Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:69b5f01ab6a98b96d46e3464af0732bbec49ed111d4fb32f867da4cb7e607290","observation_id":"d2a030c4-9c80-4783-b580-cc49fbdb0d99","resolution":{"observed_at":"2026-08-06T19:50:13.116793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.902662Z","title":"Multimodal referencing: Grounding generative models in situated communication, 2025","venue":null,"work_id":"75c5b59a-1e57-47fa-90a5-f867658bf786","year":2025},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.700641Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:9735e06374f3d1dee4c7195109fb3f8d8ea937aab689b4957f365ea44ac27fbf","observation_id":"83ad97ee-e411-40b0-bdfa-11092419905d","resolution":{"observed_at":"2026-08-06T19:50:12.975013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.745398Z","title":"WhisperX: Time-accurate speech transcription of long- form audio","venue":null,"work_id":"0db15b82-dd1c-4bae-92e1-8ac1c516a4f7","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.845844Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:53c3048144bdeec82e24b542e621aa07765cc884f89f3a26b31f59256733c443","observation_id":"6e7242c9-bf95-4793-9907-2b0e489deefd","resolution":{"observed_at":"2026-08-06T19:50:12.811067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06885","snapshot_observed_at":"2026-08-06T19:50:03.932721Z","title":"F5-TTS: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:03.932721Z"},"links":{"cited_paper":"/paper/2410.06885","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:dcbb36568fd65bc8fdc2bf5473252c29dc575f3171c338d67c451118ea874328","observation_id":"cff693cc-2ac9-4126-a8c8-6e762e54d742","resolution":{"observed_at":"2026-08-06T19:50:03.932721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.588383Z","title":"In- corporating spatial awareness in data-driven gesture gener- ation for virtual agents","venue":null,"work_id":"29baa421-3357-4085-af5e-5c33e7b81f34","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.065628Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:07db4c68ef0c618649c2e48b1a35e6439341b20789b89640338f3ae17ddd3f30","observation_id":"840c538e-51c7-479f-822f-6e0e6875f92c","resolution":{"observed_at":"2026-08-06T19:50:12.657167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.427891Z","title":"Diffusion-based co-speech gesture genera- tion using joint text and audio representation","venue":null,"work_id":"c6d9c6ea-90c1-4593-86b3-733a8f32d5e8","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.198433Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:7f54ea77f14e49705c2c8824af4ec5608ff9c034adc54df1ac7518957ccae187","observation_id":"ee322aaa-c823-4675-8917-9786148c6eb8","resolution":{"observed_at":"2026-08-06T19:50:12.497542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00253","last_updated":"2024-09-30T21:51:30Z","snapshot_observed_at":"2026-08-01T05:46:19.804175Z","submitted_at":"2024-09-30T21:51:30Z","title":"MM-Conv: A Multi-modal Conversational Dataset for Virtual Humans","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00253","snapshot_observed_at":"2026-08-06T19:50:04.281234Z","title":"MM-Conv: A multi-modal conversational dataset for virtual humans","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.281234Z"},"links":{"cited_paper":"/paper/2410.00253","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:41b98041347f4e44e5282564c7b3066d0ce30d9b9537f0c8b70b1f5f3d4af890","observation_id":"10bdca01-ee96-4a22-b5cc-425c85461871","resolution":{"observed_at":"2026-08-06T19:50:04.281234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.269980Z","title":"Towards context-aware human-like point- ing gestures with rl motion imitation","venue":null,"work_id":"955beb6f-3048-44fb-b15d-63612435e968","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.386457Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:3901f0643e6d098bd101814cbd63cae09de6c990548b9903244fb6fe20e7d6ac","observation_id":"f0b9be30-c17c-48f5-b086-398732d3a8d6","resolution":{"observed_at":"2026-08-06T19:50:12.359123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:12.064901Z","title":"Investigating the use of recurrent motion modelling for speech gesture generation","venue":null,"work_id":"3c5ca73c-b381-4e6e-a10f-1033336bd6da","year":2018},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.504162Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:d74ebe180c0280b8d5e61b55dce1e9f88f460b8a90cfc8cc418b6484f3d5bbc2","observation_id":"ec4ce390-a50e-48d6-872e-35586b8ffa74","resolution":{"observed_at":"2026-08-06T19:50:12.162163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.879869Z","title":"IV A: Investigating the use of recurrent motion modelling for speech gesture gen- eration","venue":null,"work_id":"51049779-452a-443e-b701-e7816eccbf50","year":2018},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.610387Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:5a52a3e7ff46599186bb099d2c083f2f44dc25a92a7a69c4cd4ea1171eeb3176","observation_id":"33ab9391-36f2-43e3-957e-ec1aa65725a1","resolution":{"observed_at":"2026-08-06T19:50:11.972027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04160","last_updated":"2019-06-10T17:58:08Z","snapshot_observed_at":"2026-07-06T07:59:19.943467Z","submitted_at":"2019-06-10T17:58:08Z","title":"Learning Individual Styles of Conversational Gesture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04160","snapshot_observed_at":"2026-08-06T19:50:04.689024Z","title":"Learning individual styles of conversational gesture","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.689024Z"},"links":{"cited_paper":"/paper/1906.04160","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:4f57725b74efa04ebfec33c6fdd37483a881e6b1b6356fe92ff6cc7b86e72275","observation_id":"d19b05bf-d352-4902-b5d9-2976d374ec6e","resolution":{"observed_at":"2026-08-06T19:50:04.689024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.697712Z","title":"Generating diverse and natural 3d human motions from text","venue":null,"work_id":"46d4b2c6-3d41-4e61-9d96-50d85ba69523","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.794391Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:37e093fb157448c48a564852e443a93f071a26ee4e19fbfd5f25fe3d816a3f67","observation_id":"9293ce30-5718-4b83-83f9-956ae68686d7","resolution":{"observed_at":"2026-08-06T19:50:11.771853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.499325Z","title":"Generating diverse and nat- ural 3D human motions from text","venue":null,"work_id":"be916aaf-5521-4b5f-9322-00021de6dc13","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:04.911642Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:17ee3980e333fcacc8c70faf3f39aa8a783200c28acd6afa84e2261ff661800e","observation_id":"22c2cc34-8435-4fde-86a7-681dc2990d82","resolution":{"observed_at":"2026-08-06T19:50:11.595191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.275015Z","title":"Automatic deictic ges- tures for animated pedagogical agents","venue":null,"work_id":"ffd52f19-b469-47e3-b330-6a043f1320d7","year":2019},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.018409Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:3532530d9edb90dc62f6061b6636cada8ac4a85b53fb015bf05eac7beefaf896","observation_id":"7f351244-4a7d-4a5a-9bd3-86281ff32fd7","resolution":{"observed_at":"2026-08-06T19:50:11.398664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-06T19:50:05.106839Z","title":"AI2-THOR: An interactive 3D environment for visual AI","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.106839Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:f4f36e7e5b7de01c947822bbcfcac0e334c4df53b7acb04059b8a0bd37bd842e","observation_id":"20f1bb53-2066-4dfb-99de-171ef71815aa","resolution":{"observed_at":"2026-08-06T19:50:05.106839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:11.095563Z","title":"Talking With Hands 16.2M: A large-scale dataset of synchronized body- finger motion and audio for conversational motion analy- sis and synthesis","venue":null,"work_id":"c32bb9f9-f51f-4110-bf68-16bc31bce2ba","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.235429Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:b72f390a05bb31458e19fb0bf0b55b7ee08e9a4b78efe9c4852a759c818fe6a8","observation_id":"06f30f57-3b5a-417a-ada5-782949d22d18","resolution":{"observed_at":"2026-08-06T19:50:11.171691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.903501Z","title":"Deictic believability: Coordinated ges- ture, locomotion, and speech in lifelike pedagogical agents","venue":null,"work_id":"0618482a-5526-4be0-8647-29868e0ea242","year":1999},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.347824Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:1f0f9516cc35900afa90efc38e52fc8141c6b404644fef737e34863c1ceac463","observation_id":"d1e34bab-8f38-4591-a70c-9d6f887e2ca2","resolution":{"observed_at":"2026-08-06T19:50:10.973363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.720537Z","title":"Controllable human-object interaction synthesis","venue":null,"work_id":"15a03611-1306-4911-86f1-267e582b43a2","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.439378Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:0a65944c7573b91e88e72280bac03363a097675b6a07527bd3ecfa64ee2e8b3c","observation_id":"e2104276-cda5-4d93-a977-8de37b99001e","resolution":{"observed_at":"2026-08-06T19:50:10.806290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.534700Z","title":"Black, Hao Li, and Javier Romero","venue":null,"work_id":"b05c4d54-a4da-4eab-8bc1-7578002ceaed","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.617780Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:d173fd87e075dace403ddc66bc77e0502896b47cdc6428a39ee08463ce15a70a","observation_id":"52b3c9e0-b376-4845-b560-c96f7b5d64cf","resolution":{"observed_at":"2026-08-06T19:50:10.608842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06071","last_updated":"2024-03-05T14:36:12Z","snapshot_observed_at":"2026-07-30T19:32:30.807724Z","submitted_at":"2024-01-11T17:41:57Z","title":"GroundingGPT:Language Enhanced Multi-modal Grounding Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06071","snapshot_observed_at":"2026-08-06T19:50:05.707838Z","title":"GroundingGPT: Language enhanced multi-modal grounding model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.707838Z"},"links":{"cited_paper":"/paper/2401.06071","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:9d3265df8fe01de74dfef7933358d20b54b969bc5097e0b02e904025fb8a390e","observation_id":"7b59254b-d862-46ce-b065-c05fb0b57cd9","resolution":{"observed_at":"2026-08-06T19:50:05.707838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.311501Z","title":"EMAGE: Towards unified holistic co-speech gesture generation via expressive masked audio gesture modeling","venue":null,"work_id":"b3eff0a7-3607-4b7f-a81a-02865c606fb1","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.801928Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:444fbace7e467b9ed7fb6aac19659230d46e085b63517d825675b0eaa629660c","observation_id":"1dd568d2-40eb-4b22-ae58-99d1b23ee38e","resolution":{"observed_at":"2026-08-06T19:50:10.419729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05297","last_updated":"2022-09-20T05:44:29Z","snapshot_observed_at":"2026-07-06T12:46:23.306134Z","submitted_at":"2022-03-10T11:19:52Z","title":"BEAT: A Large-Scale Semantic and Emotional Multi-Modal Dataset for Conversational Gestures Synthesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05297","snapshot_observed_at":"2026-08-06T19:50:05.916278Z","title":"BEAT: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:05.916278Z"},"links":{"cited_paper":"/paper/2203.05297","citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:1b34dfaddac53f2953275655a255cf545caf3717c8a4927f5bcc8113f964e048","observation_id":"60bc39e7-37f9-4f27-a445-72bf93eb9776","resolution":{"observed_at":"2026-08-06T19:50:05.916278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:10.131126Z","title":null,"venue":null,"work_id":"3b19e56c-83d9-4ff5-9c86-b3efdbe94017","year":2014},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.012590Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:636f79f1d1f2a02d686b029dd32d43fe36d1c1b80ff1e8d551b134a69677811f","observation_id":"c15ceb32-d0ff-4701-b969-b5ab0aef3416","resolution":{"observed_at":"2026-08-06T19:50:10.232891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.905619Z","title":"AMASS: Archive of motion capture as surface shapes","venue":null,"work_id":"9ff9c3f8-e25f-4eae-8a76-b4d3d8a9dfcb","year":2019},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.124983Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:c91819ea473e9b603de6f1146d04ade0bf3d3f639e49310d084b05309885185c","observation_id":"6637cae7-ea7e-4477-8c7c-2bf464c655c8","resolution":{"observed_at":"2026-08-06T19:50:10.015638Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.709296Z","title":"Design of a virtual human presenter","venue":null,"work_id":"c1caf74d-2a46-47ee-b9a8-9a067eb86e1f","year":2002},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.269557Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:3bc29fec1ff271678ce91208e99d167b3cee3ac42446fbb10117d4e56be0ab98","observation_id":"ae674419-b227-48ba-9d25-f1bb8522bf0c","resolution":{"observed_at":"2026-08-06T19:50:09.784238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.516227Z","title":null,"venue":null,"work_id":"6b6223cc-55ad-4932-b5e3-f8c8f91301ea","year":2019},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.421212Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:9c66e115d1987f9e19fb53d9327da7a961045a6a0466a47139ae2914d6dece95","observation_id":"dfab8d58-1c15-46aa-a256-0feea1395e08","resolution":{"observed_at":"2026-08-06T19:50:09.609324Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.329558Z","title":"The KIT Motion-Language Dataset","venue":null,"work_id":"feba576b-248f-4a32-9e7f-59b3a43823a2","year":2016},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.571398Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:2567236c80d8d0e888ca3ff760b65886b201c4703c634c82ce927dbf7b873fc5","observation_id":"f2982cd3-1b48-47e7-9e4a-9d1534100f57","resolution":{"observed_at":"2026-08-06T19:50:09.405944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:09.086746Z","title":"Animated agents for pro- cedural training in virtual reality: Perception, cognition, and motor control","venue":null,"work_id":"451dfae7-d077-4234-94a8-0bbe21737cd2","year":1999},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.669960Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:5fc98ca0df716d3c900db7346e622d24083c08518a003362fc0b0c2156b07f64","observation_id":"34b447a7-8749-4af6-b736-17bd87b07460","resolution":{"observed_at":"2026-08-06T19:50:09.213966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.888381Z","title":"Move as you say interact as you can: Language-guided human motion generation with scene af- fordance","venue":null,"work_id":"fe9755f6-0920-4afb-aa38-6a7f47884eae","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.793081Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:b846a7f2a93d56e1495623dce07d55665307721a9cb35c147f05156e730e4903","observation_id":"63733492-aeba-4176-8a7a-c238a922cfff","resolution":{"observed_at":"2026-08-06T19:50:08.998585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.681390Z","title":"HUMANISE: Language-conditioned hu- man motion generation in 3D scenes","venue":null,"work_id":"0577c09c-84ae-4b60-8832-564c531aa79b","year":2022},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:06.912657Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:402440b68d361573c64c5de20fbe047fa363c93f61998e3e47c0b4a301b1bd29","observation_id":"3a42d82f-8301-4075-adf1-f950b1045f5d","resolution":{"observed_at":"2026-08-06T19:50:08.776305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.456341Z","title":"OmniControl: Control any joint at any time for human motion generation","venue":null,"work_id":"fa436540-a070-4036-8294-c52b56659a61","year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.072912Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:07569bffff8579c2c1083aadb3cc686c01babecf98e9ae483f8ede4a2cdaf381","observation_id":"72b78304-dbe4-4b85-9c29-64b09326097e","resolution":{"observed_at":"2026-08-06T19:50:08.531050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:08.258531Z","title":"Inter-X: Towards versatile human- human interaction analysis","venue":null,"work_id":"7958a24d-ad31-4ca0-b211-cf935e64cc41","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.177655Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:01c86d5cb1e019cb93cc1c49090271d1a9ec16746e5472ab5a7028f7f636b859","observation_id":"8ca639e9-c769-438b-8fad-b9098dbc0f5a","resolution":{"observed_at":"2026-08-06T19:50:08.350360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:07.993815Z","title":null,"venue":null,"work_id":"0d7321cb-22e8-4c4b-a240-0ba6e8a85262","year":2023},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.291690Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:8d07f1750a978b18dc0ed4fe7c166c5f7cd9e3f284e56b6a087eb47bc0ee471a","observation_id":"3f8764f2-1593-4004-9a07-87364a934c35","resolution":{"observed_at":"2026-08-06T19:50:08.136137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:07.409636Z","title":"Generating human interaction motions in scenes with text control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.409636Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:22d88ec7a4c896333b1075fb131463fb3736e8e750c5c4ff7e588cceaeddfe84","observation_id":"b1929e41-a0ea-4c4a-a949-8708ca0b3a36","resolution":{"observed_at":"2026-08-06T19:50:07.409636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T19:50:07.728923Z","title":"See that bench over THERE, we could sit there","venue":null,"work_id":"1fdacda5-8cec-4eb8-b92e-2a3f2e739a13","year":null},"citing_paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T19:50:07.536013Z"},"links":{"citing_paper":"/paper/2507.04522"},"observation_digest":"sha256:d6e015c7ac58f6393bdd051cb93ba97b3cd08d15deda99c69a5d96be0909741b","observation_id":"9f0229df-734f-461e-99d5-fb2e21e0f174","resolution":{"observed_at":"2026-08-06T19:50:07.843457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.04522","last_updated":"2025-07-06T20:19:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T19:43:26.501083Z","submitted_at":"2025-07-06T20:19:34Z","title":"Grounded Gesture Generation: Language, Motion, and Space"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":25},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2507.04522."}