{"as_of":"2026-08-14T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fb6d1edb5233d8cc4bbf0b1654041d768cc41e04ebbbf3b3acf956da13b28d73","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:17:00.665972Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.16729/citation-record","integrity":"/paper/2411.16729/integrity","json":"/paper/2411.16729/citation-record.json","paper":"/paper/2411.16729"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.04919","last_updated":"2023-05-08T17:54:58Z","snapshot_observed_at":"2026-08-13T11:47:05.088519Z","submitted_at":"2023-05-08T17:54:58Z","title":"DiffuseStyleGesture: Stylized Audio-Driven Co-Speech Gesture Generation with Diffusion Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04919","snapshot_observed_at":"2026-08-12T14:17:00.502788Z","title":"DiffuseStyleGesture: Stylized audio-driven co-speech gesture generation with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.502788Z"},"links":{"cited_paper":"/paper/2305.04919","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:fab4bb1bb4a3ea0bf26c5e30baace96bea5f0bbf9cb7b883d6311c5ecddaa6aa","observation_id":"055fc402-0c08-4801-9e8f-c169a891ffcb","resolution":{"observed_at":"2026-08-12T14:17:00.502788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.363230Z","title":"The diffusestylegesture+ entry to the genea challenge 2023,","venue":null,"work_id":"e4852125-4970-4210-bcf3-de60f71922e3","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.508549Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:499f5745fbf1cdbdc5094268f275485dce73bf3e977bf974379018eb48259a89","observation_id":"899b5813-b992-493e-a53f-b66135a500d2","resolution":{"observed_at":"2026-08-12T14:17:01.368431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.348818Z","title":"Gesturediffuclip: Gesture diffusion model with clip latents,","venue":null,"work_id":"fd98014f-429b-4153-b194-2892cbae3d0d","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.513047Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:30c416419b9ee33443be7a036edf01825b29140ccf6741c22cf617307356d3fe","observation_id":"d9f01c89-db94-4c80-b469-09136ec7c473","resolution":{"observed_at":"2026-08-12T14:17:01.353269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.517549Z","title":"Listen, denoise, action! audio-driven motion synthesis with diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.517549Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:8f7d6a0d568bce46c22d2ccaf973e49471d8fa30711229b62318c64eeef81734","observation_id":"8edc59ca-2422-476b-93b1-fb8e56b5b844","resolution":{"observed_at":"2026-08-12T14:17:00.517549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"document/1050809","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.874770Z","title":"Speech-driven personalized gesture synthetics: Harnessing automatic fuzzy feature inference,","venue":null,"work_id":"72ca903d-a56f-4cdb-8764-01778cf52f77","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.522115Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:b63a40b9405ea9e5acee99a735a9f893fca69af87f87454367fe1469bffd4ae5","observation_id":"3e4fef0c-740e-4ac7-90ba-7b9e5a97fa42","resolution":{"observed_at":"2026-08-12T14:17:00.882199Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.526438Z","title":"Scalable diffusion models with transformers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.526438Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:7c03a2f88087bab22ab2e9b68661e1c1339e17417670a6529134fc7dd1fb5d3c","observation_id":"ddaad137-a51e-4f59-96e4-16bce4a02927","resolution":{"observed_at":"2026-08-12T14:17:00.526438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T14:17:00.531386Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.531386Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:e648ec44c400c4a4281fa7c9982670e5a987f76c47f731466e9574e0164e7f8c","observation_id":"4c60bf59-57fd-48b6-9670-9075a63bea42","resolution":{"observed_at":"2026-08-12T14:17:00.531386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09417","last_updated":"2024-11-14T02:00:33Z","snapshot_observed_at":"2026-08-14T11:12:31.002605Z","submitted_at":"2024-01-17T18:56:18Z","title":"Vision Mamba: Efficient Visual Representation Learning with Bidirectional State Space Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09417","snapshot_observed_at":"2026-08-12T14:17:00.535931Z","title":"Vision mamba: Efficient visual representation learning with bidirectional state space model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.535931Z"},"links":{"cited_paper":"/paper/2401.09417","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:82c75055043c8bc8b882bbee1aa31d9b9fd3bc742c697a365b912f0d095e5f8b","observation_id":"ccb8e988-c569-4246-8066-a2c03a4b47b6","resolution":{"observed_at":"2026-08-12T14:17:00.535931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04722","last_updated":"2024-01-09T18:53:20Z","snapshot_observed_at":"2026-07-06T17:13:25.341853Z","submitted_at":"2024-01-09T18:53:20Z","title":"U-Mamba: Enhancing Long-range Dependency for Biomedical Image Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04722","snapshot_observed_at":"2026-08-12T14:17:00.540557Z","title":"U-mamba: Enhancing long-range dependency for biomedical image segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.540557Z"},"links":{"cited_paper":"/paper/2401.04722","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:96839dc09dac8ca02afc23a31d062fd4b7ddca435d5fa4d60c286c3cbd418ecf","observation_id":"509de8a1-2db2-471e-ba33-d7e085b59c0c","resolution":{"observed_at":"2026-08-12T14:17:00.540557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.316539Z","title":"Videomamba: State space model for efficient video understanding,","venue":null,"work_id":"f08cf539-ecc0-4368-b346-82736a0be618","year":2025},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.544987Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:9df4186d953c44ff0146d3fdc0ad87d1288944fb31dfb7b5f0fc77bc2d681e45","observation_id":"fc2d7944-3d7a-4d5f-b06d-2a675a702218","resolution":{"observed_at":"2026-08-12T14:17:01.321133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.302294Z","title":"Segmamba: Long-range sequential modeling mamba for 3d medical image segmentation,","venue":null,"work_id":"aace726c-2a95-4c66-b62d-be008aee423b","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.549265Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:b1c816a3da77c5c672efd8564bea78d3d2f980acebfbde15e16fb3fd6e4b69a2","observation_id":"237e082c-ac8b-4891-9a51-7e39a6219726","resolution":{"observed_at":"2026-08-12T14:17:01.306904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.287580Z","title":"Graph mamba: Towards learning on graphs with state space models,","venue":null,"work_id":"117ee543-3f3a-49fc-95e2-ed2a6de03512","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.553243Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:a7c4978d3a1de1a11228eae1095978e0a4ac2d0d26ecc638d52888166b81b59b","observation_id":"d18ad0ac-4edc-415b-8371-77c3bd431f1f","resolution":{"observed_at":"2026-08-12T14:17:01.292382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00789","last_updated":"2024-02-01T17:21:53Z","snapshot_observed_at":"2026-08-13T04:29:03.289216Z","submitted_at":"2024-02-01T17:21:53Z","title":"Graph-Mamba: Towards Long-Range Graph Sequence Modeling with Selective State Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00789","snapshot_observed_at":"2026-08-12T14:17:00.557485Z","title":"Graph-mamba: Towards long-range graph sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.557485Z"},"links":{"cited_paper":"/paper/2402.00789","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:5687ceccfb2961e884343b13415b2d5c69502d657ae3a42777c1709f32b64afd","observation_id":"73e8b239-0e27-41c6-b7b9-7767deb561b5","resolution":{"observed_at":"2026-08-12T14:17:00.557485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-12T14:17:00.561955Z","title":"Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.561955Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:f901881379d313d5ca8ebf912707557b08f6f56433f4e01146529131d69de435","observation_id":"20c88340-18d5-47b5-abbc-f899329b04b8","resolution":{"observed_at":"2026-08-12T14:17:00.561955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.273199Z","title":"Investigating the use of recurrent motion modelling for speech gesture generation,","venue":null,"work_id":"77980691-2e7b-4299-a208-e2569e17a9cb","year":2018},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.566536Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:f0f0f7091fd466436172d4654935fe2d350a087a35c6c82ee057903eb5bfa458","observation_id":"6f199829-ed50-4319-9e43-4a594e7f62e5","resolution":{"observed_at":"2026-08-12T14:17:01.278117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.258872Z","title":"Zeroeggs: Zero-shot example-based gesture generation from speech,","venue":null,"work_id":"9b5930ac-52f7-482f-8797-28379e2ab7b4","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.570531Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:815dd83013dd439a62e0aec54d7dad982b69ac31bffbaa5f125629515e528313","observation_id":"aa14dd1b-3686-41aa-868c-23bb9199c0d0","resolution":{"observed_at":"2026-08-12T14:17:01.263605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.244653Z","title":"Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesis,","venue":null,"work_id":"7602d6ac-a3e9-42b6-acbc-036f511bffc2","year":2022},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.574722Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:f30b1150d4037627247cc1da6b8f7e044478a90defba4bbdd460b1fd68161e4c","observation_id":"239ce9cc-779d-46f6-9d2e-a0ba30e97cde","resolution":{"observed_at":"2026-08-12T14:17:01.249152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.229957Z","title":"Talking with hands 16.2 m: A large-scale dataset of synchronized body-finger motion and audio for conversational motion analysis and synthesis,","venue":null,"work_id":"e7c3d35a-b91e-4f0b-ae4d-17e914c5fcc6","year":2019},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.578973Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:4057cefd940adb7198b3cbdd83d5baac98e485ebf18185a0bd0843518d1ad3c8","observation_id":"1adc3dcd-6a20-42ab-96d5-19770a5ad80c","resolution":{"observed_at":"2026-08-12T14:17:01.234963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.214143Z","title":"Diffmotion: Speech-driven gesture synthesis using denoising diffusion model,","venue":null,"work_id":"6ca6f634-98ab-43d1-8842-6d30024e1e89","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.583168Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:c2791c4d3327fbcc7881cd2969dd4436d23d009cf867b7d1ae339f118db28df9","observation_id":"5afe33d7-6a9b-4fad-b648-1ca4623587eb","resolution":{"observed_at":"2026-08-12T14:17:01.219702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.198007Z","title":"Cross-modal quantization for co-speech gesture generation,","venue":null,"work_id":"663174f2-df1c-4602-bd67-bc88dbe169ad","year":2024},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.588308Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:39f1c9dce07c3f9519fce37d00abac363f349b4a18ad68a2f8f7a1b35bcb8dc3","observation_id":"14f13b5b-fe0e-4e06-9d12-7bf2d102020f","resolution":{"observed_at":"2026-08-12T14:17:01.203564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.181879Z","title":"Adversarial gesture generation with realistic gesture phasing,","venue":null,"work_id":"c2ea867a-48ca-4f91-b89f-867b2e17cb0c","year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.592915Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:911207fb6d995e83b66bcec581fed02e497166f6db3becbb9aefeb28387609a0","observation_id":"7e1c343b-d32b-4e9e-9c8d-58cc03b9a682","resolution":{"observed_at":"2026-08-12T14:17:01.187081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.164597Z","title":"Robots learn social skills: End-to-end learning of co- speech gesture generation for humanoid robots,","venue":null,"work_id":"85b6a883-876f-4c39-9a45-e941a04bd5b0","year":2019},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.597094Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:5cd65efa7255703ac72cde2d8560edbf01686b72baaa89ea6023a35377693e59","observation_id":"2c1254bc-6d92-432b-8969-079d804f6349","resolution":{"observed_at":"2026-08-12T14:17:01.170157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.147744Z","title":"chinese speech pretrain,","venue":null,"work_id":"025059e2-9c3f-4ebb-96d5-9343b06dfa49","year":2022},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.601661Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:368fc83eb2fe086e88a2c89f81138659d4d921127b4eddca1516bc718dfcac9a","observation_id":"e289d0e2-23dc-4e3c-9802-cdf92a036c80","resolution":{"observed_at":"2026-08-12T14:17:01.152738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.125355Z","title":"Hand and mind: What gestures reveal about thought,","venue":null,"work_id":"3fc8c4d6-8ec2-4b47-99ec-520f61ed7ba9","year":1992},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.605924Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:6e04608722c99c95eb442480d7c71774c4bf7b823eed3d024d1215f03ccc5462","observation_id":"7af6204c-aebb-4549-9638-d7379fe0ffce","resolution":{"observed_at":"2026-08-12T14:17:01.134088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.610099Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.610099Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:1d8cd205da71ae8706eb37d4e4641306f86fac1f70008d7c63f7d0e563077475","observation_id":"32c75d3c-be01-4b00-940c-0577ec557a3a","resolution":{"observed_at":"2026-08-12T14:17:00.610099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.096630Z","title":"Deep unsupervised learning using nonequilibrium thermodynamics,","venue":null,"work_id":"497be703-b9bc-4fdd-88af-af27229e3edb","year":2015},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.614428Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:edeb9a2d96ae79f086e1f6e5171779adb17261550978506f6cf3e62f58236192","observation_id":"dbb3583f-e517-4747-9818-9cc316e04ba2","resolution":{"observed_at":"2026-08-12T14:17:01.101912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.078023Z","title":"sur la th ´eorie du mouvement brownien,","venue":null,"work_id":"d45ba3ca-f211-4079-b1c7-c9f688128cf5","year":1908},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.618678Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:0a57fca94d8b9353d8d84335f9640f34fc48e18e7a168c3bd17e4d2edd9bbee9","observation_id":"2e8a39c7-1684-4bd5-b9f3-4b52bd7f9ebe","resolution":{"observed_at":"2026-08-12T14:17:01.084440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.061689Z","title":"Autoregressive denoising diffusion models for multivariate probabilistic time series forecasting,","venue":null,"work_id":"663bbe97-8d8a-444f-91ea-1f1132b83c6a","year":2021},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.622873Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:d2737a24067900cce5f6f2910a1232d0f211dea337a526842f40b918d9d9527f","observation_id":"9992ab7b-a54d-4c6c-b176-d8f4ac5b5abe","resolution":{"observed_at":"2026-08-12T14:17:01.067413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.044657Z","title":"Style-Controllable Speech-Driven Gesture Synthesis Using Normal- ising Flows,","venue":null,"work_id":"9777a577-311c-403c-b7fc-e3656a9ea292","year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.627269Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:2893272c3fed299d08ac220c334530a8a8a45fa3e528af52c62b90816622f7ec","observation_id":"565bc0b7-1107-4bf2-a63c-4eaa2fc6cdbe","resolution":{"observed_at":"2026-08-12T14:17:01.050540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.026287Z","title":"Practical parameterization of rotations using the expo- nential map,","venue":null,"work_id":"f1837edf-e353-4f00-8ee0-f4c22fa1ae6c","year":1998},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.631427Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:df728f4392996ae452c5de4e2d32c6d9af58fdc4599d589df1c4ffb8019d9dc2","observation_id":"39fc4f76-241c-40fc-8312-f5c1386c57c8","resolution":{"observed_at":"2026-08-12T14:17:01.032287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:01.008413Z","title":"Taming diffusion models for audio-driven co-speech gesture generation,","venue":null,"work_id":"a212ef0c-d69b-4964-a8e5-64ea4297e889","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.635471Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:a2180f885ea95e6cf5afee60c8f577293d7f9eeb0bcaf49c5459696d86d7be56","observation_id":"d44c918c-2f37-4e26-a2d6-407d85278394","resolution":{"observed_at":"2026-08-12T14:17:01.013824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.976716Z","title":"The genea challenge 2023: A large-scale evaluation of 12 gesture generation models in monadic and dyadic settings,","venue":null,"work_id":"5bcc89ac-65df-4172-ab3c-cbf078256595","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.639971Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:e5d5b335ebe586c4ca92b1e62b0eed8cfc8896444dd59a93c487f39a7ebe54dc","observation_id":"d3b09697-280d-4c4d-9581-38a7a20703ca","resolution":{"observed_at":"2026-08-12T14:17:00.981585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.961707Z","title":"To rate or not to rate: Investigating evaluation methods for generated co-speech gestures,","venue":null,"work_id":"102eab93-db65-40fb-9a8b-add3a804bfab","year":2021},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.644152Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:cc3162cc13718b145efedac397bade3be6dc2697fef4bbff3ae62d41cb2eae68","observation_id":"cfb99d7c-b6a0-43a4-85fe-c5e4997f4efb","resolution":{"observed_at":"2026-08-12T14:17:00.966317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.947109Z","title":"Speech gesture generation from the trimodal context of text, audio, and speaker identity,","venue":null,"work_id":"e56c15fe-5b66-4966-8d82-8c5aab09c989","year":2020},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.648483Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:8a4182ba28248de62610b5faa02d241754764a145efc10552531edba1416e362","observation_id":"4389f7b5-71ff-4654-a77a-06097ae9977f","resolution":{"observed_at":"2026-08-12T14:17:00.952051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.931733Z","title":"Ai choreographer: Music conditioned 3d dance generation with aist++,","venue":null,"work_id":"36e55d33-efbe-48b0-8f68-d2fa62656535","year":2021},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.652923Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:990443cdfb5b3e876dc7e32e34db65b9c443df586ea95b2c6c6d7a17c9c70bf9","observation_id":"869a70dc-467e-468c-881b-f5e31c2350a8","resolution":{"observed_at":"2026-08-12T14:17:00.937272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.657039Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilibrium,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.657039Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:b90c3fabc0c0d3e6be4b75dafccbae9ea1b09e53abc1f8d4ec65e43f9a438cea","observation_id":"eba4f2d5-487f-4566-ad62-ae37ac2529c3","resolution":{"observed_at":"2026-08-12T14:17:00.657039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08737","last_updated":"2024-03-28T16:59:24Z","snapshot_observed_at":"2026-08-13T12:24:00.586316Z","submitted_at":"2023-03-15T16:21:50Z","title":"Evaluating gesture generation in a large-scale open challenge: The GENEA Challenge 2022","version":2},"cited_work":{"arxiv_id":"2303.08737","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.08737","snapshot_observed_at":"2026-08-12T14:17:00.700505Z","title":"Evaluating gesture generation in a large-scale open challenge: The GENEA Challenge 2022","venue":"cs.HC","work_id":"e72267bf-c519-4930-8466-dd910e8132a7","year":2023},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.661545Z"},"links":{"cited_paper":"/paper/2303.08737","citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:0769364c30368b85e0867e6adb1634c73c06f68de99c983455352da4343f0087","observation_id":"6d2b75ad-8681-4e54-b843-f08ba3dbf5aa","resolution":{"observed_at":"2026-08-12T14:17:00.707160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:17:00.908544Z","title":"Simplifying, stabilizing and scaling continuous- time consistency models","venue":null,"work_id":"9e143101-cead-4fae-ae60-9ebbc5cf38a2","year":null},"citing_paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:17:00.665972Z"},"links":{"citing_paper":"/paper/2411.16729"},"observation_digest":"sha256:d79505f8b13353eddd85e47847cec6314a45028a91def318078c363ed1f6e379","observation_id":"3c26c27f-8c1b-49f4-bf85-ef4a96858f99","resolution":{"observed_at":"2026-08-12T14:17:00.913308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.16729","last_updated":"2024-11-23T08:02:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-14T03:54:35.814746Z","submitted_at":"2024-11-23T08:02:03Z","title":"DiM-Gestor: Co-Speech Gesture Generation with Adaptive Layer Normalization Mamba-2"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":2,"verified_fuzzy":26},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2411.16729."}