{"as_of":"2026-08-20T04:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a399fc79d6940e3317a78b77619d60122ae9d97f56ca2257a26de6163f20db0","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T12:23:32.145017Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.14333/citation-record","integrity":"/paper/2412.14333/integrity","json":"/paper/2412.14333/citation-record.json","paper":"/paper/2412.14333"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:34.063091Z","title":"Style-controllable speech-driven gesture synthesis using normalising flows","venue":null,"work_id":"c4882694-5d07-4970-90b3-e0215c74dc2d","year":2020},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.067700Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:1f50b918ed05e608d9a2fa3eb7c1eedb7bc69e9952595bd1fb239ca397c6c76b","observation_id":"de17da21-11c8-4624-9345-2081b1d77823","resolution":{"observed_at":"2026-08-11T12:23:34.067094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:34.050251Z","title":"Rhythmic gesticulator: Rhythm-aware co-speech gesture synthesis with hierarchical neural embeddings.TOG,","venue":null,"work_id":"431fd26b-e09d-422d-9de4-16ae8af2d89e","year":null},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.071913Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:536e0be280f6589c773b3aac1c74e1d4c331837edb3f334c9324c4af40a3c9a3","observation_id":"a9721ad2-9eb5-4a52-aa1f-eb44464dc39c","resolution":{"observed_at":"2026-08-11T12:23:34.055410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:34.038011Z","title":"Gesturediffuclip: Gesture diffusion model with clip latents","venue":null,"work_id":"4730b026-2286-48d6-8804-561343f90c30","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.146258Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:40deaf24c1d7cd0bdf0eafbe89d92d2e88d992e13490d79b7b600a191b4dec34","observation_id":"ec3ddc86-7edc-4399-9931-f85138335ec9","resolution":{"observed_at":"2026-08-11T12:23:34.042875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:31.244880Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.244880Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:54cfdac102f4f8183700749ea32709e02e22bd69e9f255305a907ab39660e95f","observation_id":"2bac6dbe-5ece-4b5c-98fa-d48cb7f3b6e6","resolution":{"observed_at":"2026-08-11T12:23:31.244880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:34.019298Z","title":"Diffsheg: A diffusion-based approach for real-time speech-driven holistic 3d expression and ges- ture generation","venue":null,"work_id":"916450ce-08f2-4cf8-a844-e3cb18d7a055","year":2024},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.351151Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:9a1ffea1a982cb838a0b056bc96b8440ad03fe99403ade5c93be58321e2d5fa2","observation_id":"557dc6e7-913f-4e05-ae09-43013793edcb","resolution":{"observed_at":"2026-08-11T12:23:34.024075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:34.008132Z","title":"Hierarchical cross-modal talking face generation with dynamic pixel-wise loss","venue":null,"work_id":"4d4b6635-5391-4a90-9c4b-073593d930bf","year":2019},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.404157Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:9a7e1a2984d8c7d9d696f0b318a93a066fea04c792942a7f7bd94a7b51a5560b","observation_id":"c6580a61-4b30-4065-9d75-372e39b19e30","resolution":{"observed_at":"2026-08-11T12:23:34.011852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.902381Z","title":"Diffusion-based co-speech gesture genera- tion using joint text and audio representation","venue":null,"work_id":"75bbe558-1409-4b3b-900b-002286f2b1f0","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.438146Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:7623bb3948cf61a9c1b212595a191369d53bc0478a7300b2d6fc089cb874c989","observation_id":"cdf013cc-808f-4df3-a5d0-c63da60afecd","resolution":{"observed_at":"2026-08-11T12:23:33.962297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.753555Z","title":"Faceformer: Speech-driven 3d facial anima- tion with transformers","venue":null,"work_id":"0378a3f6-b35c-4985-9a80-9651bfff9b00","year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.443053Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:36553896062c62381cc088306b8dc50b74563ef2f24170b888946e9dd3254829","observation_id":"b8210488-e2d2-44bc-80a3-217d6e708d0f","resolution":{"observed_at":"2026-08-11T12:23:33.786933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.743338Z","title":"Learning individual styles of conversational gesture","venue":null,"work_id":"e62b9c19-9d75-4ba9-83c6-8e942a64e527","year":2019},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.446861Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:b786e9aad875c43c70ae5162eabb9c3210af2d52e6ea642dac52ce14bf946e2b","observation_id":"615e3994-babb-4e20-8c07-67c13b8abc7f","resolution":{"observed_at":"2026-08-11T12:23:33.747078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.731789Z","title":"Learning speech-driven 3d conversational gestures from video","venue":null,"work_id":"9aeccbd8-7c7b-47e5-81ed-706edd66727d","year":2021},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.451665Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:64c0cacf599dcb1a97ff496add0787873f8aea13453d246ea4c825e6e82f4acd","observation_id":"48695b40-abba-43ad-9950-ea13fdcc28b5","resolution":{"observed_at":"2026-08-11T12:23:33.735805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.717229Z","title":"Deber- tav3: Improving deberta using electra-style pre-training with gradient-disentangled embedding sharing, 2021","venue":null,"work_id":"f491724f-9ffb-4645-a39b-e6c674dbcdb0","year":2021},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.455595Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:0aab397d23093710817066fe3b9dc5aa90746f9a8dd0287af3295c6975ce4063","observation_id":"11677b1a-bee1-497e-8e91-c0593f927221","resolution":{"observed_at":"2026-08-11T12:23:33.723157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.654174Z","title":"Gans trained by a two time-scale update rule converge to a local nash equilib- rium","venue":null,"work_id":"e3e229ba-049b-4fbf-abde-3ef573fe6743","year":2017},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.458972Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:25ac9ee42d906c2f62a1451629befffa84659fd16a22d0d69db27707dd643ddb","observation_id":"7c9035d2-24d3-4caa-8233-764d5fed8cf5","resolution":{"observed_at":"2026-08-11T12:23:33.708910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.502870Z","title":"Denoising diffu- sion probabilistic models","venue":null,"work_id":"6790ed09-43fd-4f9e-8ca3-0bace2866c0f","year":2020},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.463531Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:8c81e6fef6d93e5f9f1f11d43b3f54b00ecf24fcfe43dfa44b7766c43db0ef02","observation_id":"de3028ce-9680-4d18-a986-8b3fd4d38f68","resolution":{"observed_at":"2026-08-11T12:23:33.558058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.489655Z","title":"Parameter-efficient transfer learning for nlp, 2019","venue":null,"work_id":"fb671d16-625f-4b7c-b559-d9de0404403d","year":2019},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.467792Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:ea00ac19200c2ca2191c1ec77093e077c4b16b2f1867b9bf0f818ddc50373ee4","observation_id":"20c1385d-4ad5-44bf-9093-074fb337faf9","resolution":{"observed_at":"2026-08-11T12:23:33.493892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.477505Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units, 2021","venue":null,"work_id":"5ce1bf84-4fc5-4e64-8cb4-74590a6affe3","year":2021},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.472014Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:babe75c839f2ce3ecdd2530c2295a5fafcac83e8ae0eb8e3926e83f68fe61766","observation_id":"21fb5a73-da6c-4413-82df-55c24e98143c","resolution":{"observed_at":"2026-08-11T12:23:33.481714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:31.475850Z","title":"LoRA: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.475850Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:11afd51cfab925eb42a27ba166574545b2c6c3f6b88b3ded0b35c756b5128005","observation_id":"21b5c66a-9c29-4f13-ab8d-5ca186e16be5","resolution":{"observed_at":"2026-08-11T12:23:31.475850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.457655Z","title":"Audio2gestures: Generating diverse gestures from speech audio with conditional varia- tional autoencoders","venue":null,"work_id":"75824400-3c45-4144-ba7f-2129058e44bf","year":2021},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.480398Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:65faedc0789a1fe9d7caa54e32952b795354f1f659b29faa7756390a2c15fb88","observation_id":"d2bf0af0-ec1b-479e-9319-3e959240a69c","resolution":{"observed_at":"2026-08-11T12:23:33.461578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.273592Z","title":"Speech2video synthesis with 3d skeleton regularization and expressive body poses","venue":null,"work_id":"0e660fad-a6ef-480b-8a58-3d7bf88b2340","year":2020},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.485230Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:ed14355c7b08d8ded8b8849e3dc7491a32b41e20dc1cc662e8166540eb606092","observation_id":"3beac673-783f-4fb4-b1fa-07eaa142fbad","resolution":{"observed_at":"2026-08-11T12:23:33.344564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.225811Z","title":"Vision transformers are parameter-efficient audio- visual learners","venue":null,"work_id":"0079f8a0-6266-41f3-a937-d87c199822ff","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.509484Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:69dd93ae6b4d0dd6a82035745840fb2722d1e4db228f176fc65ca6b8c43d1382","observation_id":"f9b12401-f0dd-4737-8d41-8203a1085381","resolution":{"observed_at":"2026-08-11T12:23:33.229564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03829","last_updated":"2020-09-21T05:09:59Z","snapshot_observed_at":"2026-08-18T03:26:27.710641Z","submitted_at":"2020-04-08T06:18:44Z","title":"Exploring Versatile Generative Language Model Via Parameter-Efficient Transfer Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.03829","snapshot_observed_at":"2026-08-11T12:23:31.559189Z","title":"Ex- ploring versatile generative language model via parameter- efficient transfer learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.559189Z"},"links":{"cited_paper":"/paper/2004.03829","citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:4aff910a251d029d2333c1f446490a03048d5836a7dca8a5735747aa7ee679fd","observation_id":"713894c4-4ce2-447a-a95f-c7c77a8c0f5c","resolution":{"observed_at":"2026-08-11T12:23:31.559189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.212830Z","title":null,"venue":null,"work_id":"0f40ecb6-ee25-4dd0-8191-e39f9620254b","year":2024},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.625723Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:3e68b9e114399dbdbc48061a94c5b9691c3eed685336675f2f836494a8c816ef","observation_id":"c6c3e714-6832-4b67-b065-f4c78800753d","resolution":{"observed_at":"2026-08-11T12:23:33.217489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.197078Z","title":"Beat: A large-scale semantic and emotional multi-modal dataset for conversational gestures synthesis, 2022","venue":null,"work_id":"b0c7255a-bcd9-41d9-8bdc-f20424ee512a","year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.630788Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:a4e4530c110d599e884c09ea75974809b99f773cc3393b2ee8ca6bb8b9613466","observation_id":"b4d58b59-2201-4373-a1b0-cfdc17ff6b80","resolution":{"observed_at":"2026-08-11T12:23:33.201901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.181776Z","title":"Audio-driven co-speech gesture video generation","venue":null,"work_id":"d8059767-5e3d-431b-bf8d-cc80c2eeca87","year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.635416Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:624c41928b5c1621187883851e6e0a58399b21723fd984953eb2d50ecd27438a","observation_id":"dc00ff0c-139b-4f82-a4e2-d8ff44e7e33a","resolution":{"observed_at":"2026-08-11T12:23:33.187432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.168110Z","title":"Learning hierarchical cross-modal association for co- speech gesture generation","venue":null,"work_id":"7d962b16-cb80-4980-9939-e8b47b86ee1f","year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.639709Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:f5c4e97a81b1db83dd12522497c72a374f14a3ff0447410bda8628df0a3ef643","observation_id":"7b77b202-17d8-499d-8376-c9bdbddc2b0a","resolution":{"observed_at":"2026-08-11T12:23:33.172649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.154586Z","title":"Roberta: A robustly optimized bert pretraining approach, 2019","venue":null,"work_id":"e275cd5f-131e-42d3-9f55-1605d75d4605","year":2019},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.644071Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:bdc19f50133bac884c8292eef4fb78bacc959ae9213261e58e8fb72c990b466b","observation_id":"f53deabb-5f77-46f0-ad37-9ff8c9a2eaa2","resolution":{"observed_at":"2026-08-11T12:23:33.160042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.09865","last_updated":"2022-08-31T05:12:59Z","snapshot_observed_at":"2026-08-18T03:21:04.083062Z","submitted_at":"2022-01-24T18:40:15Z","title":"RePaint: Inpainting using Denoising Diffusion Probabilistic Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.09865","snapshot_observed_at":"2026-08-11T12:23:31.648637Z","title":"Repaint: Inpaint- ing using denoising diffusion probabilistic models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.648637Z"},"links":{"cited_paper":"/paper/2201.09865","citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:4b360b84a5997625447d489cac26022726d12b1831ff71c01c8f77b60c7833b6","observation_id":"9a85b79f-4e6d-40e0-a575-d987a1b2d6d5","resolution":{"observed_at":"2026-08-11T12:23:31.648637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.141525Z","title":"Lcm-lora: A universal stable-diffusion acceleration module, 2023","venue":null,"work_id":"dd5b645b-022a-490a-9c17-b95b9a8c2bea","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.652690Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:063b2e241b2bf49a50df25a9601487b120a59678b2f96cb64bc746d6db09ef3a","observation_id":"07f3fe2b-a012-478f-af69-f311ecb3beda","resolution":{"observed_at":"2026-08-11T12:23:33.146076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:33.068916Z","title":"Bodyformer: Semantics-guided 3d body gesture synthesis with transformer","venue":null,"work_id":"f95b5155-0e65-46d4-bb67-c7e87e642890","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.656916Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:d4a032a639ba956434edee2a0ac2da69687d0248fd9cdf1cea05db98df78dec7","observation_id":"552df057-bb53-4636-ada1-7b0a805806bf","resolution":{"observed_at":"2026-08-11T12:23:33.132275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:31.661292Z","title":"Sdxl: Improving latent diffusion models for high-resolution image synthesis, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.661292Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:05584960f47ba6f5fff58ec58e2a9816ede2db16f2e173ec9c996353dc918dae","observation_id":"a70b11a5-f6d2-4532-9a90-6999b548749f","resolution":{"observed_at":"2026-08-11T12:23:31.661292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.917234Z","title":"Speech drives templates: Co-speech gesture synthesis with learned templates","venue":null,"work_id":"2507ede8-001f-42c1-894c-a492a7b94397","year":2021},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.665586Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:ec15cc2812dc8aa106297a35b678ef9440e831537bc1efd0d7502b3a487862ab","observation_id":"80da1581-1b76-42e4-acd6-8771970f700e","resolution":{"observed_at":"2026-08-11T12:23:32.945360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.904413Z","title":"Hierarchical text-conditional image gener- ation with clip latents, 2022","venue":null,"work_id":"ced6c2fb-afc8-4618-ad40-d6adcd6d255a","year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.669295Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:9b51124ab867e164070b8db002edfedc18f97adc33290c2176a30b40d4902c86","observation_id":"03897cd4-7687-4f4b-b9a7-92e269978dba","resolution":{"observed_at":"2026-08-11T12:23:32.908236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.891380Z","title":"Bilen, and A","venue":null,"work_id":"7b0a0e6c-7256-403f-8ea5-9cd2b60c6ac0","year":2017},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.674290Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:6daf7f148cad39f963c18633b8ece8440c262b93ea34c316784727ffd259a4a6","observation_id":"8d306477-907f-4374-9411-b591ef803086","resolution":{"observed_at":"2026-08-11T12:23:32.896346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:31.735738Z","title":"Difftalk: Crafting diffusion models for generalized audio-driven portraits animation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.735738Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:4457bd9e015d46c55ce17fed44f0216519f12a66bd57951833e7cf99209dcfdf","observation_id":"c89492ae-6577-45de-baf7-dc664f340397","resolution":{"observed_at":"2026-08-11T12:23:31.735738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.872695Z","title":"Co-speech gesture synthesis by reinforcement learning with contrastive pre- trained rewards","venue":null,"work_id":"1bec1f91-262a-4017-9612-9365c390d947","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.860240Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:e6e8b166791efcee95c912ce86ceee78abf2c02a1708ce67c7bdb4416608ca3d","observation_id":"5f0b0f00-ad23-4374-a57f-fe707b79a10c","resolution":{"observed_at":"2026-08-11T12:23:32.876344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.861084Z","title":"Human motion diffu- sion model","venue":null,"work_id":"5b6a1db4-4704-4f99-adb7-8ad2c0d4aab6","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:31.997537Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:d3b3b3c246e5fb051ded11c59b7b2d1169c8beb9c6ff8827e48c63ae87d0bca4","observation_id":"87c1cf54-64d6-473f-bf6c-16a79e484b47","resolution":{"observed_at":"2026-08-11T12:23:32.865114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.781446Z","title":"Imitator: Personalized speech-driven 3d facial animation","venue":null,"work_id":"ee46fe90-df78-47b7-bcd0-e45bdabf2040","year":null},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.055724Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:846fe4c929911a2f05280f4d401f30f8dd7f8a696195560abba8d49bf0757abb","observation_id":"71eb2280-5116-44be-a9c9-f36253d81bf9","resolution":{"observed_at":"2026-08-11T12:23:32.853046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.577797Z","title":"Edge: Editable dance generation from music","venue":null,"work_id":"7455c0b2-5849-437f-9d5a-796e358389db","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.107837Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:9ecb0f8db7cb0cbd0884e8fb6a6a4854c37d970330100f21ab258ed76101b438","observation_id":"863fe772-c987-4f60-94c2-2a0dd2a8a784","resolution":{"observed_at":"2026-08-11T12:23:32.631868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.564446Z","title":"FVD: A new metric for video generation, 2019","venue":null,"work_id":"b24eb8ee-89ec-4b03-abd5-afbd48923862","year":2019},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.112009Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:c1f3aa6fe4714fac5b332d35259449d8d0f31b2e11d67ecb57a28eb3ae06fd7e","observation_id":"60783e95-6633-4e84-90b1-dd7ec2560c3f","resolution":{"observed_at":"2026-08-11T12:23:32.568816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.116235Z","title":"Codetalker: Speech-driven 3d facial animation with discrete motion prior","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.116235Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:656b6de4a0424c1b90ebe83334258c325666836b643744b3dd312032490b8cbc","observation_id":"a3dd28c5-08eb-40f2-8194-3abf1315680c","resolution":{"observed_at":"2026-08-11T12:23:32.116235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.546269Z","title":"Diffus- estylegesture: Stylized audio-driven co-speech gesture gen- eration with diffusion models","venue":null,"work_id":"a2d7a059-fe6b-4f9b-9454-5b81540c8fee","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.120331Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:b8d5b7c3ad653024e51cd16d987450035e1a5eff85a1ae3edff73c191e4211d1","observation_id":"b9b8f6bb-cecd-4398-a466-ecbe5407879e","resolution":{"observed_at":"2026-08-11T12:23:32.549848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.533599Z","title":"Audio-driven stylized gesture generation with flow-based model","venue":null,"work_id":"ca4c5350-61b5-4c88-9d9b-599ad8f08943","year":null},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.123995Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:afe40a6b8963e7ece74ec518e46b96080111ebe2a5607cae54970cca2b028c15","observation_id":"cedc24dd-d7d9-43d2-8cb5-8f859c98dbd8","resolution":{"observed_at":"2026-08-11T12:23:32.537909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.128384Z","title":"Generating holistic 3d human motion from speech","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.128384Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:ab06870d75284b7a21178796f0ed153552b9a745c40b2c52ed26d9b87fb8fc6a","observation_id":"4a377408-9a49-42e6-87b7-3fee53773318","resolution":{"observed_at":"2026-08-11T12:23:32.128384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.513849Z","title":"Speech ges- ture generation from the trimodal context of text, audio, and speaker identity","venue":null,"work_id":"58a70696-737a-4909-ba72-150a636a8590","year":2020},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.132159Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:d644549ea600213c1033c789005dac0d889a07d4149bdf509c944eb28dc405c2","observation_id":"d4ce4ed1-0bf4-4622-87c7-c2da91e4a42d","resolution":{"observed_at":"2026-08-11T12:23:32.518223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.416532Z","title":"Robots learn social skills: End-to-end learning of co-speech gesture generation for hu- manoid robots","venue":null,"work_id":"b49db38f-cfe6-4d67-a705-ee11e09b593c","year":2019},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.135661Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:1582d81d0b21aba68305a7b0f2ce67a4247df261068937132477d06aa1ad12c6","observation_id":"5fef76ce-c3ee-49b9-8c4c-49c02e99bac4","resolution":{"observed_at":"2026-08-11T12:23:32.505102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.12194","last_updated":"2023-03-13T08:40:32Z","snapshot_observed_at":"2026-08-18T03:26:35.867985Z","submitted_at":"2022-11-22T11:35:07Z","title":"SadTalker: Learning Realistic 3D Motion Coefficients for Stylized Audio-Driven Single Image Talking Face Animation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.12194","snapshot_observed_at":"2026-08-11T12:23:32.140530Z","title":"Sadtalker: Learning realistic 3d motion coefficients for stylized audio- driven single image talking face animation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.140530Z"},"links":{"cited_paper":"/paper/2211.12194","citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:b0c18efe0105e6da9a5c87409c9c4f2022a73f0d14e98cf5a367d8d7c190e6ac","observation_id":"d7a1bf6b-3431-4b71-996a-e67f7e06493d","resolution":{"observed_at":"2026-08-11T12:23:32.140530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T12:23:32.210716Z","title":"Taming diffusion models for audio-driven co-speech gesture generation","venue":null,"work_id":"3c58e98f-1346-4d77-81f1-14fc0f823d32","year":2023},"citing_paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T12:23:32.145017Z"},"links":{"citing_paper":"/paper/2412.14333"},"observation_digest":"sha256:1fd81dedfae9bce45d83577b88b10de03c3f9021341a57751fb598e1efffcf20","observation_id":"d7c2bcfc-c6d6-4d40-bbaf-aee0cc5155d1","resolution":{"observed_at":"2026-08-11T12:23:32.283367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.14333","last_updated":"2024-12-18T21:02:07Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:23:26.649824Z","submitted_at":"2024-12-18T21:02:07Z","title":"Joint Co-Speech Gesture and Expressive Talking Face Generation using Diffusion with Adapters"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":36},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2412.14333."}