{"as_of":"2026-08-16T22:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c25c106a84a0655f8cae20d508d1f94e61a7fdab6472445197e0b6d671fa876","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:51:32.702267Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:40:38.072150Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T14:25:02.434510Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-08-15T16:40:38.072150Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling w/ paralinguis- tic vocalizations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.02523","last_updated":"2025-09-02T17:22:54Z","snapshot_observed_at":"2026-08-15T16:35:12.156619Z","submitted_at":"2025-09-02T17:22:54Z","title":"Flavors of Moonshine: Tiny Specialized ASR Models for Edge Devices","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:40:38.072150Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2509.02523"},"observation_digest":"sha256:276691305eedec13c79863c864d9551a4b13e0109ba2739c7efaef7d0ceef337","observation_id":"4a89afb3-bc58-402c-a22f-e4a9c46b3b84","resolution":{"observed_at":"2026-08-15T16:40:38.072150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2604.00688","last_updated":"2026-04-21T12:14:57Z","snapshot_observed_at":"2026-07-06T22:51:26.754746Z","submitted_at":"2026-04-01T09:45:51Z","title":"OmniVoice: Towards Omnilingual Zero-Shot Text-to-Speech with Diffusion Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T23:00:18.720371Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2604.00688"},"observation_digest":"sha256:511e4f337c519099e18d066fd57adc333c881c211b882924553142648859d753","observation_id":"dc465a96-f3af-4c05-bdc3-c67a12c398db","resolution":{"observed_at":"2026-05-13T23:03:24.826968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2604.16211","last_updated":"2026-04-21T13:32:36Z","snapshot_observed_at":"2026-08-15T12:03:55.265841Z","submitted_at":"2026-04-17T16:20:55Z","title":"NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T07:37:44.393592Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2604.16211"},"observation_digest":"sha256:12a3bfef5cfe88c7564548a995502c93411226a3b4868317e9aa9517f0474c53","observation_id":"610ee6e7-2250-4543-8895-9e5295d4fd57","resolution":{"observed_at":"2026-05-10T07:47:13.005685Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2604.22225","last_updated":"2026-04-24T05:01:55Z","snapshot_observed_at":"2026-08-15T03:59:58.416838Z","submitted_at":"2026-04-24T05:01:55Z","title":"TTS-PRISM: A Perceptual Reasoning and Interpretable Speech Model for Fine-Grained Diagnosis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T12:03:11.243693Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2604.22225"},"observation_digest":"sha256:60fb0df6caac2ad2e0288f4ada781ca80968416d99af684409637e7e770b7de4","observation_id":"ecc84b56-edce-420c-b44d-25ffcba4899c","resolution":{"observed_at":"2026-05-11T19:21:09.976948Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2605.12036","last_updated":"2026-05-12T12:19:33Z","snapshot_observed_at":"2026-08-13T07:38:15.282647Z","submitted_at":"2026-05-12T12:19:33Z","title":"Towards Fine-Grained Multi-Dimensional Speech Understanding: Data Pipeline, Benchmark, and Model","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T04:03:27.608638Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2605.12036"},"observation_digest":"sha256:2de9dbc75afd13aab44b326885c5ba96b311dc579483058da2ec6377b1fd303d","observation_id":"16435fef-12da-4d26-819a-82ef45fa8ac9","resolution":{"observed_at":"2026-05-13T04:07:13.507801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2607.01563","last_updated":"2026-07-02T00:43:14Z","snapshot_observed_at":"2026-08-02T20:14:44.151587Z","submitted_at":"2026-07-02T00:43:14Z","title":"Beyond Words: Towards Effective Modeling of Non-Verbal Vocalizations in ASR","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T00:29:39.365107Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2607.01563"},"observation_digest":"sha256:919b2120421dc64095497b66e389c90de49bc79ee9031e1fa5bf58e29b051a03","observation_id":"8eb7ae9c-ae45-4db1-b2f8-41d6733a6577","resolution":{"observed_at":"2026-07-03T00:37:29.604600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":"2508.04195","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-07-08T14:25:02.434510Z","title":"Nvspeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations","venue":"cs.SD","work_id":"c4a043ef-1a77-44f9-acec-11c81b7809e4","year":2025},"citing_paper":{"arxiv_id":"2607.06179","last_updated":"2026-07-07T11:57:26Z","snapshot_observed_at":"2026-08-16T08:51:06.721807Z","submitted_at":"2026-07-07T11:57:26Z","title":"TriA Pipeline: A Large-Scale Automatic Audio Annotation Pipeline For Audio Classification In Specific Scenarios","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T14:20:24.828073Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2607.06179"},"observation_digest":"sha256:4c3a05046668c9c95384993ef3f8d38c4403f7eb890cdf9284eccda3ad7f9354","observation_id":"780fd3bc-2880-4093-a9f3-601039e19f43","resolution":{"observed_at":"2026-07-08T14:25:02.436023Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.04195","snapshot_observed_at":"2026-08-01T14:01:52.696984Z","title":"NVSpeech: An integrated and scalable pipeline for human-like speech modeling with paralinguistic vocalizations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18934","last_updated":"2026-07-21T10:19:17Z","snapshot_observed_at":"2026-08-14T01:24:51.897038Z","submitted_at":"2026-07-21T10:19:17Z","title":"Transcription Policy as a Latent Variable: Activating Controllable Verbatim ASR with Word-Level Timing","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:01:52.696984Z"},"links":{"cited_paper":"/paper/2508.04195","citing_paper":"/paper/2607.18934"},"observation_digest":"sha256:4a42d945ac4edfe4bb235ddd02f5c4c6876231533749e56cf2e61fd85acef58c","observation_id":"d6960b66-d470-4ba4-9ba0-c4a9026b2694","resolution":{"observed_at":"2026-08-01T14:01:52.696984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.04195/citation-record","integrity":"/paper/2508.04195/integrity","json":"/paper/2508.04195/citation-record.json","paper":"/paper/2508.04195"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:29.419290Z","title":", \" * write output.state after.block = add.period write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.419290Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:6a8fcd89b03c34191a675f8f2615bad82f58b62024a1b8f1f02531e0a60b795b","observation_id":"a7329c7c-d665-42d1-83e9-0297e80d850d","resolution":{"observed_at":"2026-08-06T00:51:29.419290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:29.470752Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.470752Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:bd631e038308bca97578be150dd262968a84334636f4eea45dcf212467038248","observation_id":"72272a94-9074-45d3-9444-56577ac6960d","resolution":{"observed_at":"2026-08-06T00:51:29.470752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-16T13:36:59.551255Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-06T00:51:29.524524Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.524524Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:500f33ba55c0e585bfe968488c0ba8944dbfe4239ec24e0520636773f1114c7b","observation_id":"001b74c3-9d4b-4ac2-b2fd-de1a1b7f24b0","resolution":{"observed_at":"2026-08-06T00:51:29.524524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01339","last_updated":"2024-03-31T00:38:02Z","snapshot_observed_at":"2026-08-16T14:04:56.128499Z","submitted_at":"2024-03-31T00:38:02Z","title":"Humane Speech Synthesis through Zero-Shot Emotion and Disfluency Generation","version":1},"cited_work":{"arxiv_id":"2404.01339","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.01339","snapshot_observed_at":"2026-08-06T00:51:33.198619Z","title":"Humane Speech Synthesis through Zero-Shot Emotion and Disfluency Generation","venue":"cs.CL","work_id":"042e3538-2208-493e-a807-a1c56bc387b2","year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.579149Z"},"links":{"cited_paper":"/paper/2404.01339","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:58e784bb1d2dce600acd16ee30a68183797be5ea5cf4619905afabf488be30d3","observation_id":"bc2d1ba8-8745-4564-bf8f-7f57b24c0aa9","resolution":{"observed_at":"2026-08-06T00:51:33.246231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-16T16:07:52.895019Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:51:29.678062Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.678062Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:d2137d73a350ea2ac63d6af0084c9fe60e2bb534721d1ba48d1ed4fe202db349","observation_id":"f7251430-0160-4158-b836-a7496021ba59","resolution":{"observed_at":"2026-08-06T00:51:29.678062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T00:51:29.737750Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.737750Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:e1b95cc923c8e71a48f0aab8d5be1bcfd5fb6c463c4d5ee79d1a920312d36b1e","observation_id":"c2d1e50e-b985-4320-bbcb-8f6a59ffe200","resolution":{"observed_at":"2026-08-06T00:51:29.737750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T00:51:29.827602Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.827602Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:32378b20e3a03953b6513265a98ee6a17e7383d3f8c274163f098949f2df0cf9","observation_id":"9ca561e2-bdbc-49fa-8171-9c771a950e8b","resolution":{"observed_at":"2026-08-06T00:51:29.827602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:36.476817Z","title":null,"venue":null,"work_id":"8c0a16eb-922b-4785-bf48-ee37280a3853","year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.891439Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:ca96809568b01d6723259f37567f4a271006aa77e194b7c6695a390443a7db3e","observation_id":"c3fbd9e7-19a0-47af-93b3-4c819a8ee3e5","resolution":{"observed_at":"2026-08-06T00:51:36.556797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-16T06:25:22.037199Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-06T00:51:29.957770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.957770Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:32196ed9a603bc7f46e5da6e5e9cf7be628f3d0fa22356e717c9e42e8cb765ff","observation_id":"ea8f7aa4-6cb6-4a43-a588-7b5dfc2e2fbf","resolution":{"observed_at":"2026-08-06T00:51:29.957770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11013","last_updated":"2023-05-18T14:45:09Z","snapshot_observed_at":"2026-08-16T15:31:59.301352Z","submitted_at":"2023-05-18T14:45:09Z","title":"FunASR: A Fundamental End-to-End Speech Recognition Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11013","snapshot_observed_at":"2026-08-06T00:51:30.009070Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.009070Z"},"links":{"cited_paper":"/paper/2305.11013","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:33f1ebb8e3e88f8017e429b36472e3ecd1e3133b544ce8f9693e773e40840c8c","observation_id":"b679bf31-2d50-4682-94bf-78ffa0bfacc2","resolution":{"observed_at":"2026-08-06T00:51:30.009070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-16T16:52:27.830195Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-06T00:51:30.106597Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.106597Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:4000959eb102aff24ad35adadb41900b88b4368f22811e67bc52baf4c155468a","observation_id":"15c7e2f3-41c4-4e96-ba2e-5ba58fe90610","resolution":{"observed_at":"2026-08-06T00:51:30.106597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:36.297200Z","title":"F.; Ellis, D","venue":null,"work_id":"525002c6-3f8a-4bad-ae63-2afe3601c864","year":2017},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.179764Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:674de55cfc0c6bd62a24591b7f0bfa4dbab280db5457f671214251bc645e6368","observation_id":"89df5f50-df60-457b-bc39-d774e3dc31b9","resolution":{"observed_at":"2026-08-06T00:51:36.375230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:36.147447Z","title":null,"venue":null,"work_id":"3b256834-0503-4972-b61c-c341ee916575","year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.195673Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:66e48482668814d7e34a7559e71f4a6b5cc218541094478027f27336e268d470","observation_id":"331361af-2510-447b-bd02-e88df15243df","resolution":{"observed_at":"2026-08-06T00:51:36.216252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.955667Z","title":null,"venue":null,"work_id":"5eeacdcd-2513-4034-bba9-bf1e6b11f4b0","year":2006},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.296507Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:e5c477ea5ef59b7c7caf30cd45bff3c21f63e51b3d331fb7624b0adc12baad71","observation_id":"0deb0d0e-f8ba-4bf9-bad0-278bc699f7b0","resolution":{"observed_at":"2026-08-06T00:51:36.042699Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03283","last_updated":"2025-04-11T07:36:53Z","snapshot_observed_at":"2026-08-16T13:21:11.032842Z","submitted_at":"2024-09-05T06:48:02Z","title":"FireRedTTS: A Foundation Text-To-Speech Framework for Industry-Level Generative Speech Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03283","snapshot_observed_at":"2026-08-06T00:51:30.398007Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.398007Z"},"links":{"cited_paper":"/paper/2409.03283","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:e0f70552b2f63bba1e9cb2b9541e75d32e2f2a05aa1dd6e7a8f7c5987f6ccbee","observation_id":"c671d657-7cf7-46fc-a3ff-b7c02cdf8e9e","resolution":{"observed_at":"2026-08-06T00:51:30.398007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.828916Z","title":null,"venue":null,"work_id":"be329d9a-0806-411b-a3f3-63e764b792d0","year":2016},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.527531Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:3cc7d46a1b432af1132fffc07279883bdc42155438eb1978389d1a023d42f0c5","observation_id":"4b1c2fe0-0dfc-4965-84d1-e33b4bc65832","resolution":{"observed_at":"2026-08-06T00:51:35.882856Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:30.658204Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.658204Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:7c73459e9afed8f0b4617fdc937f176751ab366869accfa058b8d90042ea2ddc","observation_id":"edc42f4b-f738-489b-bf02-57c465a9e932","resolution":{"observed_at":"2026-08-06T00:51:30.658204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07383","last_updated":"2024-03-04T19:15:29Z","snapshot_observed_at":"2026-08-16T14:19:28.426015Z","submitted_at":"2024-02-12T02:58:10Z","title":"Making Flow-Matching-Based Zero-Shot Text-to-Speech Laugh as You Like","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07383","snapshot_observed_at":"2026-08-06T00:51:30.769766Z","title":"E.; Thakker, M.; Yang, H.; Zhu, Z.; Tang, M.; Li, C.; Tsai, C.-H.; Xiao, Z.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.769766Z"},"links":{"cited_paper":"/paper/2402.07383","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:4cabd6a33a7612be31b3f9917d385058a87f7e9d1e2ebbe68924b2a147330245","observation_id":"ee47a100-26eb-4ef5-ba87-838361fe724a","resolution":{"observed_at":"2026-08-06T00:51:30.769766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.640337Z","title":"S.; and Aslin, R","venue":null,"work_id":"91d543ec-5855-4b3f-a446-3fe59d666139","year":2011},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:30.924211Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:3c7d8b6508c04d706a80be1b542d12b8e2a83738fcb05d782fb94d8384a7cd60","observation_id":"3b946c59-8ff3-4d57-96c4-14438a6cac74","resolution":{"observed_at":"2026-08-06T00:51:35.727651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.501167Z","title":null,"venue":null,"work_id":"c805a21e-0128-480a-80ec-7e1fbfc87ff9","year":2020},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.118101Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:f81120dae6571503f867eb36d81af339ab486ff51bdaf8bdae4e3fb6b323afbc","observation_id":"6f58bd19-c46a-484a-ba33-d99fb23b5c44","resolution":{"observed_at":"2026-08-06T00:51:35.582626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.348590Z","title":"M.; and Nass, C","venue":null,"work_id":"233e9fc1-dddd-4357-adca-1d459d3ad953","year":2003},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.272438Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:415cc6329845dc6ead114ea8d4c60ef9b8bd862da753547c2212ba2861bc9528","observation_id":"c48991fa-e5de-4190-a353-fa8ff95e2e32","resolution":{"observed_at":"2026-08-06T00:51:35.440905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.204439Z","title":"E.; Rohde, H.; and Corley, M","venue":null,"work_id":"c7c90956-c353-4d6c-bd56-6ef3197a6da0","year":2017},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.335779Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:8f67a9c7bcd41e9a746b67b694ad1773442ee4b774a2673e4342e4a81292400a","observation_id":"7d22d4cb-c8e1-4550-a9c7-783d4027daf7","resolution":{"observed_at":"2026-08-06T00:51:35.276295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05725","last_updated":"2023-08-10T17:41:19Z","snapshot_observed_at":"2026-08-16T15:09:17.839357Z","submitted_at":"2023-08-10T17:41:19Z","title":"EXPRESSO: A Benchmark and Analysis of Discrete Expressive Speech Resynthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05725","snapshot_observed_at":"2026-08-06T00:51:31.393989Z","title":"A.; Hsu, W.-N.; d'Avirro, A.; Shi, B.; Gat, I.; Fazel-Zarani, M.; Remez, T.; Copet, J.; Synnaeve, G.; Hassid, M.; et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.393989Z"},"links":{"cited_paper":"/paper/2308.05725","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:3a727e28b88233dd662ff3d07cab0a193b8f65bc34596af15cc69081f0107889","observation_id":"4402f487-40f7-461f-be2d-02e40eaa173d","resolution":{"observed_at":"2026-08-06T00:51:31.393989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:35.060389Z","title":null,"venue":null,"work_id":"327deb32-21d4-44fb-a26c-9557b4a4849d","year":2014},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.467268Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:f5e9350c0594ed00ef863f391b7bae5e4f118fdf8d48e24c01f4b684da13db61","observation_id":"90a046bd-2328-42d7-be3b-53404aae77a4","resolution":{"observed_at":"2026-08-06T00:51:35.131919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:31.540103Z","title":"W.; Xu, T.; Brockman, G.; McLeavey, C.; and Sutskever, I","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.540103Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:035ac9e7de453af457580928bc89007841815d7d589cbbdb03c5ba947cbd991b","observation_id":"4d568a58-48f6-438a-bb20-7a83a32d2c25","resolution":{"observed_at":"2026-08-06T00:51:31.540103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.916663Z","title":"M.; Li, G.; and Du, C","venue":null,"work_id":"dad8362c-f594-47f2-a312-0c1e02154772","year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.638027Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:553d75a7f3807c0dba33df43c3ea11028ef8851318cb6dada0a90cfcd9fec325","observation_id":"e61ee274-39f3-4365-b648-63172564e471","resolution":{"observed_at":"2026-08-06T00:51:34.968392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.698687Z","title":null,"venue":null,"work_id":"63df8673-20af-4948-83e1-442f816578c7","year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.749455Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:13cdf84c9f863a44b499ff412dd9b782506fbe613f9b4e04caf2050eda752b0b","observation_id":"f1c1672f-6204-4d98-aea6-49563bb65895","resolution":{"observed_at":"2026-08-06T00:51:34.794508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02152","last_updated":"2022-06-29T13:42:05Z","snapshot_observed_at":"2026-08-16T17:09:10.917820Z","submitted_at":"2022-04-05T12:23:51Z","title":"UTMOS: UTokyo-SaruLab System for VoiceMOS Challenge 2022","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02152","snapshot_observed_at":"2026-08-06T00:51:31.866776Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.866776Z"},"links":{"cited_paper":"/paper/2204.02152","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:ac81c0d6a17c108b2f9d56d8841a12c429b027e305eaa3106c02b1a4427435e0","observation_id":"2ac5f453-ff97-419e-b111-48e6799535e2","resolution":{"observed_at":"2026-08-06T00:51:31.866776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.485980Z","title":null,"venue":null,"work_id":"4b36f567-9c25-40fd-9812-911724f616a0","year":2013},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:31.939646Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:2e7a16f0a6f553cf51c6da2ea86d8cc6b603c645f2531984088f881d6746e2f1","observation_id":"350cd4e5-6116-4810-85fa-692f7834aa6d","resolution":{"observed_at":"2026-08-06T00:51:34.623200Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.281029Z","title":null,"venue":null,"work_id":"e53c4117-1a66-442a-bc16-9b724b5b7fef","year":2017},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.025999Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:2aa56f5a8026875526e1f4225f354b6df1ce2591dee24ade69838232f4a1db61","observation_id":"85795783-f8c7-4e9e-9ce3-5e4595ae444a","resolution":{"observed_at":"2026-08-06T00:51:34.396959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.15561","last_updated":"2021-07-23T12:32:52Z","snapshot_observed_at":"2026-08-16T18:13:35.460831Z","submitted_at":"2021-06-29T16:50:51Z","title":"A Survey on Neural Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.15561","snapshot_observed_at":"2026-08-06T00:51:32.131382Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.131382Z"},"links":{"cited_paper":"/paper/2106.15561","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:3cf813e8d011f0edd244da8c1e9f090fc5068a9a89fb5d3ca664c0df4f227e04","observation_id":"c679a6ea-d81e-483d-a059-f530be6fd47f","resolution":{"observed_at":"2026-08-06T00:51:32.131382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:34.009414Z","title":null,"venue":null,"work_id":"140268b4-c089-4454-8153-d1c9a4c88923","year":2003},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.233349Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:8c5c8c4ab6de0614401d0ab70cf5304ddb7fa2d425a6648b2c6e94a27907749d","observation_id":"c2447670-cbd6-4f8c-9fac-3720882b3d2a","resolution":{"observed_at":"2026-08-06T00:51:34.094456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.768400Z","title":null,"venue":null,"work_id":"f26e1af3-d908-4c68-a4e4-59666ca851d0","year":2013},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.333796Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:ec41e9e713e0cdff5688ea71ccf09826d65bf3c9d06e5290b7a30b0d56da3693","observation_id":"24c5b1c2-1b12-4404-9cba-5c97d514214d","resolution":{"observed_at":"2026-08-06T00:51:33.881745Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08820","last_updated":"2024-06-13T05:23:22Z","snapshot_observed_at":"2026-08-16T13:43:29.193376Z","submitted_at":"2024-06-13T05:23:22Z","title":"DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage","version":1},"cited_work":{"arxiv_id":"2406.08820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08820","snapshot_observed_at":"2026-08-06T00:51:32.844249Z","title":"DisfluencySpeech -- Single-Speaker Conversational Speech Dataset with Paralanguage","venue":"eess.AS","work_id":"8a5ac57b-d56a-42e0-990a-43fa081c3e77","year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.388095Z"},"links":{"cited_paper":"/paper/2406.08820","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:23ab5d9fd8b45c0d25ba6266c55f20cff7d9f39721707d42c279183685a1895e","observation_id":"701de64b-c30b-4506-bb16-5bd8000d593d","resolution":{"observed_at":"2026-08-06T00:51:32.888098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.597101Z","title":null,"venue":null,"work_id":"c195b4bf-0b2d-471c-8dc3-408146db52c3","year":2006},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.480445Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:3ebf55f5bb3f404c385e350aef6ad82ac0f3039ee287e0fd4ab8d9902d041185","observation_id":"fe9c6c71-7323-4996-bf15-f3cd272cfa16","resolution":{"observed_at":"2026-08-06T00:51:33.665539Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.448798Z","title":"E.; Thakker, M.; Tompkins, D.; Tsai, C.-H.; Li, C.; Xiao, Z.; Zhao, S.; Li, J.; et al","venue":null,"work_id":"93f295fa-0031-4216-9069-17d14581fb47","year":2024},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.557490Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:5d9b17ccb097b21c976b773b227a693c67a564bcd5e5e78af46f786f7a9d2308","observation_id":"e1eb9f8d-3177-42f9-a402-81b86bc9775d","resolution":{"observed_at":"2026-08-06T00:51:33.505371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16844","last_updated":"2022-03-31T07:01:06Z","snapshot_observed_at":"2026-08-16T17:10:21.435342Z","submitted_at":"2022-03-31T07:01:06Z","title":"Open Source MagicData-RAMC: A Rich Annotated Mandarin Conversational(RAMC) Speech Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16844","snapshot_observed_at":"2026-08-06T00:51:32.620801Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.620801Z"},"links":{"cited_paper":"/paper/2203.16844","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:544f572c6578564164924c8999a205f259adcac2ecfb57f3ed15a8fcd55bdec1","observation_id":"352d1629-f1fb-4857-a0c5-0c74c2bd5a9d","resolution":{"observed_at":"2026-08-06T00:51:32.620801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:51:33.314511Z","title":null,"venue":null,"work_id":"de2359d1-ff47-4b67-a504-41b1c0e30c0f","year":2023},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:32.702267Z"},"links":{"citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:2bc9cddaee5f10d15ecb8b9528d0da03d13a21eb1eba5553717e04f2a2a2821b","observation_id":"b3f16aa5-609e-407f-8418-baa6bc143a82","resolution":{"observed_at":"2026-08-06T00:51:33.368415Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 8 inbound Pith citation observations for arXiv:2508.04195."}