{"as_of":"2026-08-14T22:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a323dec38db0d8d7ffbf98c30c106233702ad194251f374f9b9f10ba2427d41","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:56.416700Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:54.000523Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T14:17:56.702242Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"cited_work":{"arxiv_id":"2505.19437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19437","snapshot_observed_at":"2026-08-07T14:17:56.702242Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","venue":"cs.SD","work_id":"565444d4-3317-49f9-9617-a7c0d7a8a59b","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.000523Z"},"links":{"cited_paper":"/paper/2505.19437","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:feb95a7fedd618ec858ef8bd7fe728e8a3c3ec5619ae02f9a76b255d1a5f463f","observation_id":"a4d2841a-34d1-4abc-8a00-52bae8c84bb5","resolution":{"observed_at":"2026-08-07T14:17:56.775310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19437/citation-record","integrity":"/paper/2505.19437/integrity","json":"/paper/2505.19437/citation-record.json","paper":"/paper/2505.19437"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"cited_work":{"arxiv_id":"2505.19437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.19437","snapshot_observed_at":"2026-08-07T14:17:56.702242Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","venue":"cs.SD","work_id":"565444d4-3317-49f9-9617-a7c0d7a8a59b","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.000523Z"},"links":{"cited_paper":"/paper/2505.19437","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:feb95a7fedd618ec858ef8bd7fe728e8a3c3ec5619ae02f9a76b255d1a5f463f","observation_id":"a4d2841a-34d1-4abc-8a00-52bae8c84bb5","resolution":{"observed_at":"2026-08-07T14:17:56.775310Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.946475Z","title":"1, the proposed RA-CLAP model is designed to learn a joint representation of speech and text through a con- trastive learning and self-distillation framework","venue":null,"work_id":"d0ad9169-28d8-4b92-9313-a6b0cff155c2","year":null},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.068751Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:d17d9c0f03276be52b1eabd284ff0440bf2f3b7b52339c31262e83a9979216d9","observation_id":"4fd6735a-f6ad-48e7-9a57-56f91ff8816f","resolution":{"observed_at":"2026-08-07T14:18:01.073427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.588248Z","title":null,"venue":null,"work_id":"b0e0993b-98ce-4ee8-8f4b-e3b9d6ae29f9","year":null},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.170786Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:096a9b6c1d298bfbeceb749355e683c5445845073e3846fde79732d47b7f77de","observation_id":"255fd815-9fcf-4735-8fdd-12a953119b6c","resolution":{"observed_at":"2026-08-07T14:18:00.833157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.322965Z","title":null,"venue":null,"work_id":"e4a3e331-1d38-49e4-8f81-63a8e08e80ce","year":null},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.269768Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:7e6df18e271c86ac96849d293eb52148b367f49882092a206bbe6f34113d8810","observation_id":"22cfcac5-4ecd-4f32-a2f6-cd10482d2d70","resolution":{"observed_at":"2026-08-07T14:18:00.385503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:18:00.010364Z","title":"Multi-level knowledge distillation for speech emotion recogni- tion in noisy conditions,","venue":null,"work_id":"e1d1a438-38db-4a32-8c7b-a79d3f517dac","year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.341870Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:6cb17710e2fb30a6a9b7e820a213568e5982830120983becc529b36e33487973","observation_id":"dcab4470-541c-4159-ab6e-9a460c34c306","resolution":{"observed_at":"2026-08-07T14:18:00.162738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:59.677976Z","title":"Iterative prototype refinement for ambiguous speech emotion recognition,","venue":null,"work_id":"361b2d9e-c8f6-458c-b01e-642b8b9307e1","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.433356Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:0b70c00cc61b20c3448b3bfdc7a244c0310d27f38fb8c0cd57e819ad7b5f5e86","observation_id":"e2d36bc6-127e-4640-b312-de50206a9f3c","resolution":{"observed_at":"2026-08-07T14:17:59.864218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:59.425593Z","title":"Fine- grained disentangled representation learning for multimodal emo- tion recognition,","venue":null,"work_id":"a9a4a2e7-5051-4b4d-96cb-3774fd8d07df","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.525076Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:600deea0b913d0efcf50ddcbaa530a87504bf51cb0cc9878cabc095bdd4439ce","observation_id":"8dcd976f-92b6-47d7-ba03-c5630c96c011","resolution":{"observed_at":"2026-08-07T14:17:59.534203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:59.105371Z","title":"Enhancing multimodal emotion recognition through multi- granularity cross-modal alignment,","venue":null,"work_id":"6826be37-4fe5-4b1b-8327-8f73ff3eea7f","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.622654Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:7b4b77d38b2b23647cafd77cdfa659c26b177d4ae12495d6297b3173d9b843cd","observation_id":"7b381f07-e144-40b8-b0d9-714a6aeccfdf","resolution":{"observed_at":"2026-08-07T14:17:59.287679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:58.822271Z","title":"Enhancing emotion recognition in incomplete data: A novel cross-modal alignment, reconstruction, and refinement framework,","venue":null,"work_id":"a3e930ab-3087-448d-ab85-d1b279e726ec","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.695780Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:d3eeec5d288f08fe29848cbc1ceefd758415f997d133972718d0d52393300f38","observation_id":"24a5fce8-6dbb-496e-a982-5e77b7170dd9","resolution":{"observed_at":"2026-08-07T14:17:58.971264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:58.601749Z","title":"Emotion- preserving prosody anonymization network for voice privacy pro- tection,","venue":null,"work_id":"cbe1c1a4-f6be-4ae1-8fc1-743d29ab895b","year":2025},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.769076Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:7a4dbfc4b6516bf550707b6080beba1e90ad11b254f6af936af66d50ac41b38e","observation_id":"b5e1bef2-6569-419b-a241-a2292c9f7476","resolution":{"observed_at":"2026-08-07T14:17:58.689480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06055","last_updated":"2023-12-11T01:23:50Z","snapshot_observed_at":"2026-08-13T05:05:31.512416Z","submitted_at":"2023-12-11T01:23:50Z","title":"Speaker-Text Retrieval via Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06055","snapshot_observed_at":"2026-08-07T14:17:54.860761Z","title":"Speaker-text retrieval via contrastive learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.860761Z"},"links":{"cited_paper":"/paper/2312.06055","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:23d0225c630ea573f514bec11544d951e844e3052659a1f5e5663fa4e3ce6a7d","observation_id":"7b76d34f-d7e0-4a80-be68-e6aa57a9c381","resolution":{"observed_at":"2026-08-07T14:17:54.860761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07203","last_updated":"2024-06-11T12:23:01Z","snapshot_observed_at":"2026-08-12T23:45:36.635055Z","submitted_at":"2024-06-11T12:23:01Z","title":"ParaCLAP -- Towards a general language-audio model for computational paralinguistic tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07203","snapshot_observed_at":"2026-08-07T14:17:54.955489Z","title":"Paraclap– towards a general language-audio model for computational par- alinguistic tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:54.955489Z"},"links":{"cited_paper":"/paper/2406.07203","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:49bf9a505ec71b37ee1d9b080ce56a1fe08b7409ba22944297492d83b22431ba","observation_id":"5c13774c-0ad4-4b6f-be57-d16cd86060c4","resolution":{"observed_at":"2026-08-07T14:17:54.955489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.047419Z","title":"Prompttts: Control- lable text-to-speech with text descriptions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.047419Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:fc9d02b9b8a816ffdd95c48e35e56511defb3bf47f0cda69a1f7e691c48cc952","observation_id":"885dc978-f9c3-4645-afed-bb1808695639","resolution":{"observed_at":"2026-08-07T14:17:55.047419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.119979Z","title":"Prompttts++: Controlling speaker identity in prompt-based text-to-speech using natural language descriptions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.119979Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:c3861b75e63aec5750de0799aaeffe38ef9f2ee93ba8977ad5458be0624baa70","observation_id":"2dde2d89-3f11-4d8f-8a91-71334313d05a","resolution":{"observed_at":"2026-08-07T14:17:55.119979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:58.307118Z","title":"Stylecap: Automatic speaking-style captioning from speech based on speech and lan- guage self-supervised learning models,","venue":null,"work_id":"cc732c1d-4e20-4102-b9fe-f33cb0951727","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.198369Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:3b78a25acca975e4e1039b77f3d2730f9aad548fd72f83f4a3bd106ab34d3b96","observation_id":"217c859d-ace3-4f9b-935d-7b0465d73791","resolution":{"observed_at":"2026-08-07T14:17:58.439368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.282718Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.282718Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:f7e9e1e429718343b0f75d80ec1346c4efab7d3829b15742a766877b852ce3cd","observation_id":"eecc696b-4dec-42a6-86ce-e67a873841e5","resolution":{"observed_at":"2026-08-07T14:17:55.282718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.352417Z","title":"Large-scale contrastive language-audio pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.352417Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:95c6053cb93badb308b24b717557b7d7d2ec8edc63745dbbd9858b5f80c41b55","observation_id":"58ce6195-63f3-4120-a029-d8cfed917ff5","resolution":{"observed_at":"2026-08-07T14:17:55.352417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.424565Z","title":"Gemo-clap: Gender-attribute-enhanced contrastive language- audio pretraining for accurate speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.424565Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:c647550c3dcfad5b66f985c8dd7ed25fb64d3b33d7c12d851d6eb1fcda8aec24","observation_id":"1ec33af7-db3f-4148-acc8-169c6d83f315","resolution":{"observed_at":"2026-08-07T14:17:55.424565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-14T16:51:22.656133Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-07T14:17:55.489986Z","title":"Libritts: A corpus derived from librispeech for text- to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.489986Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:8b98b49d5b99acd20e654cb8ed66415cf6a72e65fc5598c1629c17b22a496956","observation_id":"0bf44369-fa18-4cc9-92a8-1c3955fd0b31","resolution":{"observed_at":"2026-08-07T14:17:55.489986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.585634Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.585634Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:9185826b5326a801c94cf4aa5adf6667b3c2b8c09f9f8c34a588331dde934437","observation_id":"b98c4c3d-eb89-4736-9d6d-234d00ccfc05","resolution":{"observed_at":"2026-08-07T14:17:55.585634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.683776Z","title":"Cstr vctk corpus: English multi-speaker corpus for cstr voice cloning toolkit (ver- sion 0.92),","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.683776Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:fe6604358df9b01865dbc1f5d1e7ae299678dad205d9add2cad6a8eb4101978e","observation_id":"03232a1d-a6c3-40eb-88ec-7f590001e8c1","resolution":{"observed_at":"2026-08-07T14:17:55.683776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:57.898928Z","title":"Seen and unseen emo- tional style transfer for voice conversion with a new emotional speech dataset,","venue":null,"work_id":"7af008ad-569c-49d6-ae58-46c668de69fb","year":2021},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.766272Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:f6f887d69c5ee951f3b32fecf38c84302a346be1eb2b4fd9238c8e483d7afbef","observation_id":"b41c8ce9-08fa-448e-9a36-22230ca671ba","resolution":{"observed_at":"2026-08-07T14:17:58.010603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.841134Z","title":"Toronto emotional speech set (tess)-younger talker happy,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.841134Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:cf674b76622e0be0479f91e1a2ee796cc7cc35531a490d419e38154340ee64eb","observation_id":"bc78f9b0-6e12-40ea-8dd1-b6dfefc3985e","resolution":{"observed_at":"2026-08-07T14:17:55.841134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:55.935541Z","title":"Mead: A large-scale audio-visual dataset for emotional talking-face generation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:55.935541Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:99ec0168275e1d3078a743a982f05a336c1aea126d082520eb57b30ddcc04f19","observation_id":"926bbc5f-94fc-49f7-98c5-5813ee848590","resolution":{"observed_at":"2026-08-07T14:17:55.935541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:57.500264Z","title":"Speaker-dependent audio- visual emotion recognition","venue":null,"work_id":"f4bc689f-548a-47b2-ac4d-b9e5012f73d8","year":2009},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.006922Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:45d4d3ca89c6c9c4a3b021a6033a4e6617cf6b686b53eccc0462afb8757f436d","observation_id":"f03dea00-5445-4c91-a680-281a4ca24cea","resolution":{"observed_at":"2026-08-07T14:17:57.693973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:57.191418Z","title":"Categorical and dimensional ratings of emotional speech: Behavioral findings from the morgan emotional speech set,","venue":null,"work_id":"c8854c78-7a77-401c-8826-626c6368b869","year":2019},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.074876Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:8217f00bb53363d5af471c9e85e9436f2bde3d29ff01fd8d66e606cc372ad6b5","observation_id":"4d642703-dd2c-4e55-aa53-48d00d88f84c","resolution":{"observed_at":"2026-08-07T14:17:57.338662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:17:56.876970Z","title":"Speechcraft: A fine-grained expressive speech dataset with natural language description,","venue":null,"work_id":"c80c0e1a-1650-4dc5-8e6b-c329fdc0cd39","year":2024},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.143003Z"},"links":{"citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:3e31999d7ac763a549051496d2e5fba0d66f0592a4e2beec17f7f25e576d23a6","observation_id":"3f5edecf-56f6-4bc2-b46c-2e855d6fd05c","resolution":{"observed_at":"2026-08-07T14:17:57.013435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11567","last_updated":"2021-04-22T07:51:51Z","snapshot_observed_at":"2026-08-11T16:25:21.518432Z","submitted_at":"2020-10-22T09:54:22Z","title":"AISHELL-3: A Multi-speaker Mandarin TTS Corpus and the Baselines","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11567","snapshot_observed_at":"2026-08-07T14:17:56.239809Z","title":"Aishell-3: A multi- speaker mandarin tts corpus and the baselines,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.239809Z"},"links":{"cited_paper":"/paper/2010.11567","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:e050509d35a1efa35488035aadf34103d983133f9ed9edddf84796ee9d82e498","observation_id":"72b3b378-ef9c-4449-8708-5f8c65c46d46","resolution":{"observed_at":"2026-08-07T14:17:56.239809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.06909","last_updated":"2021-06-13T04:09:16Z","snapshot_observed_at":"2026-08-13T19:04:39.932284Z","submitted_at":"2021-06-13T04:09:16Z","title":"GigaSpeech: An Evolving, Multi-domain ASR Corpus with 10,000 Hours of Transcribed Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.06909","snapshot_observed_at":"2026-08-07T14:17:56.327895Z","title":"Gigaspeech: An evolving, multi-domain asr corpus with 10,000 hours of transcribed audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.327895Z"},"links":{"cited_paper":"/paper/2106.06909","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:b1d544e60fcff081c4bcbae2a52e487af5a7e8ea4713674937c256aeeb60b0d1","observation_id":"b6c69078-b779-436a-8e7e-6dc2e647e0ad","resolution":{"observed_at":"2026-08-07T14:17:56.327895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18802","last_updated":"2023-05-30T07:30:21Z","snapshot_observed_at":"2026-08-13T11:29:44.547086Z","submitted_at":"2023-05-30T07:30:21Z","title":"LibriTTS-R: A Restored Multi-Speaker Text-to-Speech Corpus","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18802","snapshot_observed_at":"2026-08-07T14:17:56.416700Z","title":"Libritts-r: A restored multi-speaker text-to-speech corpus,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:56.416700Z"},"links":{"cited_paper":"/paper/2305.18802","citing_paper":"/paper/2505.19437"},"observation_digest":"sha256:3a2c83d4d57826eacd2b92c9f8ae1054b6aa891259b38e93ac8b1b2a8e1f4d57","observation_id":"fea97d2f-3f14-46fd-8cc3-9a25b645b90f","resolution":{"observed_at":"2026-08-07T14:17:56.416700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19437","last_updated":"2025-05-26T02:54:14Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T23:22:46.825899Z","submitted_at":"2025-05-26T02:54:14Z","title":"RA-CLAP: Relation-Augmented Emotional Speaking Style Contrastive Language-Audio Pretraining For Speech Retrieval"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.19437."}