{"as_of":"2026-08-10T08:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b358a3b97fd32b8d44743f81529374a58305a40785001e065a7b55bd537b416","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T04:29:22.726620Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T18:28:48.480697Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2409.18512","last_updated":"2026-04-03T15:54:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-27T07:46:52Z","title":"Expressive Prompting: Improving Emotion Intensity and Speaker Consistency in Zero-Shot TTS","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T20:31:24.494060Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2409.18512"},"observation_digest":"sha256:ac5d9b6f72da8f36e17ab2588a9246124d6623411f552cf2c9efcbf0ff04a391","observation_id":"8c1e784a-8609-4a47-b1bb-6dc4731fc21d","resolution":{"observed_at":"2026-05-23T20:33:25.612916Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-08T19:15:52.182473Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05471","last_updated":"2025-02-08T07:14:04Z","snapshot_observed_at":"2026-08-08T19:09:27.361732Z","submitted_at":"2025-02-08T07:14:04Z","title":"Enhancing Expressive Voice Conversion with Discrete Pitch-Conditioned Flow Matching Model","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:52.182473Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2502.05471"},"observation_digest":"sha256:f3f9159e60318de7d6ee4b25c480b87e7e82822a7b4ed3927c13732ebcc80133","observation_id":"143e4c8e-f340-4307-b93c-822ef83fa9be","resolution":{"observed_at":"2026-08-08T19:15:52.182473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-08T18:34:11.621926Z","title":"arXiv preprint arXiv:2312.15185","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05649","last_updated":"2025-02-08T17:38:24Z","snapshot_observed_at":"2026-08-08T18:27:23.020012Z","submitted_at":"2025-02-08T17:38:24Z","title":"Gender Bias in Instruction-Guided Speech Synthesis Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:11.621926Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2502.05649"},"observation_digest":"sha256:a90af60bde67bd5666066c465f6c8c47268d144337dcce1ff889c1ff5dbbe2e6","observation_id":"974f1597-8794-4829-b9ec-2a0e2c86ae37","resolution":{"observed_at":"2026-08-08T18:34:11.621926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T15:30:36.078119Z","title":"Emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15004","last_updated":"2025-05-30T08:08:47Z","snapshot_observed_at":"2026-08-10T07:05:40.283135Z","submitted_at":"2025-05-21T01:17:09Z","title":"EASY: Emotion-aware Speaker Anonymization via Factorized Distillation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:30:36.078119Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2505.15004"},"observation_digest":"sha256:764d15258c7c7a13236011ac510ec8cde38b33df9cfdb4e081d348e3cce000e8","observation_id":"4f619372-433f-4e44-baf3-81c64b1af81b","resolution":{"observed_at":"2026-08-07T15:30:36.078119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T15:30:02.058069Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation.arXiv preprint arXiv:2312.15185, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17090","last_updated":"2025-05-20T22:14:38Z","snapshot_observed_at":"2026-08-08T00:26:41.300341Z","submitted_at":"2025-05-20T22:14:38Z","title":"EmoSign: A Multimodal Dataset for Understanding Emotions in American Sign Language","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:30:02.058069Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2505.17090"},"observation_digest":"sha256:ffe1870baa31b717cc4fd7d6e9a31ded83058ff515e293a60d8a17d43c63bfd5","observation_id":"fa03a2b8-92fd-4ae8-afab-9bee14f50ef5","resolution":{"observed_at":"2026-08-07T15:30:02.058069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T14:33:39.181667Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18453","last_updated":"2025-05-24T01:26:02Z","snapshot_observed_at":"2026-08-07T15:24:07.535545Z","submitted_at":"2025-05-24T01:26:02Z","title":"MPE-TTS: Customized Emotion Zero-Shot Text-To-Speech Using Multi-Modal Prompt","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:39.181667Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2505.18453"},"observation_digest":"sha256:3a31b049092d07cf3c770cc48bcfd9aa0fe5d7692a57930e9894af6c25f6cb6c","observation_id":"2a46fb90-8592-4e1b-9623-cba6f0a2de59","resolution":{"observed_at":"2026-08-07T14:33:39.181667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T12:31:39.523254Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24248","last_updated":"2025-05-30T06:12:52Z","snapshot_observed_at":"2026-08-08T04:48:33.525066Z","submitted_at":"2025-05-30T06:12:52Z","title":"Probing the Robustness Properties of Neural Speech Codecs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:31:39.523254Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2505.24248"},"observation_digest":"sha256:c964e1b1fa2d59d5a4625ab211443e3e2571eb28883b0d709a870d3ca4c6a7a1","observation_id":"1283c4a1-509d-4616-a396-e1175b8febbd","resolution":{"observed_at":"2026-08-07T12:31:39.523254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T11:57:56.482687Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01014","last_updated":"2025-06-01T13:53:28Z","snapshot_observed_at":"2026-08-07T23:06:59.165463Z","submitted_at":"2025-06-01T13:53:28Z","title":"Rhythm Controllable and Efficient Zero-Shot Voice Conversion via Shortcut Flow Matching","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:57:56.482687Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.01014"},"observation_digest":"sha256:4431edeb74a10a663f49a7ee2008cd2b427466dcc46a9f59827f808c99f8a6f3","observation_id":"3a23ebd0-dc44-4dec-b950-692437c41977","resolution":{"observed_at":"2026-08-07T11:57:56.482687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T11:21:09.566555Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02742","last_updated":"2025-06-03T10:59:22Z","snapshot_observed_at":"2026-08-08T08:10:54.994072Z","submitted_at":"2025-06-03T10:59:22Z","title":"Prompt-Unseen-Emotion: Zero-shot Expressive Speech Synthesis with Prompt-LLM Contextual Knowledge for Mixed Emotions","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:21:09.566555Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.02742"},"observation_digest":"sha256:15bbeaa828cf4695fabb5485a326c3298a32c5992feef212ce9e6a5750ee6de6","observation_id":"17b384e8-dc7f-4680-a281-53e03cb3b570","resolution":{"observed_at":"2026-08-07T11:21:09.566555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T10:55:20.353059Z","title":"Emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04013","last_updated":"2025-06-04T14:42:12Z","snapshot_observed_at":"2026-08-08T13:06:14.713555Z","submitted_at":"2025-06-04T14:42:12Z","title":"Towards Better Disentanglement in Non-Autoregressive Zero-Shot Expressive Voice Conversion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:55:20.353059Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.04013"},"observation_digest":"sha256:a8644d3224cec53f61935f3690826b5ce9b2d2849a56d1a5d1d7b84da9e18b42","observation_id":"2c0e4eed-aa8b-4d57-84ec-3030fd4b73d1","resolution":{"observed_at":"2026-08-07T10:55:20.353059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T23:49:29.542314Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-08T22:59:15.277514Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.542314Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:331c80c118218d2584e19c475ce7cf565b2671a9043f1a871255421c1ec9eb5b","observation_id":"eb7ebb49-ba2d-4e51-805d-2b1b66e5e02f","resolution":{"observed_at":"2026-08-06T23:49:29.542314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T19:16:57.081692Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.06071","last_updated":"2025-08-14T07:56:46Z","snapshot_observed_at":"2026-08-08T00:26:40.379475Z","submitted_at":"2025-07-08T15:14:27Z","title":"MEDTalk: Multimodal Controlled 3D Facial Animation with Dynamic Emotions by Disentangled Embedding","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T19:16:57.081692Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.06071"},"observation_digest":"sha256:8035dd9408dbf14f9fdeb2443ff596119ab172c001e6922fa7703b14cd15c263","observation_id":"382fc309-fb3f-43a4-85a1-672827b718f9","resolution":{"observed_at":"2026-08-06T19:16:57.081692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T14:50:04.223838Z","title":"ArXiv abs/2312.15185 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.223838Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:0817163f57a1b5cde7fffca68e22fd1d0b28961263020fefef9a70c61f916d7a","observation_id":"f780c7fd-ff9e-48e9-abaf-946cd67323b8","resolution":{"observed_at":"2026-08-06T14:50:04.223838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T11:50:25.414247Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22367","last_updated":"2025-07-30T04:12:14Z","snapshot_observed_at":"2026-08-08T07:37:18.983409Z","submitted_at":"2025-07-30T04:12:14Z","title":"Traits Run Deep: Enhancing Personality Assessment via Psychology-Guided LLM Representations and Multimodal Apparent Behaviors","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:50:25.414247Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.22367"},"observation_digest":"sha256:4f40c9591ccf8a98264bdb759a10e4b9b2d35595af1653d2815a01e15cec8f33","observation_id":"301254d5-bccf-44a0-9c29-c9adc82369e6","resolution":{"observed_at":"2026-08-06T11:50:25.414247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-06T11:29:41.195435Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22676","last_updated":"2025-08-05T07:29:09Z","snapshot_observed_at":"2026-08-09T16:14:17.293546Z","submitted_at":"2025-07-30T13:37:06Z","title":"Listening to the Unspoken: Exploring \"365\" Aspects of Multimodal Interview Performance Assessment","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:29:41.195435Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.22676"},"observation_digest":"sha256:86d7a072c24bc210ff0506d90d049c235b0b9309659211741392c3431fe67bff","observation_id":"fd2dd173-740f-4bdb-b45a-89eb39ad134e","resolution":{"observed_at":"2026-08-06T11:29:41.195435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2507.23511","last_updated":"2026-05-11T14:54:52Z","snapshot_observed_at":"2026-08-03T03:37:10.882228Z","submitted_at":"2025-07-31T12:47:43Z","title":"MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-19T02:41:52.996457Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2507.23511"},"observation_digest":"sha256:8199b8958d90dfd9a00a9ef20d42953c932b5a9d235d3b1e11c75f2c18f96f5f","observation_id":"d904b568-df3c-4f04-9e7c-0eceb1425215","resolution":{"observed_at":"2026-05-19T02:41:59.596971Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-05T22:34:43.524538Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06890","last_updated":"2025-08-09T08:46:32Z","snapshot_observed_at":"2026-08-09T15:28:21.576303Z","submitted_at":"2025-08-09T08:46:32Z","title":"Maestro-EVC: Controllable Emotional Voice Conversion Guided by References and Explicit Prosody","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:34:43.524538Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2508.06890"},"observation_digest":"sha256:26d7d4679fcb70e21e899dd08c99f6d30b27a5f6f65fcf7e25dfb9bfaa727eec","observation_id":"f5dcc674-87c2-4a7e-a7b8-417df35ec02d","resolution":{"observed_at":"2026-08-05T22:34:43.524538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-05T10:36:06.444581Z","title":"arXiv preprint arXiv:2312.15185","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.03940","last_updated":"2025-09-04T07:03:46Z","snapshot_observed_at":"2026-08-08T20:51:35.281735Z","submitted_at":"2025-09-04T07:03:46Z","title":"VoxRole: A Comprehensive Benchmark for Evaluating Speech-Based Role-Playing Agents","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:36:06.444581Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2509.03940"},"observation_digest":"sha256:225672d0b141ad09f4b22b909bd3d0c4c760865d622e6511b593e24088c58b0f","observation_id":"4f720ed5-cb13-4286-845c-a4e5e3b0d86e","resolution":{"observed_at":"2026-08-05T10:36:06.444581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T07:42:43.077644Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:41d1593d773ddbe178d0a9df260fb16e118f56aa52c6307fabb1fa5fc04a99b2","observation_id":"875a69b9-3d43-4033-95b0-c1a2e6d7ba3b","resolution":{"observed_at":"2026-05-18T07:46:03.634188Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-21T20:56:37.533183Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:3405d59e4956230b0d7636b15796dfd2cac72d2c9951fa833cd300cb326e40d5","observation_id":"f2f20dca-d5f0-4a8d-8723-6e5aaa377292","resolution":{"observed_at":"2026-05-21T21:00:39.123236Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-04T09:49:44.597311Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.13293","last_updated":"2026-06-10T05:54:25Z","snapshot_observed_at":"2026-08-04T09:49:40.217695Z","submitted_at":"2025-10-15T08:37:16Z","title":"Cross-modal Consistency Guidance for Robust Emotion Control in Auto-Regressive TTS Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T09:49:44.597311Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2510.13293"},"observation_digest":"sha256:4bf1115f24915b67a556ed2d8c2a804880fe033e448435011ef34cd5095fa39a","observation_id":"26e9a64d-ee20-421a-8ce6-207d9ac59a60","resolution":{"observed_at":"2026-08-04T09:49:44.597311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-13T16:09:50.207908Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28737","last_updated":"2026-06-20T22:01:30Z","snapshot_observed_at":"2026-08-07T03:32:35.423463Z","submitted_at":"2026-03-30T17:50:07Z","title":"ParaSpeechCLAP: A Dual-Encoder Speech-Text Model for Rich Stylistic Language-Audio Pretraining","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T16:09:50.207908Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2603.28737"},"observation_digest":"sha256:554aade5e0744e1b77e2390c6c626fb45418404b7a1d33e55d6d2b9792c914f9","observation_id":"1235f466-957a-4462-850b-41217ba13cd5","resolution":{"observed_at":"2026-07-13T16:09:50.207908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2604.08363","last_updated":"2026-04-09T15:27:22Z","snapshot_observed_at":"2026-07-06T22:57:26.678728Z","submitted_at":"2026-04-09T15:27:22Z","title":"CapTalk: Unified Voice Design for Single-Utterance and Dialogue Speech Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-10T17:15:28.918204Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2604.08363"},"observation_digest":"sha256:080c42d3bfb8a91bf8eff18c814de2ab417f75f7ced4000ef6bb1844f003bbcd","observation_id":"4331fecc-4aaf-471d-a446-b8f915a6a3d1","resolution":{"observed_at":"2026-05-11T07:16:00.004189Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2604.26417","last_updated":"2026-04-29T08:27:39Z","snapshot_observed_at":"2026-07-06T23:12:06.349884Z","submitted_at":"2026-04-29T08:27:39Z","title":"EmoTransCap: Dataset and Pipeline for Emotion Transition-Aware Speech Captioning in Discourses","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-07T13:13:49.855219Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2604.26417"},"observation_digest":"sha256:dfcf37234afec3d96ed0758fa694c952ad484c92aad4063588b21428c3aa4d3d","observation_id":"c34293b0-51c8-46a8-8778-04e736d509da","resolution":{"observed_at":"2026-05-12T09:01:26.002498Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:e190e8665e018acd9374b402e09b0d2e9b2d4880db87c08128ede6a835251d6f","observation_id":"f2cdfda3-401b-417d-b4a1-06c2b5264529","resolution":{"observed_at":"2026-05-11T04:50:56.208024Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2605.19630","last_updated":"2026-05-19T10:11:10Z","snapshot_observed_at":"2026-07-06T23:30:21.283826Z","submitted_at":"2026-05-19T10:11:10Z","title":"EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-20T05:47:45.259359Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2605.19630"},"observation_digest":"sha256:8a3535740f9d382aaaefb2ef5b7c32a722d7c79f4cbdddd317f8195685dde8a5","observation_id":"3400357e-5d39-49d9-a2bb-3ad06fbcff50","resolution":{"observed_at":"2026-05-20T05:48:04.313900Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2605.22732","last_updated":"2026-05-21T17:03:37Z","snapshot_observed_at":"2026-08-06T17:38:43.550221Z","submitted_at":"2026-05-21T17:03:37Z","title":"Beyond Acoustic Emotion Recognition: Multimodal Pathos Analysis in Political Speech Using LLM-Based and Acoustic Emotion Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T04:54:35.815868Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2605.22732"},"observation_digest":"sha256:8c7f17b5867bef9d0b5432a214ac1888092842d74a789f4023f05c1dde01fc27","observation_id":"fb0a5d89-b9d0-46f5-9587-71f8ac923026","resolution":{"observed_at":"2026-05-22T04:56:05.289172Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2606.17339","last_updated":"2026-06-15T22:38:36Z","snapshot_observed_at":"2026-07-06T23:52:57.359941Z","submitted_at":"2026-06-15T22:38:36Z","title":"SpeechDx: A Multi-Task Benchmark for Clinical Speech AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-27T03:09:07.295810Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2606.17339"},"observation_digest":"sha256:6c8f1266adcdb83dff50de0db98f4b5adac1a2d6e25b9b15649a6fa410e0d4b5","observation_id":"a1f077c2-ab30-4e47-8e9c-e03bb13a4806","resolution":{"observed_at":"2026-07-03T18:28:48.482501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2606.31128","last_updated":"2026-06-30T04:46:45Z","snapshot_observed_at":"2026-08-06T13:27:09.813532Z","submitted_at":"2026-06-30T04:46:45Z","title":"UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-01T04:05:27.343684Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2606.31128"},"observation_digest":"sha256:913e4e1c1caeea53f57a7c35ef21e5f70eb6907decd44ab670d44a5c7de78edc","observation_id":"e9feee97-ee97-4e78-a2f2-09a872113081","resolution":{"observed_at":"2026-07-01T11:45:46.191735Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":"2312.15185","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-07-03T18:28:48.480697Z","title":"emotion2vec: Self-supervised pre-training for speech emotion repre- sentation","venue":null,"work_id":"47565141-2d61-4ce8-98eb-f2c76f40fe37","year":2023},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":189,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:a560515bcf5acae75809a6b345a6a0806a929f1b7bcf439b038d0ba6de091908","observation_id":"0f87d94c-cb0a-4502-9e79-0d9d381219bf","resolution":{"observed_at":"2026-07-01T11:45:47.155193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-01T07:12:11.459753Z","title":"arXiv preprint arXiv:2312.15185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21550","last_updated":"2026-07-23T17:35:20Z","snapshot_observed_at":"2026-08-08T08:48:36.880078Z","submitted_at":"2026-07-23T17:35:20Z","title":"X$^3$-OPD: Distilling Reasoning into Large Audio-Language Models via On-Policy Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T07:12:11.459753Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2607.21550"},"observation_digest":"sha256:c156bab1c68267af10dacddb8e7d8872bc86feda4172b66676a648a50340f5b9","observation_id":"e98932ef-6fc6-4774-b43e-c1653e5faa6c","resolution":{"observed_at":"2026-08-01T07:12:11.459753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-08T11:50:21.349519Z","title":"arXiv preprint arXiv:2312.15185 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05507","last_updated":"2026-08-06T01:19:35Z","snapshot_observed_at":"2026-08-09T23:10:58.519642Z","submitted_at":"2026-08-06T01:19:35Z","title":"AffectDF: The Most Comprehensive Benchmark for Speech Deepfake Detection against Emotionally Expressive Attacks","version":1},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-08T11:50:21.349519Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2608.05507"},"observation_digest":"sha256:052142a5dc92fc1c879fa5b43a8223c9b2dc43ce2371911da59141373ab9ed44","observation_id":"3e30aec3-6e10-456d-b113-a85825e87fb0","resolution":{"observed_at":"2026-08-08T11:50:21.349519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-07T14:34:38.489642Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06122","last_updated":"2026-08-07T08:30:22Z","snapshot_observed_at":"2026-08-10T08:09:44.116690Z","submitted_at":"2026-08-06T14:53:23Z","title":"Is Self-Pretraining really useful to improve diagnosis in medical Time Series?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:38.489642Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2608.06122"},"observation_digest":"sha256:5fc47afd4a640d7e9ad073f95074dbc87cee3cb4e329911035a1d6bb62216c7b","observation_id":"4c81d5b5-1e73-428e-941f-4a7c2c63a788","resolution":{"observed_at":"2026-08-07T14:34:38.489642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15185","snapshot_observed_at":"2026-08-10T04:29:22.726620Z","title":"emotion2vec: Self-supervised pre-training for speech emotion representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06122","last_updated":"2026-08-07T08:30:22Z","snapshot_observed_at":"2026-08-10T08:09:44.116690Z","submitted_at":"2026-08-06T14:53:23Z","title":"Is Self-Pretraining really useful to improve diagnosis in medical Time Series?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T04:29:22.726620Z"},"links":{"cited_paper":"/paper/2312.15185","citing_paper":"/paper/2608.06122"},"observation_digest":"sha256:e4cacb43b7424a850f532931e9daf9d6bfb40040acead1ec945e18626d7921aa","observation_id":"91568008-84fe-4be4-84d6-d88c38f2ae7d","resolution":{"observed_at":"2026-08-10T04:29:22.726620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.15185/citation-record","integrity":"/paper/2312.15185/integrity","json":"/paper/2312.15185/citation-record.json","paper":"/paper/2312.15185"},"outbound":[],"paper":{"arxiv_id":"2312.15185","last_updated":"2023-12-23T07:46:55Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T00:25:44.100410Z","submitted_at":"2023-12-23T07:46:55Z","title":"emotion2vec: Self-Supervised Pre-Training for Speech Emotion Representation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2312.15185."}