{"as_of":"2026-08-10T12:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8cc4d231e7ddfe3285d56d5680453e83348ae11a50bbe10aafe64727c5ff95ba","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:17:38.566540Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T16:27:37.596817Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T16:31:37.259420Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":"2508.07302","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.07302","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","venue":null,"work_id":"e4d08037-aa7f-4f18-8cf5-f5434910e1ee","year":2025},"citing_paper":{"arxiv_id":"2509.14804","last_updated":"2025-09-18T09:59:55Z","snapshot_observed_at":"2026-08-07T14:31:44.422604Z","submitted_at":"2025-09-18T09:59:55Z","title":"Towards Building Speech Large Language Models for Multitask Understanding in Low-Resource Languages","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T16:27:37.596817Z"},"links":{"cited_paper":"/paper/2508.07302","citing_paper":"/paper/2509.14804"},"observation_digest":"sha256:aeb165a7df1514f7e4ae225eeac53f0adaf4c0f66a4c0c143ed06c44acb14bec","observation_id":"a8438032-1c43-4fd7-a270-741ef50b734a","resolution":{"observed_at":"2026-05-18T16:31:37.262268Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.07302/citation-record","integrity":"/paper/2508.07302/integrity","json":"/paper/2508.07302/citation-record.json","paper":"/paper/2508.07302"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.04558","last_updated":"2022-08-08T01:53:05Z","snapshot_observed_at":"2026-08-06T18:05:37.673476Z","submitted_at":"2020-06-08T13:05:40Z","title":"FastSpeech 2: Fast and High-Quality End-to-End Text to Speech","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04558","snapshot_observed_at":"2026-08-05T22:17:38.247156Z","title":"Fastspeech 2: Fast and high-quality end-to-end text to speech,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.247156Z"},"links":{"cited_paper":"/paper/2006.04558","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:876de7c6b69739ef4090768e7fc9b43e8bf1dadcd1e8a2a37f8070fb11e57d76","observation_id":"747a176c-8695-4ef4-a090-5eede55c3179","resolution":{"observed_at":"2026-08-05T22:17:38.247156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00993","last_updated":"2021-03-01T13:28:59Z","snapshot_observed_at":"2026-08-10T07:58:40.233730Z","submitted_at":"2021-03-01T13:28:59Z","title":"AdaSpeech: Adaptive Text to Speech for Custom Voice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00993","snapshot_observed_at":"2026-08-05T22:17:38.258146Z","title":"Adaspeech: Adaptive text to speech for custom voice,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.258146Z"},"links":{"cited_paper":"/paper/2103.00993","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:25ef162326d1f356186a615bf1d51916194401c4c49b5537fec03fdfafa07682","observation_id":"cb5c16d8-bd7b-449b-8519-f84e610c92a5","resolution":{"observed_at":"2026-08-05T22:17:38.258146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.851795Z","title":"Conditional variational autoencoder with adversarial learning for end-to-end text-to-speech,","venue":null,"work_id":"26366589-f5e0-479b-9d13-ccd833b5474b","year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.274410Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:539efaeacbc27a27e1f612282f838035a72c36337a98219c834555d90537179e","observation_id":"d3080bf9-3ac0-430d-91a3-617464b9f6d1","resolution":{"observed_at":"2026-08-05T22:17:39.858055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.818288Z","title":"Generspeech: Towards style transfer for generalizable out-of-domain text-to-speech,","venue":null,"work_id":"6d9d0743-48ed-4790-b88a-a07096b827a5","year":2022},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.291568Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:f42e242835148f1fb3340600424c20363eedd290990cf84cd41e643227ba2393","observation_id":"5ec9cfc4-6a90-424a-9aa4-a7ac5a171124","resolution":{"observed_at":"2026-08-05T22:17:39.826565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03926","last_updated":"2023-03-07T14:31:55Z","snapshot_observed_at":"2026-08-06T04:55:08.186019Z","submitted_at":"2023-03-07T14:31:55Z","title":"Speak Foreign Languages with Your Own Voice: Cross-Lingual Neural Codec Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03926","snapshot_observed_at":"2026-08-05T22:17:38.301601Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.301601Z"},"links":{"cited_paper":"/paper/2303.03926","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:3c59ab8e9e584434b81fb0f1e9abfa32f8cfba574673bff575585ad040c4e9e7","observation_id":"64a33c59-d966-4a47-b022-18342097d1b9","resolution":{"observed_at":"2026-08-05T22:17:38.301601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04904","last_updated":"2024-06-07T12:56:11Z","snapshot_observed_at":"2026-08-06T13:29:11.244845Z","submitted_at":"2024-06-07T12:56:11Z","title":"XTTS: a Massively Multilingual Zero-Shot Text-to-Speech Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04904","snapshot_observed_at":"2026-08-05T22:17:38.311772Z","title":"Xtts: a massively multilingual zero-shot text-to-speech model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.311772Z"},"links":{"cited_paper":"/paper/2406.04904","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:6fdddb1b4d458ac567f2f72896285c571829f78b9de7c1f747bea1f41c71c43e","observation_id":"e7f00805-43b9-4391-b1f9-c4d742d2f610","resolution":{"observed_at":"2026-08-05T22:17:38.311772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13910","last_updated":"2024-09-20T21:27:13Z","snapshot_observed_at":"2026-08-08T21:57:04.995783Z","submitted_at":"2024-09-20T21:27:13Z","title":"Zero-shot Cross-lingual Voice Transfer for TTS","version":1},"cited_work":{"arxiv_id":"2409.13910","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.13910","snapshot_observed_at":"2026-08-05T22:17:39.010243Z","title":"Zero-shot Cross-lingual Voice Transfer for TTS","venue":"eess.AS","work_id":"606cf45d-43e6-43a3-9722-4c9d5f40a643","year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.318698Z"},"links":{"cited_paper":"/paper/2409.13910","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:c48fc04cfe5279ba4ba5a82c4333c2863582761df1dd736b07d23b60580770b3","observation_id":"59f5b7dc-2217-4e9f-bb9a-e6bfae52afd9","resolution":{"observed_at":"2026-08-05T22:17:39.030809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.778532Z","title":"Multilingual video dubbing—a tech- nology review and current challenges,","venue":null,"work_id":"f8f89a2c-f0c8-48ec-81d2-e53dea79f0fa","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.325689Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:f688a752763e38807d2b5283033d9ae062b63a5de49aa09a73e6e33dd4f0b036","observation_id":"605ed599-7d83-4687-81d3-bacee00df06c","resolution":{"observed_at":"2026-08-05T22:17:39.793134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14145","last_updated":"2023-06-25T06:46:36Z","snapshot_observed_at":"2026-08-09T23:27:47.178155Z","submitted_at":"2023-06-25T06:46:36Z","title":"DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech","version":1},"cited_work":{"arxiv_id":"2306.14145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.14145","snapshot_observed_at":"2026-08-05T22:17:38.968017Z","title":"DSE-TTS: Dual Speaker Embedding for Cross-Lingual Text-to-Speech","venue":"cs.SD","work_id":"fdcd5a3f-5dec-4017-ab39-b2548c3fe635","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.331461Z"},"links":{"cited_paper":"/paper/2306.14145","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:3a45fc1ad977eabc9722acff63ae463c07ef9a262cbbb3d231aac0313509c33e","observation_id":"98aae8f0-105e-4709-aba3-f3d9113366d6","resolution":{"observed_at":"2026-08-05T22:17:38.977395Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.748746Z","title":"Diclet-tts: Diffusion model based cross- lingual emotion transfer for text-to-speech – a study between english and mandarin,","venue":null,"work_id":"fc7c8ae8-c9f2-4479-a478-738e1d5ec65e","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.341071Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:c0b338bb0ec886eef73228eb078985b005a66d1c2e655dc88fb7fd980bd0f88f","observation_id":"a34f24ce-f9b9-4e55-9784-b403575276b2","resolution":{"observed_at":"2026-08-05T22:17:39.755773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T22:17:38.347773Z","title":"Llasa: Scaling train- time and inference-time compute for llama-based speech synthesis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.347773Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:702549438760810a47bc7988730895e9f287696882f591279a24081dad14decb","observation_id":"dfd6b0ba-a7d5-4eaf-8b30-2dfe786e5db2","resolution":{"observed_at":"2026-08-05T22:17:38.347773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12612","last_updated":"2021-11-19T04:41:50Z","snapshot_observed_at":"2026-08-01T15:30:55.161032Z","submitted_at":"2021-10-25T02:47:59Z","title":"DelightfulTTS: The Microsoft Speech Synthesis System for Blizzard Challenge 2021","version":2},"cited_work":{"arxiv_id":"2110.12612","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.12612","snapshot_observed_at":"2026-08-05T22:17:39.120607Z","title":"DelightfulTTS: The Microsoft Speech Synthesis System for Blizzard Challenge 2021","venue":"cs.SD","work_id":"f0a0099d-3c4f-4303-a370-c105b8b5478f","year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.360877Z"},"links":{"cited_paper":"/paper/2110.12612","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:f8e576d890968bf45b8b58c7f8515c6d31905be754f2d5a6ad1002d19ffd612d","observation_id":"75e50fdd-80fb-4768-9237-e5027783d363","resolution":{"observed_at":"2026-08-05T22:17:39.128510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.714219Z","title":"iemotts: Toward robust cross- speaker emotion transfer and control for speech synthesis based on disentanglement between prosody and timbre,","venue":null,"work_id":"633ba8f0-e06a-43f8-a558-918b5d4fe2ea","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.374104Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:977d482c6be1892719af1f8114249a22560ff178de8c11631d3b4bb33730da82","observation_id":"c3cd9acd-ddc0-4b8c-aa05-0f5377f9ae59","resolution":{"observed_at":"2026-08-05T22:17:39.723619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.688093Z","title":"Zero-shot emotion transfer for cross-lingual speech synthesis,","venue":null,"work_id":"b7222713-6744-4430-93fb-8aaec74928c8","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.382804Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:8258db56da4749133a7e1940ff616841362128e76a6995df17f23d2d63434678","observation_id":"ebd62e70-9ff8-444c-b5ad-d094344832c6","resolution":{"observed_at":"2026-08-05T22:17:39.694834Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.650360Z","title":"Zet- speech: Zero-shot adaptive emotion-controllable text-to-speech synthesis with diffusion and style-based models,","venue":null,"work_id":"59145651-0d97-4fa9-a340-3bf1005899d0","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.396075Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:68afb2e14052247c2c2e0529849e4c00b614cdc9c8514fa8f558c81a04013c06","observation_id":"ffc56a9f-a356-4bce-977d-4e0b7e8ef712","resolution":{"observed_at":"2026-08-05T22:17:39.668409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04448","last_updated":"2019-07-24T15:03:15Z","snapshot_observed_at":"2026-08-01T16:40:42.798374Z","submitted_at":"2019-07-09T22:43:55Z","title":"Learning to Speak Fluently in a Foreign Language: Multilingual Speech Synthesis and Cross-Language Voice Cloning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.04448","snapshot_observed_at":"2026-08-05T22:17:38.408435Z","title":"Learning to speak fluently in a foreign language: Multilingual speech synthesis and cross-language voice cloning,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.408435Z"},"links":{"cited_paper":"/paper/1907.04448","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:849866967507669b7c750d8641a763cbdfcaa1336a672163d418de357fbfd666","observation_id":"b5f15223-498d-4312-b7d4-6d7df3408c0e","resolution":{"observed_at":"2026-08-05T22:17:38.408435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.579975Z","title":"Metts: Multilingual emotional text-to-speech by cross- speaker and cross-lingual emotion transfer,","venue":null,"work_id":"e30c8f0e-ffc1-486c-8e96-6acb7b12b793","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.432824Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:1c9393071e8c62cff4e00d60f5421c33126845c8d7d8fe965f8f4dde59e8df56","observation_id":"b563c52b-a9a8-4dd0-b931-3a11f9ffc017","resolution":{"observed_at":"2026-08-05T22:17:39.590546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.540451Z","title":"Cosyvoice 3: Towards in-the-wild speech generation via scaling-up and post-training,","venue":null,"work_id":"008625fe-aac6-4728-92ea-bc8d45ddcac9","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.448447Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:54c314ab7721d01e74e8d56088e8df950f80d2a9c795964382811d9790579e35","observation_id":"c289e77e-be12-49de-854d-42d9081d5e61","resolution":{"observed_at":"2026-08-05T22:17:39.550878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.509497Z","title":"Maskgct: Zero-shot text-to-speech with masked generative codec transformer,","venue":null,"work_id":"77c68de6-d662-42de-a4dd-72fba1a6e6ca","year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.455700Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:2bd232555974293c0908bcb6d83b1edfe26c3da3f0e9e6a74ea7e0d63e68cabe","observation_id":"f8971949-c88b-47e5-9cba-070cd6ad9ad7","resolution":{"observed_at":"2026-08-05T22:17:39.518076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.448458Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot,","venue":null,"work_id":"7e930c73-a409-4c4f-b736-b7ef59ca4b85","year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.466878Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:b52d9f7ac965302cdef54d1df7432f88ef05bd18b4196f24ea3c3dc7d15d72e3","observation_id":"6d350465-2bb9-4d84-9e98-ca93d880dd75","resolution":{"observed_at":"2026-08-05T22:17:39.465254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.616493Z","title":"Speak foreign languages with your own voice: Cross-lingual neural codec language modeling,","venue":null,"work_id":"34238212-b058-4471-adc4-602fa8c46dd1","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.476870Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:30b3c633c50d61582228663020d1fd89f4e6a5dd254a35b18f0bc52e757622ea","observation_id":"fccb8667-09ba-4ccc-80fd-6853f0519b74","resolution":{"observed_at":"2026-08-05T22:17:39.626151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.367409Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":"93ef0ea6-af59-4daf-b555-8c7f69a4612e","year":2021},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.486028Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:f6eed6c0accb42285f04d08b5cd955bbfc240276564154a98773ff061acf1ffe","observation_id":"5007cd8a-5f5a-4b75-a446-eaf0afcbbef1","resolution":{"observed_at":"2026-08-05T22:17:39.405977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10309","last_updated":"2025-04-14T15:18:59Z","snapshot_observed_at":"2026-08-07T16:05:51.346192Z","submitted_at":"2025-04-14T15:18:59Z","title":"AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2504.10309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.10309","snapshot_observed_at":"2026-08-05T22:17:38.818420Z","title":"AutoStyle-TTS: Retrieval-Augmented Generation based Automatic Style Matching Text-to-Speech Synthesis","venue":"cs.SD","work_id":"720409d4-649b-4039-aaaf-a64d69c4283c","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.493215Z"},"links":{"cited_paper":"/paper/2504.10309","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:a99034d2fd02ba9ca84f4d565710d22b27f906bc11ec77cc81af5f94030fc989","observation_id":"4c753727-01f5-46c9-b865-9e959a85ceaa","resolution":{"observed_at":"2026-08-05T22:17:38.830913Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.329471Z","title":"Wavrag: Audio-integrated retrieval augmented generation for spoken dialogue models,","venue":null,"work_id":"9ee78a43-9e2b-4356-acea-c4527caecce3","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.503618Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:a46c728dc27a03937ca31d50529595ed9a3ad6b9595cd08fc5dfac68b760cf0c","observation_id":"1e42d927-5c44-4fff-a769-f3f74672a38c","resolution":{"observed_at":"2026-08-05T22:17:39.343676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.298171Z","title":"Codec does matter: Exploring the semantic shortcoming of codec for audio language model,","venue":null,"work_id":"c14cd59e-5fd5-41a4-8e0b-30910e98b7f7","year":2025},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.511641Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:ad9d439bbc400c06c21fd7befff45213b3522f3c0c70091673898b9e7865aeea","observation_id":"cccfc76b-36da-420c-b2e4-c4131e596751","resolution":{"observed_at":"2026-08-05T22:17:39.304422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.272647Z","title":"Emo2vec: Learning emotional embeddings via multi-emotion cate- gory,","venue":null,"work_id":"f28b4678-156c-45c1-a8d4-e98258b1efc0","year":2020},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.527270Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:7dea1bbb704a4924b0c2c67d93acfabbb9df8571f9d2c802d5e0731902f4a7ac","observation_id":"ccf1bd42-12ea-41ad-adf4-7b8b96c96d3a","resolution":{"observed_at":"2026-08-05T22:17:39.279034Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.252455Z","title":"Dspgan: A gan-based universal vocoder for high-fidelity tts by time-frequency domain supervision from dsp,","venue":null,"work_id":"b13355df-f1a2-4848-be6b-7641c83f43c4","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.538673Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:964f77f0fd7ebe35ac24541bbf16f0929a6d914a9696ef456cffdaa346d0e6b1","observation_id":"41f923b0-f431-41f5-9199-848c59f8635e","resolution":{"observed_at":"2026-08-05T22:17:39.259195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13702","last_updated":"2024-12-19T17:36:38Z","snapshot_observed_at":"2026-07-06T20:09:10.465980Z","submitted_at":"2024-12-18T10:45:24Z","title":"Typhoon 2: A Family of Open Text and Multimodal Thai Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13702","snapshot_observed_at":"2026-08-05T22:17:38.548736Z","title":"Typhoon 2: A family of open text and multi- modal thai large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.548736Z"},"links":{"cited_paper":"/paper/2412.13702","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:3532f8f69f5f6934674b014899911b6314aba00c1531e60c590d460db5f577c5","observation_id":"673bf918-60b9-4a34-b0c1-4645917f6e50","resolution":{"observed_at":"2026-08-05T22:17:38.548736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:17:39.227744Z","title":"Wespeaker: A research and production oriented speaker embedding learning toolkit,","venue":null,"work_id":"a58a197f-6617-4619-afb9-0c373d31699d","year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.555521Z"},"links":{"citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:01924c4190a6063734aa1cdd9b9d53c4edf4e65f329f2820f739a23d11ee1901","observation_id":"d50a04fe-1cb7-4954-97cf-7339f98a8a42","resolution":{"observed_at":"2026-08-05T22:17:39.234880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11230","last_updated":"2024-04-10T02:35:38Z","snapshot_observed_at":"2026-07-06T16:34:31.299748Z","submitted_at":"2023-10-17T13:01:10Z","title":"Zipformer: A faster and better encoder for automatic speech recognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11230","snapshot_observed_at":"2026-08-05T22:17:38.566540Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:17:38.566540Z"},"links":{"cited_paper":"/paper/2310.11230","citing_paper":"/paper/2508.07302"},"observation_digest":"sha256:92165731a83054a215f6e5ba438ea664843e2b575536e6ef957837f749909236","observation_id":"36270e26-3b47-4623-b5ba-0d932e9939a4","resolution":{"observed_at":"2026-08-05T22:17:38.566540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.07302","last_updated":"2025-08-12T02:31:09Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-06T13:29:36.885619Z","submitted_at":"2025-08-10T11:31:13Z","title":"XEmoRAG: Cross-Lingual Emotion Transfer with Controllable Intensity Using Retrieval-Augmented Generation"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":4,"verified_fuzzy":18},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2508.07302."}