{"as_of":"2026-08-15T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b8ecc95d144ee12457f750b47953627289b0ddaa5dbe2953ab1ff22445744466","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:04:51.686582Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T10:28:18.202974Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-10T12:15:01.137692Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"cited_work":{"arxiv_id":"2508.11326","doi":"10.48550/arxiv.2508.11326","metadata_source":"arxiv_reference","pith_arxiv_id":"2508.11326","snapshot_observed_at":"2026-07-10T12:15:01.137692Z","title":"Moe-tts: Enhancing out-of-domain text understanding for description-based TTS via mixture-of-experts,","venue":null,"work_id":"7069e87a-9607-4df6-b66e-fcf2c140fba0","year":2025},"citing_paper":{"arxiv_id":"2605.28063","last_updated":"2026-05-27T07:15:35Z","snapshot_observed_at":"2026-08-13T12:17:23.810410Z","submitted_at":"2026-05-27T07:15:35Z","title":"Unified Synthesis of Compositional Speech and Sound from Free-Form Text Prompts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T10:28:18.202974Z"},"links":{"cited_paper":"/paper/2508.11326","citing_paper":"/paper/2605.28063"},"observation_digest":"sha256:beb63d08b51e8f9d7e037001758d7927bf9dab78f4526e47ffeba71093d85aca","observation_id":"5c51c5e4-1523-44d3-a286-74cf8ac7a6d0","resolution":{"observed_at":"2026-06-29T10:33:17.871334Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.11326/citation-record","integrity":"/paper/2508.11326/integrity","json":"/paper/2508.11326/citation-record.json","paper":"/paper/2508.11326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.689013Z","title":"URL https://elevenlabs.io/","venue":null,"work_id":"637c59cf-05b0-4b59-9fae-2df34837c1bf","year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.469156Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:7dfd61ae87e45f3447bdb31d45ba89621bee3af48522192f4bd10c705432ebef","observation_id":"9738eb00-04f2-48bf-92c0-b27cd17b3e05","resolution":{"observed_at":"2026-08-05T20:04:55.748254Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.516355Z","title":"URL https://www.minimaxi.com/","venue":null,"work_id":"d77c48dd-8cbe-46dc-abf1-e426d3ed6241","year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.565640Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:e24cba2725b50963990e2023e9b72f946a6b726c44e3f05aeebaccd28d668dab","observation_id":"ce9e6f66-ac65-4b5c-9169-07ff32a861b1","resolution":{"observed_at":"2026-08-05T20:04:55.589041Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.309505Z","title":"Prompttts: Controllable text-to-speech with text descriptions","venue":null,"work_id":"ece45a85-96d7-4ffb-919c-5b892ac4f2ad","year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.689717Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:38eaa6bb2e8a2cb61bc040cabfc7dd3cbf71fef9f7152201cdd588f78f24136b","observation_id":"89f4c621-ff5f-4dcc-822d-b331d18b5808","resolution":{"observed_at":"2026-08-05T20:04:55.428810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:48.027737Z","title":"Textrolspeech: A text style control speech corpus with codec language text-to-speech models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.027737Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:3e172ce0700a286db6eed4fdce8d1c4e5560e72b1ae4d1e72d100666b80bce01","observation_id":"8c8023d0-3447-4634-b9fe-92b3eadf8ecc","resolution":{"observed_at":"2026-08-05T20:04:48.027737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.167287Z","title":"Prompttts 2: Describing and generating voices with text prompt","venue":null,"work_id":"89ba0ea5-8d92-42a6-adf6-7eeac739d839","year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.124723Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:b31ec79dac5a9f47a60d4b42ade5ef58b9cb21a2cb2f54e6dca7854262047026","observation_id":"e089af01-3335-4723-9b80-2e7ee8217d75","resolution":{"observed_at":"2026-08-05T20:04:55.245317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:48.227297Z","title":"Libritts-p: A corpus with speaking style and speaker identity prompts for text- to-speech and style captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.227297Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:b85aa16ba427ee555700843edc4af8c05f7eb278aa3e32b4d5a0d54de47bff80","observation_id":"1bdee4dd-a422-45a5-97ce-36ccaa271d3e","resolution":{"observed_at":"2026-08-05T20:04:48.227297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:48.356380Z","title":"Speechcraft: A fine-grained expressive speech dataset with natural language description","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.356380Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:faa6f44ae79beea908ec7aa19ba6709422bcb342603c0fdb3d8cb037147c6aa2","observation_id":"7fc63fbb-c694-47ce-96fa-7e5e5aa45525","resolution":{"observed_at":"2026-08-05T20:04:48.356380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01912","last_updated":"2024-02-02T21:29:34Z","snapshot_observed_at":"2026-08-13T04:28:02.323611Z","submitted_at":"2024-02-02T21:29:34Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01912","snapshot_observed_at":"2026-08-05T20:04:48.453562Z","title":"Natural language guidance of high-fidelity text-to-speech with synthetic annotations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.453562Z"},"links":{"cited_paper":"/paper/2402.01912","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:1cb1cd3503060139fad7a167c70093f3f57d2448376bddabe709a119f81412fc","observation_id":"604d43fb-5ff3-4590-b857-a3b1e3df899f","resolution":{"observed_at":"2026-08-05T20:04:48.453562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2503.04713","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Scaling rich style-prompted text-to-speech datasets","venue":"ArXiv.org","work_id":"bbbc9f48-ef11-4553-9bb0-b4b6309172ef","year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.511222Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:1ae5845dc390a3a8d8c5b719da478042f9cc96d2796bd905badb1352a602d68e","observation_id":"ad880798-f23f-401c-86a7-7da9281cad6e","resolution":{"observed_at":"2026-08-05T20:04:52.561894Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T20:04:48.592233Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.592233Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:bf875aa92a06325459da351d7ee5ffa81d183e0691de89efb168216e12a24d6f","observation_id":"da4489d1-bfb3-4e5a-88bc-db1fc786b8b6","resolution":{"observed_at":"2026-08-05T20:04:48.592233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T20:04:48.684230Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.684230Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:05a8eecc4f15615de1fa71ebb0a39328646ed7d353050f25edaf3a32d8d3ba6d","observation_id":"b68494d3-07d7-4dba-a3df-bf733c33b7f2","resolution":{"observed_at":"2026-08-05T20:04:48.684230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:55.039733Z","title":null,"venue":null,"work_id":"4ee53b57-f386-44e2-b1cc-c6e8c453be31","year":2020},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.772419Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:6b307866707687848418fe9a0aa0e1ce0ce6302308783b99f79900bc57f44b9f","observation_id":"f0be7c83-54b5-4e2c-b38c-2317bd581025","resolution":{"observed_at":"2026-08-05T20:04:55.112183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-15T06:56:49.859129Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-05T20:04:48.852163Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.852163Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:0160ac38738cd8d92bf763019f97eff4a560de2a0fe69f647ff5d712c50971a8","observation_id":"971ec484-d792-4683-9284-c4dd997917f3","resolution":{"observed_at":"2026-08-05T20:04:48.852163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12867","last_updated":"2025-08-13T11:23:57Z","snapshot_observed_at":"2026-08-07T16:01:29.916688Z","submitted_at":"2025-04-17T11:50:04Z","title":"EmoVoice: LLM-based Emotional Text-To-Speech Model with Freestyle Text Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12867","snapshot_observed_at":"2026-08-05T20:04:48.933028Z","title":"Emovoice: Llm-based emotional text-to-speech model with freestyle text prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:48.933028Z"},"links":{"cited_paper":"/paper/2504.12867","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:f8bde3c828a8b305edd3553b80bce45764950ec308591b0ca471cd011ba3ff7f","observation_id":"e8030ec9-5c4e-4c8b-b9de-b51f1d09328a","resolution":{"observed_at":"2026-08-05T20:04:48.933028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T20:04:49.009853Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.009853Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:65f1e62d66a8ca6f3151c49376a602d03772256567aa2a9082cd3c91a8f884ae","observation_id":"cf596226-53b9-4921-ab0f-3282f7c3cfe8","resolution":{"observed_at":"2026-08-05T20:04:49.009853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-08-13T14:29:50.623753Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-05T20:04:49.104039Z","title":"Investi- gating the catastrophic forgetting in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.104039Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:1b92a79197c090cec6daa969c37bde9917e50b38f0fba04520aba5213240bac9","observation_id":"bf9a4a57-a755-4743-aae5-8ba47bbd97e6","resolution":{"observed_at":"2026-08-05T20:04:49.104039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.833915Z","title":"Mono-internvl: Pushing the boundaries of monolithic multimodal large language models with endogenous visual pre-training","venue":null,"work_id":"fff52c82-754d-48d2-91a1-6d2f219aa527","year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.260735Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:ac5a4caec0d7cc265ec10b3dd18624f7c909dd1ede78854b3d530087f1aaba49","observation_id":"d8fb27d0-048f-43b8-8811-f6ae30b3d965","resolution":{"observed_at":"2026-08-05T20:04:54.957933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10313","last_updated":"2023-12-05T08:59:33Z","snapshot_observed_at":"2026-08-13T14:29:50.623753Z","submitted_at":"2023-09-19T04:51:13Z","title":"Investigating the Catastrophic Forgetting in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10313","snapshot_observed_at":"2026-08-05T20:04:49.161915Z","title":"URL https://doi.org/10.48550/arXiv.2309","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.161915Z"},"links":{"cited_paper":"/paper/2309.10313","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:2a908993c86846cc6c9ce8b3f08624b88e6df06ab2bcac82080bc6ac1d1e51fb","observation_id":"8b2ff2d1-6018-4309-95ab-bf44defa8f83","resolution":{"observed_at":"2026-08-05T20:04:49.161915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.630495Z","title":"Vlmo: Unified vision- language pre-training with mixture-of-modality-experts","venue":null,"work_id":"6d4c6951-3472-4e2a-b507-365dbb140114","year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.447667Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:63b5ce55ab5b3e835c5c48667c078f99b62d240192f22e7d06e192319874db22","observation_id":"43dfd901-5a48-435a-97c5-6aa2d561ba95","resolution":{"observed_at":"2026-08-05T20:04:54.706910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06788","snapshot_observed_at":"2026-08-05T20:04:49.342135Z","title":"Evev2: Improved baselines for encoder-free vision- language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.342135Z"},"links":{"cited_paper":"/paper/2502.06788","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:b7ec6ebc752c14c50916b5b19536969d65c02c442dedd382d1c15585ca4c849b","observation_id":"6313292f-a74b-4422-952c-043a5e25126a","resolution":{"observed_at":"2026-08-05T20:04:49.342135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.401062Z","title":"Simbert: Integrating retrieval and generation into bert","venue":null,"work_id":"5f6bab19-4fc5-4405-bf1a-c19743c0d165","year":2020},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.727665Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:9ce337d5ada63ac06e18d56c8cf87b036d1329285aa0c655439ae902db83a1d5","observation_id":"b0af524c-c2bd-43bc-b1e0-e4d2c969f240","resolution":{"observed_at":"2026-08-05T20:04:54.508410Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-05T20:04:49.511799Z","title":"Image as a foreign language: Beit pretraining for all vision and vision-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.511799Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:aad60cf47cc12f81410ba134b2b7bcb63b10162648b33c0eda025b81f410650a","observation_id":"813005c5-8fe4-4834-b72a-2f5f23fc6ff8","resolution":{"observed_at":"2026-08-05T20:04:49.511799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.059491Z","title":"Fastspeech: Fast, robust and controllable text to speech","venue":null,"work_id":"b9257022-c71e-4614-9fd1-10a4485f5e7e","year":2019},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.987765Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:b49eeb859f66391b4030525cd06ad6b85a73601bf67fc2b479b3f680aaa624f2","observation_id":"695d6b7c-a62b-4a93-bf27-bbd25450c258","resolution":{"observed_at":"2026-08-05T20:04:54.168169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-05T20:04:50.064063Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.064063Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:fbec20b64a4bad06e7209e53c1be2556f577748de6340ebaa29c727cff0b450f","observation_id":"faa15446-d0e2-479a-84e9-03b0b46f337b","resolution":{"observed_at":"2026-08-05T20:04:50.064063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:54.322190Z","title":"BERT: pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"86180dbb-e375-4c6a-afc3-8d4d2b224e1f","year":2019},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.809205Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:9f3b6b41a7ee54e152832efc61da50e51e25eeaf6ad26cd7569c73fe4dc026f1","observation_id":"ac9cca37-f696-416f-8db7-12761b0f7f4a","resolution":{"observed_at":"2026-08-05T20:04:54.327115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.07916","last_updated":"2025-05-12T14:25:20Z","snapshot_observed_at":"2026-08-07T15:47:51.144825Z","submitted_at":"2025-05-12T14:25:20Z","title":"MiniMax-Speech: Intrinsic Zero-Shot Text-to-Speech with a Learnable Speaker Encoder","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.07916","snapshot_observed_at":"2026-08-05T20:04:50.260659Z","title":"Minimax-speech: Intrinsic zero-shot text-to-speech with a learnable speaker encoder","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.260659Z"},"links":{"cited_paper":"/paper/2505.07916","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:b5530f964f051371197194e2a673673cfa3359032307937f0b2caaf96a710189","observation_id":"2c2df928-bc5f-48f1-b625-13fb9153f588","resolution":{"observed_at":"2026-08-05T20:04:50.260659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.758","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T05:30:23.456663Z","title":"Scaling vision-language models with sparse mixture of experts","venue":null,"work_id":"20d30a70-1ac9-4d00-a52e-74ffaf1db1e3","year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.387922Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:eb8410743dd33d072a171f66ccd14fba532a47e6db2eb3f63a481c6625f3e8ff","observation_id":"88f43fff-0582-44ed-bff3-0f42b3fb910a","resolution":{"observed_at":"2026-08-05T20:04:52.080129Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04128","last_updated":"2025-02-22T11:32:13Z","snapshot_observed_at":"2026-08-08T23:22:17.610458Z","submitted_at":"2025-02-06T15:04:00Z","title":"Llasa: Scaling Train-Time and Inference-Time Compute for Llama-based Speech Synthesis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04128","snapshot_observed_at":"2026-08-05T20:04:50.463688Z","title":"Llasa: Scaling train-time and inference-time compute for llama-based speech synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.463688Z"},"links":{"cited_paper":"/paper/2502.04128","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:3b0101d76fa52185fa338e362dc79af7a31460b29229f970ed9817ca059d5ef7","observation_id":"dae82b05-3ee8-421c-9566-a108eea12dd3","resolution":{"observed_at":"2026-08-05T20:04:50.463688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-08-15T11:55:32.600679Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-05T20:04:50.143999Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.143999Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:1f0b7735480025340b71083b2e151a0e73cbcd5cf493dc63f79843413d954329","observation_id":"653e739d-550c-4d36-abff-8a836d6e1634","resolution":{"observed_at":"2026-08-05T20:04:50.143999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-05T20:04:50.680474Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.680474Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:11112524b8eedc8b63744c83522b76244cf8d460289be87d0d55e4c05ab418fb","observation_id":"2bc8c221-afe1-4c67-97d8-90be3bb98c38","resolution":{"observed_at":"2026-08-05T20:04:50.680474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.939732Z","title":"Orpheus tts: Towards human-sounding tts","venue":null,"work_id":"33d9e767-5aa0-4d13-b3a4-55a3c2d19f5a","year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.781373Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:2548b875ac1fa105bf4cb3ac6de9de55dbb59be0ca86961f04389637ea172bdf","observation_id":"d17d0c2a-3b7c-4648-827f-3ffda6d2e73f","resolution":{"observed_at":"2026-08-05T20:04:53.997908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.821157Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units","venue":null,"work_id":"b9430469-5526-4f26-ae4a-a74b4efd1704","year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.872744Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:2b0955339003adc116dedacded0187efe735a9ec0ef05e85e8083523bba8258f","observation_id":"fe17e825-4a1a-4234-a1b4-7f458d45e298","resolution":{"observed_at":"2026-08-05T20:04:53.870799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-08-11T19:42:36.266059Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-05T20:04:50.570486Z","title":"Qwen2.5-1m technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.570486Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:e642519f60b2a811c6602178dc7e01c6d675361b5875ab7e51828df14d61e415","observation_id":"cf0c18c0-5f8a-4972-b220-3ebce6c1707b","resolution":{"observed_at":"2026-08-05T20:04:50.570486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.501481Z","title":"Neural discrete representation learning","venue":null,"work_id":"86a0853a-801a-4e07-b89a-c80b5081794e","year":2017},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.113315Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:11831d751bae5950d4fcfe4f4fd0bb486776dcf99b65188c95fbbef20123e19d","observation_id":"66e3afe6-3357-4c14-8fde-7939efa6c934","resolution":{"observed_at":"2026-08-05T20:04:53.559273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.210481Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.210481Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:fa94bab7151b031ff4537a9e9475f12cdadfc59b853ffe20f6131987c4c88e37","observation_id":"dc0ecd74-90e6-4083-b7bc-ac851aba7832","resolution":{"observed_at":"2026-08-05T20:04:51.210481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.394185Z","title":"High-fidelity audio compression with improved RVQGAN","venue":null,"work_id":"308a926b-5b5e-42c6-ba9f-3ce99b89526e","year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.289926Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:d908960f70b8581c125dc382f0ea3d6d75acd28e2414f1342072a33dbc0389b8","observation_id":"4ed51057-2fdc-4987-a663-7e456b2448e6","resolution":{"observed_at":"2026-08-05T20:04:53.446296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01710","last_updated":"2025-03-03T16:23:10Z","snapshot_observed_at":"2026-08-13T16:11:28.134657Z","submitted_at":"2025-03-03T16:23:10Z","title":"Spark-TTS: An Efficient LLM-Based Text-to-Speech Model with Single-Stream Decoupled Speech Tokens","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01710","snapshot_observed_at":"2026-08-05T20:04:51.369330Z","title":"Spark-tts: An efficient llm-based text-to- speech model with single-stream decoupled speech tokens","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.369330Z"},"links":{"cited_paper":"/paper/2503.01710","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:d69d1448eb853fa5b3d055abc9dadce9db63c69fb6286d3de64f2a86ea621a19","observation_id":"9accb710-3a08-439c-b5ad-e7e7fbbba6c0","resolution":{"observed_at":"2026-08-05T20:04:51.369330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.686152Z","title":"Self-supervised learning with random-projection quantizer for speech recognition","venue":null,"work_id":"37685eda-9502-45c1-9787-cee334c81e78","year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.037030Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:eeb89c6e549eec212b3dbc40c8c0642af79ab660080e5b0b4a59df494d898129","observation_id":"bdc1c6f7-2d9a-4f7d-9bd7-3bf548064f4d","resolution":{"observed_at":"2026-08-05T20:04:53.769779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.505861Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.505861Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:6e49523d3948ab8d248728c079c51b73d21f9f434b7010a9a4162811240059fd","observation_id":"ecd9b8f4-018b-449c-80fd-7bc44ad28dfb","resolution":{"observed_at":"2026-08-05T20:04:51.505861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.590164Z","title":"Albergo, Nicholas M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.590164Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:5a9bbfade816086e707520ed069f95aa14b4c38377343afc2b137262591b1db5","observation_id":"4dc488d9-eef8-4a29-9e0e-fef17261ee57","resolution":{"observed_at":"2026-08-05T20:04:51.590164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:51.686582Z","title":"Emilia: A large-scale, extensive, multilingual, and diverse dataset for speech generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.686582Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:091ad2f8e785a7e64adc6c9450d82b3a154f54802fca1b114526c82828fb706d","observation_id":"a6b3cc7b-26e8-46e9-9a56-07636ec06f1b","resolution":{"observed_at":"2026-08-05T20:04:51.686582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:53.271134Z","title":"Elucidating the de- sign space of diffusion-based generative models","venue":null,"work_id":"f3a08470-ccb4-431c-8b3d-7a0cd07b728f","year":2022},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:51.448310Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:18c27c1bee4978a2fc7923949dcb9b9ac59aca82af665d3b010c2518b50888b9","observation_id":"be96fe05-0c7d-4492-9fbe-fc61f0d13e93","resolution":{"observed_at":"2026-08-05T20:04:53.311325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:50.973979Z","title":"URL https://doi.org/10.1109/TASLP.2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:50.973979Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:753741342fc7ff7d130ea5449147b27cb0bc1fb89fff6028eb0ec0d01c84acf0","observation_id":"8854b402-7093-4e14-9a29-82a68a516603","resolution":{"observed_at":"2026-08-05T20:04:50.973979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.10442","last_updated":"2022-08-31T02:26:45Z","snapshot_observed_at":"2026-08-13T14:40:51.995893Z","submitted_at":"2022-08-22T16:55:04Z","title":"Image as a Foreign Language: BEiT Pretraining for All Vision and Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.10442","snapshot_observed_at":"2026-08-05T20:04:49.612420Z","title":"URL https://doi.org/10.48550/arXiv.2208","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.612420Z"},"links":{"cited_paper":"/paper/2208.10442","citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:bd6480580631e4c55de975a3c6b1cf606db8339ae89d384353ef9cb10e1bdfbe","observation_id":"5d35de97-2743-4564-959d-2c91eed98a3a","resolution":{"observed_at":"2026-08-05T20:04:49.612420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:47.813576Z","title":"URL https://doi.org/10.1109/ ICASSP49357.2023.10096285","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:47.813576Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:17d7688ad73cee636a3cc8fc1576f31a920ff4e58323091f20aa37e93d3e0f2d","observation_id":"1a804652-6dfb-4a4a-9f30-ad5deddc4abd","resolution":{"observed_at":"2026-08-05T20:04:47.813576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:04:49.884453Z","title":"doi: 10.18653/V1/N19-1423","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts","version":1},"reference_index":4186,"source":"pdf_text","source_observed_at":"2026-08-05T20:04:49.884453Z"},"links":{"citing_paper":"/paper/2508.11326"},"observation_digest":"sha256:749b42e9ead9cb85139bf049a883995187539975536945f5b2f4c65d6226e992","observation_id":"e5145ede-99f9-4cef-bc1e-8e700f33f581","resolution":{"observed_at":"2026-08-05T20:04:49.884453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.11326","last_updated":"2025-08-15T08:53:56Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-08T03:03:55.171613Z","submitted_at":"2025-08-15T08:53:56Z","title":"MoE-TTS: Enhancing Out-of-Domain Text Understanding for Description-based TTS via Mixture-of-Experts"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2508.11326."}