{"as_of":"2026-08-20T04:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b167fc6e03e84b6bd4ffd87888b914d47e4ebb838cf7ae1136b7f4f334b65eef","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:43:40.731660Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T15:47:06.014261Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":"2306.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-07-02T15:47:06.014261Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"e877a8f6-5739-4d1e-9bc8-516dd1ed738d","year":2023},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-17T10:09:03.767186Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:84ba615530085f7fdd8d0d6dd6dd7a3beb78f8ffb92c0cf02d17eb890b5ef1f2","observation_id":"f456c7f4-541e-47cd-856c-1b8ad3962f2c","resolution":{"observed_at":"2026-05-11T14:16:25.046954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-11T12:44:57.241106Z","title":"arXiv preprint arXiv:2306.15687","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.13917","last_updated":"2024-12-18T14:57:06Z","snapshot_observed_at":"2026-08-14T20:49:43.328828Z","submitted_at":"2024-12-18T14:57:06Z","title":"Speech Watermarking with Discrete Intermediate Representations","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T12:44:57.241106Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2412.13917"},"observation_digest":"sha256:23e73278367c62efd60680afda4fe4c89f0f79361410775d15290a55a9713c88","observation_id":"bd427a1c-693f-42af-b43f-14463a3e3cd5","resolution":{"observed_at":"2026-08-11T12:44:57.241106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-10T23:21:34.590797Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.21037","last_updated":"2025-04-10T05:01:32Z","snapshot_observed_at":"2026-08-18T08:51:59.333838Z","submitted_at":"2024-12-30T16:02:44Z","title":"TangoFlux: Super Fast and Faithful Text to Audio Generation with Flow Matching and Clap-Ranked Preference Optimization","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T23:21:34.590797Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2412.21037"},"observation_digest":"sha256:b62018cabf21994ec8a62071d4c859b5e62ed5ddf5eafd43cccef4ab2eb2dd0a","observation_id":"b360166c-1f97-4adf-93ca-1ce8e1519132","resolution":{"observed_at":"2026-08-10T23:21:34.590797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-09T16:43:08.768464Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01084","last_updated":"2025-02-13T09:25:03Z","snapshot_observed_at":"2026-08-18T03:00:24.814227Z","submitted_at":"2025-02-03T05:53:59Z","title":"Continuous Autoregressive Modeling with Stochastic Monotonic Alignment for Speech Synthesis","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T16:43:08.768464Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2502.01084"},"observation_digest":"sha256:558f164a76eb11e1901b100356d5256d0aeb8d7d25581cd073ca64f4ddd813eb","observation_id":"996e2d5b-fdd1-48d5-88b8-1a4ee0220a00","resolution":{"observed_at":"2026-08-09T16:43:08.768464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-16T11:43:40.731660Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-08-20T00:55:08.973218Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:43:40.731660Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2504.14906"},"observation_digest":"sha256:c4b3ed23d53564b03139028654223d36e0f1ccb9177dc37ade0ee2260d4a3302","observation_id":"352967e5-f9f1-4b2a-8471-9f1a25b21d67","resolution":{"observed_at":"2026-08-16T11:43:40.731660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-15T22:12:32.845011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07802","last_updated":"2025-06-03T16:45:05Z","snapshot_observed_at":"2026-08-18T14:45:46.910267Z","submitted_at":"2025-05-12T17:50:10Z","title":"Improving Trajectory Stitching with Flow Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T22:12:32.845011Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2505.07802"},"observation_digest":"sha256:1742d7461cd9a45e667958ad9c2910af7994dd2f28f3d3d8211cb3a2816c25c5","observation_id":"8c436648-c066-4e7d-bf43-27b29dadef12","resolution":{"observed_at":"2026-08-15T22:12:32.845011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-07T14:58:57.464868Z","title":"Preprint, arXiv:2306.15687","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-13T05:00:06.234822Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.464868Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:789af2d53390d71bbd80015076ebc14c33974ce13006f4f720484afb9358f3c8","observation_id":"228b822e-6e8d-4a88-ad92-ce19c9c4def3","resolution":{"observed_at":"2026-08-07T14:58:57.464868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-07T14:19:51.036153Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale.ArXiv, abs/2306.15687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19462","last_updated":"2025-05-31T22:36:04Z","snapshot_observed_at":"2026-08-09T03:57:33.373890Z","submitted_at":"2025-05-26T03:35:44Z","title":"VoiceStar: Robust Zero-Shot Autoregressive TTS with Duration Control and Extrapolation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:19:51.036153Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2505.19462"},"observation_digest":"sha256:b8185ab98fbfff6c5461e6f3f756d362657d6560da41e9896bb693067f419088","observation_id":"c44eb73f-b23e-479f-822f-8d99bf5d7fe1","resolution":{"observed_at":"2026-08-07T14:19:51.036153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-06T18:21:33.236994Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08603","last_updated":"2025-07-11T13:55:45Z","snapshot_observed_at":"2026-08-14T09:41:39.436098Z","submitted_at":"2025-07-11T13:55:45Z","title":"Unlocking Speech Instruction Data Potential with Query Rewriting","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T18:21:33.236994Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2507.08603"},"observation_digest":"sha256:84124a818c1bb80ac2a4ac8dd853229a2a9d88dd1fcdf35cb4dd7913d29d3d3a","observation_id":"f142280b-7379-477a-bfee-909d5bfdb87c","resolution":{"observed_at":"2026-08-06T18:21:33.236994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-06T15:14:30.133816Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16875","last_updated":"2025-07-22T09:38:30Z","snapshot_observed_at":"2026-08-14T19:25:32.616653Z","submitted_at":"2025-07-22T09:38:30Z","title":"Technical report: Impact of Duration Prediction on Speaker-specific TTS for Indian Languages","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T15:14:30.133816Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2507.16875"},"observation_digest":"sha256:5bd2435950faa7320d3eb8483e507d0dfb682e79cb8dc2f53ce8317c86b67f7e","observation_id":"ead94f66-2b8d-4b78-928d-1d85dd3b77a5","resolution":{"observed_at":"2026-08-06T15:14:30.133816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-06T13:54:39.883971Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.19894","last_updated":"2026-08-15T13:49:25Z","snapshot_observed_at":"2026-08-20T04:09:10.796587Z","submitted_at":"2025-07-26T09:49:57Z","title":"Generative Model Unlearning: A Survey through Target Events, Unlearning Operators, and Evaluation Protocols","version":1},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-08-06T13:54:39.883971Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2507.19894"},"observation_digest":"sha256:4deca373a199f7a180bc0c04cb22f8fe3dd8a456067d83052d49e38eee897ed9","observation_id":"a26f963b-c51b-4469-a6b0-76b0961ebf9d","resolution":{"observed_at":"2026-08-06T13:54:39.883971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-02T18:03:40.202491Z","title":"V oicebox: Text-guided multilin- gual universal speech generation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-18T07:26:57.959066Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.202491Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:e6d762f32e745fbe77f477e2de313748eba6fdae7d1cef293fb04be1aebe12cd","observation_id":"90acce7b-57d5-49f2-9b22-d93e9238a3c7","resolution":{"observed_at":"2026-08-02T18:03:40.202491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":"2306.15687","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-07-02T15:47:06.014261Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"e877a8f6-5739-4d1e-9bc8-516dd1ed738d","year":2023},"citing_paper":{"arxiv_id":"2606.06357","last_updated":"2026-06-04T16:25:07Z","snapshot_observed_at":"2026-08-12T03:15:42.764171Z","submitted_at":"2026-06-04T16:25:07Z","title":"F3-Tokenizer: Taming Audio Autoencoder Latents for Understanding and Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-27T23:36:27.369551Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2606.06357"},"observation_digest":"sha256:a5b0a0f5ca24bf68e260d2ea37eb291ec1b1cba6baf100f9b45cc3be54ab2934","observation_id":"f9d4e9c5-ff4c-451c-acc1-e5a81b6d86e5","resolution":{"observed_at":"2026-07-02T15:47:06.015877Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-02T00:41:47.855999Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14947","last_updated":"2026-07-16T12:57:00Z","snapshot_observed_at":"2026-08-09T11:25:01.860063Z","submitted_at":"2026-07-16T12:57:00Z","title":"Optimal Self-Distillation for Rectified Flow via Linear Probing","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:41:47.855999Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2607.14947"},"observation_digest":"sha256:30622a19b47439bd9fab8ebb4335da7eddc46e160d02d20db3d3659c02ed3f74","observation_id":"02bcab2f-d7b1-462a-b062-50ba2e73d25c","resolution":{"observed_at":"2026-08-02T00:41:47.855999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-01T17:45:41.413951Z","title":"arXiv preprint arXiv:2306.15687 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-17T21:54:04.970629Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.413951Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:7390cdfce5476c7a50ec048c54909d02698499bed5377f03c781afed3f8d7d9f","observation_id":"b386eac8-8089-4c0d-89f8-1bac72d4b507","resolution":{"observed_at":"2026-08-01T17:45:41.413951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-14T04:32:48.017504Z","title":"V oicebox: Text-Guided Multilingual Universal Speech Generation at Scale.https://arxiv.org/ abs/2306.15687, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.08667","last_updated":"2026-08-09T12:21:54Z","snapshot_observed_at":"2026-08-14T09:18:48.936467Z","submitted_at":"2026-08-09T12:21:54Z","title":"A Unifying Perspective on Audio Generative Modeling: Latent Representations and Modeling Strategies","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:48.017504Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2608.08667"},"observation_digest":"sha256:8831266fc7b655062b1508317ed523788cebb0f0052e1098bcad46b88afd28dc","observation_id":"bbde2eef-b8a9-41e2-9698-44f2f76c5e36","resolution":{"observed_at":"2026-08-14T04:32:48.017504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-16T00:36:21.682711Z","title":"V oicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.11650","last_updated":"2026-08-12T04:48:29Z","snapshot_observed_at":"2026-08-19T11:38:34.761607Z","submitted_at":"2026-08-12T04:48:29Z","title":"Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T00:36:21.682711Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2608.11650"},"observation_digest":"sha256:51be9ee0af00a839a7c54bbcede82a18dfdb2eb26c3c4c40e98837d9dff6751e","observation_id":"0556a7c5-451b-4c06-94bb-3e5db3357557","resolution":{"observed_at":"2026-08-16T00:36:21.682711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2306.15687/citation-record","integrity":"/paper/2306.15687/integrity","json":"/paper/2306.15687/citation-record.json","paper":"/paper/2306.15687"},"outbound":[],"paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T15:21:37.387257Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2306.15687."}