{"as_of":"2026-08-09T15:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aad1e0dfb16c487aabd5352e5d862e7e841200d9d89694a39ee22fb0b62e8587","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:07:00.555072Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T05:39:39.351499Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T12:26:37.300599Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2406.02430"},"observation_digest":"sha256:4953f8611af1dae4dead420f77d092a4159b932c8fdc8433b99c137eb4df3f60","observation_id":"d23726c2-113b-44f4-aa51-28e4166d5cf8","resolution":{"observed_at":"2026-05-15T12:26:37.374042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2410.06885","last_updated":"2025-05-20T15:53:10Z","snapshot_observed_at":"2026-08-01T23:52:25.071174Z","submitted_at":"2024-10-09T13:46:34Z","title":"F5-TTS: A Fairytaler that Fakes Fluent and Faithful Speech with Flow Matching","version":3},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-16T06:06:41.348728Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2410.06885"},"observation_digest":"sha256:258188d4f56d4e8608750b3a5f6a2cbff6294f6e873f86a5f38739c6cf85e27b","observation_id":"2739dbb6-bbdd-4204-ada2-6c2aa237b80e","resolution":{"observed_at":"2026-05-16T06:06:41.419455Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2410.13720","last_updated":"2025-02-26T16:05:55Z","snapshot_observed_at":"2026-08-09T03:17:30.671491Z","submitted_at":"2024-10-17T16:22:46Z","title":"Movie Gen: A Cast of Media Foundation Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-11T14:16:18.521699Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2410.13720"},"observation_digest":"sha256:7e71d36c451470c96db13719a4fcb104b0c0283ccfd08020fd2a6bd20906a6d3","observation_id":"d1f8a6af-4077-4cfd-922b-e4af6a01f3a2","resolution":{"observed_at":"2026-05-11T14:16:25.090823Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-08T19:07:00.555072Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.05512","last_updated":"2025-02-08T10:23:20Z","snapshot_observed_at":"2026-08-08T19:00:10.236127Z","submitted_at":"2025-02-08T10:23:20Z","title":"IndexTTS: An Industrial-Level Controllable and Efficient Zero-Shot Text-To-Speech System","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T19:07:00.555072Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2502.05512"},"observation_digest":"sha256:510a8e02b73cf235c945745f3fc1b3225ee500924868ff7caf43c28c44ef5ce8","observation_id":"579bf133-2af6-4ed5-8767-e6b373bc5b1c","resolution":{"observed_at":"2026-08-08T19:07:00.555072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:f3e978c99faa00a8235c1c74efc0efca4d4e1d2785436c7949ca24f3d99fa177","observation_id":"7d63e650-8a76-42e2-8d3b-161003e822e3","resolution":{"observed_at":"2026-05-11T19:21:27.203852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-07T14:58:57.060521Z","title":"Preprint, arXiv:2206.04658","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.16691","last_updated":"2025-05-23T05:07:17Z","snapshot_observed_at":"2026-08-07T15:22:39.973665Z","submitted_at":"2025-05-22T13:57:02Z","title":"EZ-VC: Easy Zero-shot Any-to-Any Voice Conversion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:58:57.060521Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2505.16691"},"observation_digest":"sha256:bbbb8a41981a9e88925625280e08441b603f5db147f5c53846735ff0ac9a5125","observation_id":"e23d19c3-e4d0-4c5b-9b03-a0f3341ab500","resolution":{"observed_at":"2026-08-07T14:58:57.060521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-07T14:18:26.333141Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.19476","last_updated":"2025-05-27T09:33:56Z","snapshot_observed_at":"2026-08-09T13:06:45.444737Z","submitted_at":"2025-05-26T03:55:00Z","title":"FlowSE: Efficient and High-Quality Speech Enhancement via Flow Matching","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:18:26.333141Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2505.19476"},"observation_digest":"sha256:e5ba99d603c80cce072e9e2d2bd583119ec835e0ba435fc29ffb24983723a30e","observation_id":"19438aab-9d1a-45a9-81ef-0bfca388140b","resolution":{"observed_at":"2026-08-07T14:18:26.333141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2505.24437","last_updated":"2026-05-07T16:01:45Z","snapshot_observed_at":"2026-08-01T04:07:46.006657Z","submitted_at":"2025-05-30T10:20:04Z","title":"SwitchCodec: A High-Fidelity Nerual Audio Codec With Sparse Quantization","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-19T13:10:14.839742Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2505.24437"},"observation_digest":"sha256:15343989552bcd80edd7963f8050ff351c6ce90c9133e88fc3477c3dac7879b6","observation_id":"0b615ebf-df7c-41fa-8796-d91eb89e070b","resolution":{"observed_at":"2026-05-19T13:12:18.182021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-07T04:42:03.300243Z","title":"Bigvgan: A universal neural vocoder with large-scale training.arXiv preprint arXiv:2206.04658,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09989","last_updated":"2025-06-11T17:58:34Z","snapshot_observed_at":"2026-08-08T02:04:20.796517Z","submitted_at":"2025-06-11T17:58:34Z","title":"Hearing Hands: Generating Sounds from Physical Interactions in 3D Scenes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:42:03.300243Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2506.09989"},"observation_digest":"sha256:271980b31163c5ff7aca8f987c3ed897152d74a52f30396763243133e1634024","observation_id":"bbf3bf9b-824b-4480-85ee-db7a70c8a286","resolution":{"observed_at":"2026-08-07T04:42:03.300243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-06T22:29:28.144770Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21478","last_updated":"2025-06-26T17:07:45Z","snapshot_observed_at":"2026-08-06T22:21:25.389863Z","submitted_at":"2025-06-26T17:07:45Z","title":"SmoothSinger: A Conditional Diffusion Model for Singing Voice Synthesis with Multi-Resolution Architecture","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:29:28.144770Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2506.21478"},"observation_digest":"sha256:fa6b77d75dc195538656a06aace449e5c9c92478ff82303f1126501d3e2e1cb3","observation_id":"9270443a-18f3-402d-b2b9-64bc1ce5d6ec","resolution":{"observed_at":"2026-08-06T22:29:28.144770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-06T20:06:18.783491Z","title":"arXiv preprint arXiv:2206.04658 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03887","last_updated":"2025-07-05T03:59:17Z","snapshot_observed_at":"2026-08-09T03:28:14.530864Z","submitted_at":"2025-07-05T03:59:17Z","title":"Traceable TTS: Toward Watermark-Free TTS with Strong Traceability","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T20:06:18.783491Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2507.03887"},"observation_digest":"sha256:bbaeef0398470ee5362b4a3f6cbbdcf64b92886f4ff79ee7057c6ab4dce2024c","observation_id":"a948d280-9424-49bd-84ba-40d785a8f973","resolution":{"observed_at":"2026-08-06T20:06:18.783491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:850d64c552ae6f3d3f1126bf1a769fbb78a9b81babb0de4b789c7c2edee17737","observation_id":"604528b6-756c-4732-9d83-2299a1a9d949","resolution":{"observed_at":"2026-05-16T05:59:51.180223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-05T23:10:56.252891Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.05835","last_updated":"2025-08-07T20:20:32Z","snapshot_observed_at":"2026-08-08T04:15:55.486381Z","submitted_at":"2025-08-07T20:20:32Z","title":"NanoCodec: Towards High-Quality Ultra Fast Speech LLM Inference","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T23:10:56.252891Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2508.05835"},"observation_digest":"sha256:0c69cf73030c93c695ab4de4abd9326dfaa65406a7da85ef33a14f4391b6f9c7","observation_id":"1df455ea-20ce-4795-9461-174ffa8818ab","resolution":{"observed_at":"2026-08-05T23:10:56.252891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2510.01284","last_updated":"2025-09-30T21:03:50Z","snapshot_observed_at":"2026-08-06T11:49:53.749464Z","submitted_at":"2025-09-30T21:03:50Z","title":"Ovi: Twin Backbone Cross-Modal Fusion for Audio-Video Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T01:03:15.183360Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2510.01284"},"observation_digest":"sha256:d9ed733458a372521499dd8ed4395629aadc99ee6ff71e4bf4303cfb2fa489c5","observation_id":"1c4df732-860b-4121-aaf6-1bbac2558344","resolution":{"observed_at":"2026-05-17T01:03:15.250457Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-04T11:29:33.696265Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:33.696265Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:38fad697c6a0f4c6ba0e074425308b8fbad0024b67aa826ac8ec2e327a7f13fc","observation_id":"373248fe-be09-4514-ab30-ec207ad538f0","resolution":{"observed_at":"2026-08-04T11:29:33.696265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-03T00:11:13.570717Z","title":"Bigvgan: A universal neural vocoder with large-scale training.arXiv preprint arXiv:2206.04658,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.12304","last_updated":"2026-07-23T11:24:08Z","snapshot_observed_at":"2026-08-03T00:11:08.466564Z","submitted_at":"2026-02-12T03:25:41Z","title":"OmniCustom: Sync Audio-Video Customization Via Joint Audio-Video Generation Model","version":5},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T00:11:13.570717Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2602.12304"},"observation_digest":"sha256:773f6a9f2aeb9571f64b97ae8a457a4ace8523ef22adfea40b587f297ef052d9","observation_id":"0a9243e4-5b1f-4c08-8647-a0501dc8fe38","resolution":{"observed_at":"2026-08-03T00:11:13.570717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-14T22:43:13.611383Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.11669","last_updated":"2026-06-08T07:16:00Z","snapshot_observed_at":"2026-08-02T13:38:52.812816Z","submitted_at":"2026-03-12T08:37:28Z","title":"SEMamba++: A General Speech Restoration Framework Leveraging Global, Local, and Periodic Spectral Patterns","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T22:43:13.611383Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2603.11669"},"observation_digest":"sha256:3373f71614446a277583d4047335288c1b63d5d773a59794fa9435d84c8b99fb","observation_id":"e6e78f76-5b58-4f8a-ba39-c53405f146b5","resolution":{"observed_at":"2026-07-14T22:43:13.611383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-02T18:03:42.596651Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.596651Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:aa594dd7ebf36b1d2d1eabe8a9ad100a7b0d9f426879fca6b35f1e0da55c726c","observation_id":"226673d6-99e2-4c78-aaa2-02f64a4e0c1d","resolution":{"observed_at":"2026-08-02T18:03:42.596651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2604.17986","last_updated":"2026-04-20T09:08:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-20T09:08:13Z","title":"Latent Fourier Transform","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T03:45:07.892234Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2604.17986"},"observation_digest":"sha256:996f8ea2482d4cc32371f382f002437867753a60b04835c21788b5bc7f471e94","observation_id":"20153b22-c0d0-49e9-8ffb-4c85d2fbee4b","resolution":{"observed_at":"2026-05-11T12:21:07.071659Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.15831","last_updated":"2026-05-15T10:35:49Z","snapshot_observed_at":"2026-07-06T23:27:05.961780Z","submitted_at":"2026-05-15T10:35:49Z","title":"Modeling Music as a Time-Frequency Image: A 2D Tokenizer for Music Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T18:47:32.003545Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.15831"},"observation_digest":"sha256:d7d75c4309c20b6d203db1f59567fefe49c7bf9adca8d3c205fe064f71b33068","observation_id":"9992c7a6-1cbf-4232-bcf4-a04420ee13d6","resolution":{"observed_at":"2026-05-19T18:47:43.077570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.16681","last_updated":"2026-05-15T22:34:52Z","snapshot_observed_at":"2026-08-01T12:57:25.699552Z","submitted_at":"2026-05-15T22:34:52Z","title":"A Survey of Advancing Audio Super-Resolution and Bandwidth Extension from Discriminative to Generative Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-19T20:26:59.049472Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.16681"},"observation_digest":"sha256:0f3f4e3f358cd285062ee8908240d9c0fee56c955109ac95f0efb0ee9a1410d0","observation_id":"67134491-ea93-4cb6-a203-9f53492153b3","resolution":{"observed_at":"2026-05-19T20:27:49.816692Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.17085","last_updated":"2026-05-16T17:01:47Z","snapshot_observed_at":"2026-07-06T23:28:06.971959Z","submitted_at":"2026-05-16T17:01:47Z","title":"Taming Audio VAEs via Target-KL Regularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-20T14:53:15.718359Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.17085"},"observation_digest":"sha256:6247f03dabea4a1de8eef7ddc9261fdb4cd7e81aa4b2b4afa734196e500ad149","observation_id":"636c0cda-1aa7-491a-803c-a712e014276f","resolution":{"observed_at":"2026-05-20T14:53:23.209087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.18749","last_updated":"2026-05-18T17:59:10Z","snapshot_observed_at":"2026-08-01T11:03:45.027975Z","submitted_at":"2026-05-18T17:59:10Z","title":"WavFlow: Audio Generation in Waveform Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T07:33:35.243337Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.18749"},"observation_digest":"sha256:c94e9ebcb678ca557cc5a085de574f1a1294fb9c58877de25f3a815e1c510719","observation_id":"3662da70-f9dc-47ec-9904-b88ea400f5ca","resolution":{"observed_at":"2026-05-20T07:38:09.595548Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.26672","last_updated":"2026-06-17T13:28:50Z","snapshot_observed_at":"2026-07-06T23:36:29.930024Z","submitted_at":"2026-05-26T08:11:27Z","title":"Can We Hear from Events? Generating Speech from Event Camera","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T14:40:29.819278Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.26672"},"observation_digest":"sha256:f4a36bace1e3f398eafd454e3c6fb24852c3d6d6353cecf13d5130ed1dbbf16f","observation_id":"bf7b9118-f04a-47bc-83e3-a35cb284d05d","resolution":{"observed_at":"2026-06-29T14:43:30.664608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2605.29531","last_updated":"2026-06-20T04:24:04Z","snapshot_observed_at":"2026-08-08T15:04:19.890939Z","submitted_at":"2026-05-28T07:47:22Z","title":"Audio Deepfake Detection with Half-Truth Localisation Using Cross-Attentive Feature Fusion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T06:02:59.488895Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2605.29531"},"observation_digest":"sha256:e96fb84407755a2e090112f6bc5f5568e3572578a2c971917766aca0b64866de","observation_id":"0309b8d9-1088-4116-bfbc-45332e306b20","resolution":{"observed_at":"2026-06-29T06:03:08.305425Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2606.03455","last_updated":"2026-06-02T10:33:20Z","snapshot_observed_at":"2026-08-05T18:48:21.902772Z","submitted_at":"2026-06-02T10:33:20Z","title":"WavTTS: Towards High-Quality Zero-Shot TTS via Direct Raw Waveform Modeling","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T08:18:42.002083Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2606.03455"},"observation_digest":"sha256:1631cf776117e16a789f67b740561bf86cd0a8140fc6221dc390b6931d33d27f","observation_id":"f58b15e8-af53-49b9-9393-c734f69dbe9a","resolution":{"observed_at":"2026-07-02T05:16:39.735273Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-07-17T23:18:05.285816Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-26T15:51:48.672086Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:148989bc5c90e81295030390755e860603d997fdf552feecc1c65fa4eceabc18","observation_id":"6eca4175-8429-414d-9b49-d8ba54451670","resolution":{"observed_at":"2026-07-04T05:39:39.354621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-07-17T23:18:05.285816Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-03T23:36:39.368933Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:4c5e41b6532c62c1da0eaef59440aafba57841691ddf5d569ec0bd4e31adb766","observation_id":"a817e62f-41a3-4069-9317-bef083050635","resolution":{"observed_at":"2026-07-03T23:39:03.049720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-15T10:41:34.347336Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.20101","last_updated":"2026-07-13T22:06:08Z","snapshot_observed_at":"2026-07-17T23:18:05.285816Z","submitted_at":"2026-06-18T11:20:08Z","title":"RFM-Editing 2: Text-Guided Audio Editing with Rectified Flow Matching and Coarse-to-Fine Diffusion Transformers","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-15T10:41:34.347336Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2606.20101"},"observation_digest":"sha256:13fb791fd2714525505ea1b5dbb0d550c10929a54c8d57114d46d6fe3ff4bec5","observation_id":"6330ad10-3a6c-4bb5-a416-99b113edd190","resolution":{"observed_at":"2026-07-15T10:41:34.347336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2606.31128","last_updated":"2026-06-30T04:46:45Z","snapshot_observed_at":"2026-08-06T13:27:09.813532Z","submitted_at":"2026-06-30T04:46:45Z","title":"UniSAE: Unified Speech Attribute Editing on Speaker, Emotion and Low-Level Content via Discrete Phonetic Posteriorgram Modelling","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-01T04:05:27.343684Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2606.31128"},"observation_digest":"sha256:47a1abf29329e2f97495de8a845e635b8a8e1813cf92397f8cd2f3d4707a8fa9","observation_id":"84d3053b-a9ec-42ee-b070-7879ea0cfc7b","resolution":{"observed_at":"2026-07-01T11:45:46.188575Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":"2206.04658","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-04T05:39:39.351499Z","title":"Bigvgan: A universal neural vocoder with large-scale training","venue":null,"work_id":"953c2238-9c78-4b7c-a435-58768d959ff6","year":2022},"citing_paper":{"arxiv_id":"2606.31247","last_updated":"2026-06-30T07:24:10Z","snapshot_observed_at":"2026-07-07T00:04:58.486133Z","submitted_at":"2026-06-30T07:24:10Z","title":"FlexiSLM: A Dynamic and Controllable Frame Rate Spoken Language Model","version":1},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-07-01T03:50:26.873406Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2606.31247"},"observation_digest":"sha256:7a4c519b4acc26a2bf9eda679f913966f8618525b8a8dddb9152ef4e27ee6633","observation_id":"aa50874b-2739-4ff1-a3f3-aeaf04927119","resolution":{"observed_at":"2026-07-01T11:55:42.258516Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-07-14T14:47:58.592181Z","title":"BigVGAN: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.09891","last_updated":"2026-07-10T18:29:24Z","snapshot_observed_at":"2026-08-07T18:22:58.421177Z","submitted_at":"2026-07-10T18:29:24Z","title":"What You Train Is What You Get: Gender Bias, Training Composition, and Post-Hoc Mitigation in Audio Deepfake Detection","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T14:47:58.592181Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2607.09891"},"observation_digest":"sha256:d27c24c8f3eb06ad7108d5bcc0e222892115c94b8b211aaa7f3d0b9927e368ca","observation_id":"e71e3b9a-8de6-4cc1-99c5-688362adba5b","resolution":{"observed_at":"2026-07-14T14:47:58.592181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-01T22:37:47.065781Z","title":"BigV- GAN: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15694","last_updated":"2026-08-01T08:45:58Z","snapshot_observed_at":"2026-08-07T06:45:33.554889Z","submitted_at":"2026-07-17T07:13:11Z","title":"A Geometry-Limited Identification Floor and Its Consequences for Voice-Clone Attribution in Professional Voice Actors","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-01T22:37:47.065781Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2607.15694"},"observation_digest":"sha256:58806551e4bc0d48a5dcc0aed420de1a51564b8dcb1a968c180bebe4e0d8ed12","observation_id":"e7d11ceb-6de3-46b4-b475-c12e180b5c19","resolution":{"observed_at":"2026-08-01T22:37:47.065781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-04T01:43:21.961191Z","title":"BigV- GAN: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15694","last_updated":"2026-08-01T08:45:58Z","snapshot_observed_at":"2026-08-07T06:45:33.554889Z","submitted_at":"2026-07-17T07:13:11Z","title":"A Geometry-Limited Identification Floor and Its Consequences for Voice-Clone Attribution in Professional Voice Actors","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T01:43:21.961191Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2607.15694"},"observation_digest":"sha256:012f82e33c2e19dc94664f8593c75419599d289383cc0a72106750c2077c14d5","observation_id":"a2325b15-5f9a-46d0-8265-9b3319349523","resolution":{"observed_at":"2026-08-04T01:43:21.961191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-01T08:40:29.851867Z","title":"BigVGAN: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.21042","last_updated":"2026-07-23T08:24:21Z","snapshot_observed_at":"2026-08-06T21:34:24.895106Z","submitted_at":"2026-07-23T08:24:21Z","title":"Faster IndexTTS-2: Accelerating and Streaming Autoregressive Zero-Shot Text-to-Speech Synthesis on GPUs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T08:40:29.851867Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2607.21042"},"observation_digest":"sha256:d499a9d5faeadd0e7bed84bc466e1fd82a830fa243a95a5e3475e5312d282295","observation_id":"e5d0f3a8-6f14-4794-95e9-61cf4c3f3ecd","resolution":{"observed_at":"2026-08-01T08:40:29.851867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2206.04658/citation-record","integrity":"/paper/2206.04658/integrity","json":"/paper/2206.04658/citation-record.json","paper":"/paper/2206.04658"},"outbound":[],"paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2206.04658."}