{"as_of":"2026-08-14T11:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:44fb16cfefcc7fdd2ec67dfe65c6f83352573be0071d55367d495c72b834aa75","coverage":[{"denominator":58,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":58,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T14:54:55.275856Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.09571/citation-record","integrity":"/paper/2608.09571/integrity","json":"/paper/2608.09571/citation-record.json","paper":"/paper/2608.09571"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.267889Z","title":null,"venue":null,"work_id":"b11ceb22-6bb3-4c70-83ff-bd4dccc71ea6","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.028632Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:8dff46e462e875eec996e7d786e0bc9eafef87fbbda44d3bc995d692ec43048c","observation_id":"afd02cc8-07cd-496d-a50f-5e442ff4c8c2","resolution":{"observed_at":"2026-08-11T14:54:56.272037Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.252473Z","title":"V oicebox: Text-guided multilingual universal speech generation at 8 scale.Advances in neural information processing systems, 36:14005–14034, 2023","venue":null,"work_id":"9fb08c7c-74ee-4680-94af-e7c9ab0e85c0","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.033145Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:51ba9afb3b733a042602fca65844ea765f67f19efa4d6960daade4b2e34781f3","observation_id":"4eed1274-ef77-48e1-b345-c3ae0df48eb6","resolution":{"observed_at":"2026-08-11T14:54:56.257290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.237971Z","title":"F5- TTS: A fairytaler that fakes fluent and faithful speech with flow matching","venue":null,"work_id":"83e7044d-d6a2-4430-a93c-b196c4c694c3","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.038148Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:229c0a8be2a50d5d151c7a43f0e2b6908264268285154ba682796b50f8595066","observation_id":"fb1a21ac-4182-42ba-84e7-1f03920daa17","resolution":{"observed_at":"2026-08-11T14:54:56.242505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.223502Z","title":"Tangoflux: Super fast and faithful text to audio generation with flow matching and clap-ranked preference optimization","venue":null,"work_id":"d73ec26b-7d20-4257-a123-aad0bba5b557","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.042819Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:21c28b2bac6f39259a9f9783b09839f9b65bb769fe9ec07f521ca1927e1629f1","observation_id":"c3e5f785-c4a8-424a-8b6e-b1cbf54b13c0","resolution":{"observed_at":"2026-08-11T14:54:56.228130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.207772Z","title":"Plumbley","venue":null,"work_id":"d3a67f92-6647-4692-8dba-1aeb320492b2","year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.047662Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:afe5a3341789f56edb0e0787cd6bade1f93002358abcc74e6f20ad0d134daeca","observation_id":"4fa110ad-eb7a-4c90-9dca-66fc47c1d481","resolution":{"observed_at":"2026-08-11T14:54:56.212486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.191084Z","title":null,"venue":null,"work_id":"cd9a9a42-8aed-4026-a79b-87dfbde1ddf5","year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.052640Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:dc152e1a02057e2db2cb0b1f2a9f7bb3ef609deb642587994d08c9ad89aa001c","observation_id":"c268a083-01d3-4d96-ae51-f753edf7da14","resolution":{"observed_at":"2026-08-11T14:54:56.196252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-13T04:54:07.077274Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T14:54:55.057843Z","title":"Audiobox: Unified audio generation with natural language prompts.CoRR, abs/2312.15821,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.057843Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:14a28de23743b6b329a9694ec42f8d1e2477cbae98203dc81ab9c53f63b60297","observation_id":"cdbad638-fd23-48e1-bf05-11a5343a5750","resolution":{"observed_at":"2026-08-11T14:54:55.057843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.27838","last_updated":"2026-05-27T01:50:29Z","snapshot_observed_at":"2026-08-13T15:35:37.691793Z","submitted_at":"2026-05-27T01:50:29Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","version":1},"cited_work":{"arxiv_id":"2605.27838","doi":"10.48550/arxiv.2605.27838","metadata_source":"pith","pith_arxiv_id":"2605.27838","snapshot_observed_at":"2026-08-11T18:16:15.004306Z","title":"Dasheng AudioGen: A Unified Model for Generating Coherent Audio Scenes from Text","venue":"cs.SD","work_id":"69af8481-4ef8-488b-9407-1f67f1fa0396","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.067522Z"},"links":{"cited_paper":"/paper/2605.27838","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:31b2b90821ad90d6de953501b60ef2fab13e6e28fce23599eca7ba728579e417","observation_id":"a466b657-6ca1-489c-921d-c11eb11d7be7","resolution":{"observed_at":"2026-08-11T14:54:55.619644Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.173665Z","title":"UniMoE-Audio: Unified speech and music generation with dynamic- capacity mixture-of-experts","venue":null,"work_id":"d34c1c41-2349-4263-a11e-a0180415d43d","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.072212Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:e69f803df2aa0eec439180330fddb7872925a13d0c4b7dc8c5b8d1e32eddfc40","observation_id":"f59e3dc8-afac-4863-b9ef-1593a0f9b875","resolution":{"observed_at":"2026-08-11T14:54:56.178829Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.158527Z","title":"Mandic, Wenwu Wang, and Mark D","venue":null,"work_id":"82df77a7-f92f-402a-abaa-d22bba993f24","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.076050Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:8d46333eb7af642e76b4546ee180248238d12e7f044e6a09bc47c032535f38fc","observation_id":"8e6278e1-319a-45e0-9363-943639f4f052","resolution":{"observed_at":"2026-08-11T14:54:56.163243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.143778Z","title":"UniSonate: A unified model for speech, music, and sound effect generation with text instructions","venue":null,"work_id":"09b06aac-db37-4818-bd14-b09c23e86563","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.079733Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:004494589be90b6071851b77bc242fcd438a9194f2c03e47ee3e5bc25f4227d9","observation_id":"a826b188-4b5a-4d18-bb33-6e4b0ca9c963","resolution":{"observed_at":"2026-08-11T14:54:56.148464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18474","last_updated":"2023-05-29T10:41:28Z","snapshot_observed_at":"2026-08-13T11:30:24.178620Z","submitted_at":"2023-05-29T10:41:28Z","title":"Make-An-Audio 2: Temporal-Enhanced Text-to-Audio Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18474","snapshot_observed_at":"2026-08-11T14:54:55.083682Z","title":"Make-An-Audio 2: Temporal-enhanced text-to-audio generation.CoRR, abs/2305.18474, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.083682Z"},"links":{"cited_paper":"/paper/2305.18474","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:cf71af9ee597513c28eb9d45c3c53e73e40be31daaa7cdb9bd0d62e7fe001b60","observation_id":"79092f9d-7ac3-4d2d-b7e0-8a2dbf9f2cda","resolution":{"observed_at":"2026-08-11T14:54:55.083682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.129319Z","title":"Text-to-audio generation using in- struction guided latent diffusion model","venue":null,"work_id":"3f1bc7d6-5d77-4a6a-9cdd-177ee7bb84c2","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.087986Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:251886ac1f8d0a9d0e8aabe0b6caa6d7898e82ecb212d348af695dfa6ef9b3d5","observation_id":"d82903fd-9735-4cd8-81ec-05f31fbda54c","resolution":{"observed_at":"2026-08-11T14:54:56.133911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.114638Z","title":"Freeaudio: Training-free timing plan- ning for controllable long-form text-to-audio generation","venue":null,"work_id":"1aeea26e-bdab-441c-87a8-b8451178e5ee","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.091787Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:9718fe770f5c7f9d8541754ea389540bdf33c3acf408469ecc603855f04e4ba8","observation_id":"54b05279-be64-43e9-8226-51d3f4c08fac","resolution":{"observed_at":"2026-08-11T14:54:56.119443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.095477Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learn- ing Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.095477Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:43af279c46bc57a0be1d62ecde5923865312a43e1d9eec9feaa3b8ab17a6dc56","observation_id":"e04a2ccd-3fd9-4258-a87f-8fe0dd487153","resolution":{"observed_at":"2026-08-11T14:54:55.095477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11633","last_updated":"2024-09-09T02:17:12Z","snapshot_observed_at":"2026-08-12T23:21:10.918169Z","submitted_at":"2024-07-16T11:55:23Z","title":"Scaling Diffusion Transformers to 16 Billion Parameters","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11633","snapshot_observed_at":"2026-08-11T14:54:55.099279Z","title":"Scaling diffusion transformers to 16 billion parameters.CoRR, abs/2407.11633, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.099279Z"},"links":{"cited_paper":"/paper/2407.11633","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:98aae82bb33ae4596868e58e8990155693f458019f1ba464e570ff8ef1efea60","observation_id":"62964b0e-7417-4d5b-9b98-07b190c2032c","resolution":{"observed_at":"2026-08-11T14:54:55.099279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.090258Z","title":"Switch diffu- sion transformer: Synergizing denoising tasks with sparse mixture-of-experts","venue":null,"work_id":"9da556bc-a285-49a7-bb8d-2474a3b2e439","year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.103831Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:63eae476f12c530d120b4df41b713f782a3250474dfe9e45029f2c4502b93680","observation_id":"1ea80760-c232-497a-bed6-eb0602fcff01","resolution":{"observed_at":"2026-08-11T14:54:56.095129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.074869Z","title":"EC-DIT: Scaling diffusion transformers with adaptive expert-choice routing","venue":null,"work_id":"beeec2b7-394b-47a5-86f2-1d8f35f0267b","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.108164Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:54d2cfc4dfd7c8630cab1cf5eae48236204fc217f625df0f2c1a93e11c6e7db9","observation_id":"f5509802-f7a0-46ce-8b60-2855f3ce56b7","resolution":{"observed_at":"2026-08-11T14:54:56.079884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-11T14:54:55.113059Z","title":"Qwen2-VL: Enhanc- ing vision-language model’s perception of the world at any resolution.CoRR, abs/2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.113059Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:a52d271d198482c7ebf015aa00ad801f0dba4cc120c5b9959422c40cf62ebcb1","observation_id":"91b25063-e225-4f9a-92d6-762f8998988d","resolution":{"observed_at":"2026-08-11T14:54:55.113059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.061052Z","title":"Scalable diffusion mod- els with transformers","venue":null,"work_id":"35bb954d-393e-4fee-b1cb-5555ea1d367d","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.117751Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:7ddbb563cafd80c3d002e450661c023abd3b0df48954a13b4f4251f20f74b128","observation_id":"7c0ebbd6-d290-41f6-9327-a19b0d50143d","resolution":{"observed_at":"2026-08-11T14:54:56.065225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.047989Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"244d62c7-5bf0-4e2c-b0f1-dacd30685d90","year":2021},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.122187Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:72014e3bd9deee04153c62fb99a57afeef0f00e90ba22c3336764af3dd8665a6","observation_id":"ec6c0a83-9fa1-445a-aa46-3864d9e1d3cb","resolution":{"observed_at":"2026-08-11T14:54:56.052100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-11T14:54:55.126911Z","title":"CosyV oice 2: Scalable streaming speech synthesis with large language models.CoRR, abs/2412.10117, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.126911Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:922f1312ac27f6bdd16749bc875f30edd807164f75977cd5a4861a684bb43bfa","observation_id":"8a2bcaef-be1c-44b5-9a36-b84fec2768e0","resolution":{"observed_at":"2026-08-11T14:54:55.126911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-12T20:35:16.024701Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-11T14:54:55.131781Z","title":"Step-Audio: Unified understanding and generation in intelligent speech interaction.CoRR, abs/2502.11946, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.131781Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:dbe67b57a7d13eda8fcfa920f60fdba73ca59d278fb25533c6cd30b593588a01","observation_id":"0e10443b-a2af-4cb4-9da5-27e2fbf33a07","resolution":{"observed_at":"2026-08-11T14:54:55.131781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.034405Z","title":"Simple and controllable music generation.Advances in neural information processing systems, 36:47704–47720, 2023","venue":null,"work_id":"ead99ef5-79fb-48d7-a1ac-b248c87a0b56","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.136657Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:8b30f3728fd78e621c978bde82b469675a4da5dc410a55cae83a0f5e2c231c35","observation_id":"0669497a-4ea5-47c6-8599-cf94c0d5df74","resolution":{"observed_at":"2026-08-11T14:54:56.038847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2026.acl-long.586","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.523913Z","title":"SegTune: Structured and fine-grained con- trol for song generation","venue":null,"work_id":"3ea9c83b-4dcb-4521-8f34-480158e20896","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.140918Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:8337f37efe0208dca88b2be4ba5c1d8d3caab89a11b9de7d64ad2e603f7b88c3","observation_id":"ef7088ac-e0e6-4331-a5c5-bff7ee09a496","resolution":{"observed_at":"2026-08-11T14:54:55.528507Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-11T14:54:55.144842Z","title":"Qwen2.5-Omni technical report.CoRR, abs/2503.20215,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.144842Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:cb1430878acdb3eb206153958b2890ffd87853ddc31ec9fc1897b7d7972188dc","observation_id":"a41bb708-5063-4773-a12d-b90f59ac082e","resolution":{"observed_at":"2026-08-11T14:54:55.144842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.020433Z","title":"Parker, CJ Carr, Zack Zukowski, Josiah Taylor, and Jordi Pons","venue":null,"work_id":"5236cc02-ff3c-4ec9-8e9d-6b5bb1493f8c","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.153623Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:bd7c7ae285bd7dc7c1bf631ea30c567b68b0f53663bfdb3be57bafd39e25c928","observation_id":"fda2e9ef-d7ff-4da9-a101-f60dad53afd7","resolution":{"observed_at":"2026-08-11T14:54:56.025058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:56.005904Z","title":"Audiox: A unified framework for anything-to-audio generation","venue":null,"work_id":"5a9b7f06-9986-470c-976e-5d8025cddf65","year":2026},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.157870Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:7cc1bf5532e57e433f73fa85455179aa5ec20bf87b2597b08a8ce3042f8d5516","observation_id":"386c4899-330e-4995-a944-fd706fcd1e3d","resolution":{"observed_at":"2026-08-11T14:54:56.010531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.989387Z","title":"Higgs Audio V2: Redefining expressiveness in audio generation","venue":null,"work_id":"8bc9118b-d096-45e4-b4fa-2e1294dc5132","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.161824Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:b2491e8ff58cdefc26024c5c4218533271515cb112bce9b14d7215f2952ccc9c","observation_id":"ddc464a5-37d5-489e-bdb3-37f041586904","resolution":{"observed_at":"2026-08-11T14:54:55.995338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2509.24391","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.491811Z","title":"UniFlow- Audio: Unified flow matching for audio generation from omni-modalities.CoRR, abs/2509.24391, 2025","venue":null,"work_id":"f58a04b2-7ef7-416e-8af3-bf2f8e92a991","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.165701Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:73f0458bcc0da2f5dd13af688c4664e78a9c63e284ca84e58de0fd19e4f5500e","observation_id":"4ae51aae-4b50-4398-bbf1-ffeb860a1e57","resolution":{"observed_at":"2026-08-11T14:54:55.499848Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.169530Z","title":"Supervised learning of universal sentence representations from natural language inference data","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.169530Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:cdf8a9b54ff917dcb48c3cd0828480b8c6df0ae4f6fc132500a82ee63e08a3eb","observation_id":"955e52c4-3a3b-455c-8728-ad26f9cbfee5","resolution":{"observed_at":"2026-08-11T14:54:55.169530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-08-14T06:37:15.299690Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-11T14:54:55.173499Z","title":"Classifier-free diffusion guidance.arXiv preprint arXiv:2207.12598, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.173499Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:b06be3fcedbc1eee277d9fea798edef4f3625637bee4a8539e9af44fc68c68c4","observation_id":"abcac6ea-9023-46a7-83e5-f42822daecd6","resolution":{"observed_at":"2026-08-11T14:54:55.173499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.973585Z","title":"Eliminating oversaturation and artifacts of high guidance scales in diffusion models","venue":null,"work_id":"c4049769-a4c0-4e3c-af8b-549181738046","year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.178905Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:389be918aacbcd5ab496792055ad5e48471992dd28d95205207c4a53292ebfa3","observation_id":"6004f259-5b16-45c1-a7ea-f7031326e77c","resolution":{"observed_at":"2026-08-11T14:54:55.978801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-11T14:54:55.183277Z","title":"Seed-TTS: A family of high-quality versatile speech generation models.CoRR, abs/2406.02430, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.183277Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:6785d9c76953d7748fe3fba0194924aed769a0e23527b9b62a60bf5a8bd73898","observation_id":"ac4144c2-224e-423e-9d08-114090bf528a","resolution":{"observed_at":"2026-08-11T14:54:55.183277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.958161Z","title":"Librispeech-pc: Benchmark for evaluation of punc- tuation and capitalization capabilities of end-to-end asr models","venue":null,"work_id":"2069da5b-2a54-4b7d-b7ba-ac57253396d9","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.188042Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:68418a617db9c3a9cd05e5995a434e7297cd93b83cfa8908d022c215d8c7eca8","observation_id":"371dd502-aa54-4b93-8057-8f167f221832","resolution":{"observed_at":"2026-08-11T14:54:55.963729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.944446Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":"5505ad84-5cf8-4bdf-a3c7-37d5d71828bf","year":2019},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.192582Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:7b9dfc548c3005f35180d7e12eba97831e72b8a57710e930525132ca54625979","observation_id":"b2798beb-52d1-42af-ac10-55cdf9072415","resolution":{"observed_at":"2026-08-11T14:54:55.948849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.11325","last_updated":"2023-01-26T18:58:53Z","snapshot_observed_at":"2026-08-14T02:16:19.922733Z","submitted_at":"2023-01-26T18:58:53Z","title":"MusicLM: Generating Music From Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.11325","snapshot_observed_at":"2026-08-11T14:54:55.196931Z","title":"Denk, Zalán Borsos, Jesse H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.196931Z"},"links":{"cited_paper":"/paper/2301.11325","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:a004837cbfc97a324fc1f985d89e2c64fd9d5764d4d6e81f35a7c8fc9eb52ba7","observation_id":"7f6a365e-c732-4d60-b0d2-c35994108945","resolution":{"observed_at":"2026-08-11T14:54:55.196931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10057","last_updated":"2023-11-22T21:22:11Z","snapshot_observed_at":"2026-08-13T05:23:40.948189Z","submitted_at":"2023-11-16T17:52:21Z","title":"The Song Describer Dataset: a Corpus of Audio Captions for Music-and-Language Evaluation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10057","snapshot_observed_at":"2026-08-11T14:54:55.201613Z","title":"The song describer dataset: A corpus of audio captions for music-and- language evaluation.CoRR, abs/2311.10057, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.201613Z"},"links":{"cited_paper":"/paper/2311.10057","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:24d31755ad460ae843eb7c1ac36ae2d2f01aed1c3808e642f2ce49c4785babc3","observation_id":"b68f9f84-a28b-4284-9d43-227b77b4bca7","resolution":{"observed_at":"2026-08-11T14:54:55.201613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-11T14:54:55.206209Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.206209Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:a2d3fa7ddd9cc7bfe07b3e280412fc87b18949988571fa3f4c93ab73c9a628f8","observation_id":"9242d031-4e69-4b04-9d86-ddf022d84c86","resolution":{"observed_at":"2026-08-11T14:54:55.206209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.930758Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"f0edfcd9-2ae8-4b3f-bb9d-15ef94be5f5d","year":2023},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.210869Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:e8af68d74b232ad451a7716f4ae99eb1be4586b1876b155f93b61e39679a391d","observation_id":"0cb6a07a-4fb6-4c10-b20e-18cc239d67a0","resolution":{"observed_at":"2026-08-11T14:54:55.935113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.916997Z","title":"rain” may be an event in sfx, “an urban street in a downpour","venue":null,"work_id":"056e29b2-ce60-44cf-b7c5-05401dc5796e","year":2022},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.215282Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:c7cb9309db8bb97c7a1990ccc99b0b246da8a524700ffda118daed26b5e44db1","observation_id":"c7d98b08-56b2-46b5-bba9-9d43b7952fa7","resolution":{"observed_at":"2026-08-11T14:54:55.921565Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.902970Z","title":"rule-based templates","venue":null,"work_id":"295a7468-acc2-43f2-ac8d-69d3e864110e","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.219349Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:1b9a99465f8a2fcb7789e2d9df6726cfc7adf0657f8eb12d36b96f5f640334e9","observation_id":"f7f18d1f-6b9b-4db2-b40a-3db806700a16","resolution":{"observed_at":"2026-08-11T14:54:55.907528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.888718Z","title":"Do not include markdown, explana- tions, or extra text","venue":null,"work_id":"0358bf83-f12d-48f4-b985-6fae20b4c536","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.223346Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:5664e1db97ec832bc6c0a5bb5e786c94682e8dac6825e65001f551ea5579a42e","observation_id":"1fa24644-4753-455f-b26b-eb41a89cd3be","resolution":{"observed_at":"2026-08-11T14:54:55.893520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.874150Z","title":"Do not add new keys","venue":null,"work_id":"b8674615-5f5d-4bba-a237-11058e227397","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.227851Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:be47f2975af023fe9422a9018704ab2a12e14b692384e930f6ff2c2744d3ef14","observation_id":"0010179d-e9ce-4f5e-bd02-2954138956d6","resolution":{"observed_at":"2026-08-11T14:54:55.878723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.858888Z","title":"- Do not paraphrase, expand, or rewrite it","venue":null,"work_id":"6e3924ee-d9d4-43b2-ab87-815cf105bf4d","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.231770Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:0ff9b65f34858f3a95e5268d6a466555182549d2abbe64287de627ec68383410","observation_id":"364a779a-e06d-4041-af44-06bacacb3304","resolution":{"observed_at":"2026-08-11T14:54:55.863503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.844435Z","title":"- Otherwise leave it empty","venue":null,"work_id":"f001676f-cac0-4cb9-aef6-bc7b36abf79c","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.235918Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:c63d3fff1175818060b82235f25ab44728f2013849d2b55ef7fee8945be5e7fd","observation_id":"28fde77a-e01a-4113-815d-914948893213","resolution":{"observed_at":"2026-08-11T14:54:55.849051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.830826Z","title":"Other- wise leave it empty","venue":null,"work_id":"0587fb4e-4ab9-4aa2-93f0-86294dbaa870","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.239775Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:45ac0c63f9d80d5084b5a701dd38b645b304a28cd59ed8c66e5f7823f7c5d901","observation_id":"750581f5-7a9b-4b7d-be7b-b099686e335e","resolution":{"observed_at":"2026-08-11T14:54:55.834994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.817135Z","title":null,"venue":null,"work_id":"a39e9022-cef1-4105-adef-8696e70fbfda","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.243879Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:7abdd6f954c93888d2fbe642e5f9f272246802f273ddebbaebefc86525f1c1c8","observation_id":"465acee9-987c-47c6-bfc0-4dab1cd5d5c7","resolution":{"observed_at":"2026-08-11T14:54:55.821099Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.803569Z","title":"- Otherwise leave it empty","venue":null,"work_id":"4a251756-f8fe-45c3-835f-9fe071df32e7","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.247581Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:bf8a482483b1c35a0b627b6af98ae3c3c2276d3d22a35242320b6e6003569aa0","observation_id":"ace219d6-1fef-41df-969f-24e92c3f7d29","resolution":{"observed_at":"2026-08-11T14:54:55.807877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.789430Z","title":null,"venue":null,"work_id":"30570b2c-bae0-40b2-8cda-1a8c316cb71b","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.251276Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:002644e7ef7f88052f2b43681b86c78e98a2f6a61fbaee1c57ec38085f99904c","observation_id":"353f1487-1fbf-4872-a937-cbd532615bd3","resolution":{"observed_at":"2026-08-11T14:54:55.794116Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.773349Z","title":null,"venue":null,"work_id":"dbd95d23-26bb-4bd6-833c-d0edcb1e176f","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.254890Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:f8e19a8f76b76ea043c800b6186d7e7448bb027fa8dde108a97f2a157b852c3e","observation_id":"83f9cdc4-50cd-4be2-bf37-b6357e747476","resolution":{"observed_at":"2026-08-11T14:54:55.778522Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.757850Z","title":null,"venue":null,"work_id":"a124a4e1-c3e0-4cf1-b659-516edbc4a6b5","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.258634Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:f0310978c48a3bb715758327fba5f6c3e56ad130e7e7a87e3dfe8c232cf440b1","observation_id":"6330a75d-ffd2-4610-a6f9-473999d3b4e5","resolution":{"observed_at":"2026-08-11T14:54:55.762312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.743210Z","title":null,"venue":null,"work_id":"daa0893d-53e4-4749-9cc0-29f5e39c4729","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.262758Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:b67142d6009c1dad776a110d4a97a37ddec945087d973ebdf42dba67adb4799d","observation_id":"889cc983-b815-4dd9-a3e1-56cfdcf16dad","resolution":{"observed_at":"2026-08-11T14:54:55.747826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.729930Z","title":"1\", \"2\",","venue":null,"work_id":"07935f21-c035-4965-8781-30e85ef7a366","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.267346Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:fd51a3f09a89b793fe035fe9baa424250b6d99b22e6740b26bf7930708ee6cf5","observation_id":"4c9b4f35-0a32-4976-af3c-7a1910d000f2","resolution":{"observed_at":"2026-08-11T14:54:55.733866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.716248Z","title":null,"venue":null,"work_id":"e3c1714a-b557-425b-987b-3e0afcb2e460","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.271550Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:ffca343d71a70fb816cf8b5d83ffdabffbb069af7f5837c7e3db2159fe5e5797","observation_id":"4038b4a8-cdc6-468c-835d-7d4d25138f2f","resolution":{"observed_at":"2026-08-11T14:54:55.720592Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T14:54:55.701813Z","title":"summary\":","venue":null,"work_id":"5512078b-b456-4363-b404-d03cd2f220f3","year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.275856Z"},"links":{"citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:dfd4f4a9019e6f5ca5eabf30dde61858c5d0f182998e3c92b50b47f28c497bd0","observation_id":"0d1a757a-e876-4dc8-b70c-6f66be8fce40","resolution":{"observed_at":"2026-08-11T14:54:55.706330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15821","last_updated":"2023-12-25T22:24:49Z","snapshot_observed_at":"2026-08-13T04:54:07.077274Z","submitted_at":"2023-12-25T22:24:49Z","title":"Audiobox: Unified Audio Generation with Natural Language Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15821","snapshot_observed_at":"2026-08-11T14:54:55.062732Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.062732Z"},"links":{"cited_paper":"/paper/2312.15821","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:184e14bf3093fc592accb6b9e00dc183a18788dacdd2656eb9e6b07f5ba7b96d","observation_id":"57e5ad33-fe50-4da2-b06f-b3c4ed53a099","resolution":{"observed_at":"2026-08-11T14:54:55.062732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-11T14:54:55.149373Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-11T14:54:55.149373Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2608.09571"},"observation_digest":"sha256:97d46adb8135d945cf4ea75024eb5482aa3057b3e0ad38f4349148589b4428ad","observation_id":"d2ee54d8-1f0b-469a-98b8-2ae550ef66e5","resolution":{"observed_at":"2026-08-11T14:54:55.149373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.09571","last_updated":"2026-08-10T13:07:24Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T23:45:11.945610Z","submitted_at":"2026-08-10T13:07:24Z","title":"SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation"},"reference_resolution":{"displayed":58,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":24,"verified_exact":3,"verified_fuzzy":30},"total_outbound_references":58},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 58 of 58 outbound references and 0 inbound Pith citation observations for arXiv:2608.09571."}