{"as_of":"2026-08-09T15:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fd06c016942992fa102386477a59d86c00a1109066934f6317b9ffab6200f221","coverage":[{"denominator":32,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":32,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:03:42.705090Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T18:03:39.804104Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16805","snapshot_observed_at":"2026-08-02T18:03:39.804104Z","title":"Problem Setup: Separation-First Multi-Stream Water- marking We consider mixtures formed by multiple stems (e.g., vocal and accompaniment) that may originate from different sources","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:39.804104Z"},"links":{"cited_paper":"/paper/2603.16805","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:c5cec818896a97c1998846fa0c89c0a7edca1e79628971b1eccd74a92176a3d2","observation_id":"d95a5364-4c2f-4396-946b-a1b22a37c019","resolution":{"observed_at":"2026-08-02T18:03:39.804104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2603.16805/citation-record","integrity":"/paper/2603.16805/integrity","json":"/paper/2603.16805/citation-record.json","paper":"/paper/2603.16805"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:39.754037Z","title":"Audio watermarking has therefore emerged as a key technology for copyright protection and tamper detection [5]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:39.754037Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:c2ce468680110bb38e00dac6a435c219aa339e9de21f668e2aa4fdd8e374e674","observation_id":"cf778fc3-f1cb-4b7e-9567-5c68cf177af5","resolution":{"observed_at":"2026-08-02T18:03:39.754037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16805","snapshot_observed_at":"2026-08-02T18:03:39.804104Z","title":"Problem Setup: Separation-First Multi-Stream Water- marking We consider mixtures formed by multiple stems (e.g., vocal and accompaniment) that may originate from different sources","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:39.804104Z"},"links":{"cited_paper":"/paper/2603.16805","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:c5cec818896a97c1998846fa0c89c0a7edca1e79628971b1eccd74a92176a3d2","observation_id":"d95a5364-4c2f-4396-946b-a1b22a37c019","resolution":{"observed_at":"2026-08-02T18:03:39.804104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:39.883511Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:39.883511Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:8f176198ba557266e408d0f926223fa6d648c88ea53a0853191cd3bc62ea9d17","observation_id":"775dfc10-d2a2-4f79-8f1c-1e30be1da483","resolution":{"observed_at":"2026-08-02T18:03:39.883511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:39.938342Z","title":"The LLMs were not used for ideation, methodology, experimental design, data analysis, or result interpretation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:39.938342Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:7794e71314034d0ae8fce288c0f2cfc027cc7bb1d3d6fb452065eb7386bd6f6d","observation_id":"8a9e14cc-64ab-4ed2-97f6-aa9b2557c439","resolution":{"observed_at":"2026-08-02T18:03:39.938342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-02T18:03:40.027879Z","title":"Neural codec language mod- els are zero-shot text to speech synthesizers,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.027879Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:af19e410ba7fe301d2f87ddf8fe9743c123c80c197f150da2ee660ce93035c5d","observation_id":"0cd1e6aa-b77f-48ac-8e1a-832191215d75","resolution":{"observed_at":"2026-08-02T18:03:40.027879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-06T16:43:15.954030Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-02T18:03:40.092528Z","title":"Audioldm: Text-to-audio generation with latent diffusion models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.092528Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:dc589f1f3f6805e9d8e9f76fa7ad33edcbf15cca15a84a6a791e1a884c29acaf","observation_id":"6f6fbe12-1056-481f-a394-17d714e80274","resolution":{"observed_at":"2026-08-02T18:03:40.092528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15687","last_updated":"2023-10-19T13:23:28Z","snapshot_observed_at":"2026-07-06T15:47:26.532273Z","submitted_at":"2023-06-23T16:23:24Z","title":"Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15687","snapshot_observed_at":"2026-08-02T18:03:40.202491Z","title":"V oicebox: Text-guided multilin- gual universal speech generation at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.202491Z"},"links":{"cited_paper":"/paper/2306.15687","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:6509a03f6c71c390a41a482a4ffcc1773e3bdc1f315124c4d8251511864b674f","observation_id":"90acce7b-57d5-49f2-9b22-d93e9238a3c7","resolution":{"observed_at":"2026-08-02T18:03:40.202491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07243","last_updated":"2023-05-23T21:41:54Z","snapshot_observed_at":"2026-07-06T15:26:18.929153Z","submitted_at":"2023-05-12T04:19:49Z","title":"Better speech synthesis through scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07243","snapshot_observed_at":"2026-08-02T18:03:40.305722Z","title":"Better speech synthesis through scaling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.305722Z"},"links":{"cited_paper":"/paper/2305.07243","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:b9ee087d48847bbc35087c042347ea1211ed7b368ad99196998377d2aec552ac","observation_id":"314b1853-2332-4c49-a51b-96a09c774be3","resolution":{"observed_at":"2026-08-02T18:03:40.305722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.02339","last_updated":"2023-04-03T06:33:46Z","snapshot_observed_at":"2026-08-09T09:52:44.049285Z","submitted_at":"2022-12-05T15:15:10Z","title":"DeAR: A Deep-learning-based Audio Re-recording Resilient Watermarking","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.02339","snapshot_observed_at":"2026-08-02T18:03:40.411732Z","title":"Dear: A deep-learning-based audio re-recording resilient watermarking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.411732Z"},"links":{"cited_paper":"/paper/2212.02339","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:3e83dc615bae3be768fa6f8357a0b9ddde8c016b0603c7f69f3a2080c250bd87","observation_id":"f02bc71e-5f27-4749-a6bf-d6e64001e1f5","resolution":{"observed_at":"2026-08-02T18:03:40.411732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:40.546684Z","title":"Techniques for data hiding,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.546684Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:b6d48f879f71eff40b0b4636a483188797c2440bbd7473b6b593f6326a338bf7","observation_id":"52adeee5-bc53-4369-843d-160bf6a487e9","resolution":{"observed_at":"2026-08-02T18:03:40.546684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12770","last_updated":"2024-01-07T07:05:37Z","snapshot_observed_at":"2026-07-06T16:09:59.750388Z","submitted_at":"2023-08-24T13:17:35Z","title":"WavMark: Watermarking for Audio Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12770","snapshot_observed_at":"2026-08-02T18:03:40.666307Z","title":"Wav- mark: Watermarking for audio generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.666307Z"},"links":{"cited_paper":"/paper/2308.12770","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:ea7fc1b790f66073372b67b33589cd5d0995c2cbd0923d4e71ab2365266c9267","observation_id":"107565b5-0ab9-4990-a8eb-433ba4186345","resolution":{"observed_at":"2026-08-02T18:03:40.666307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:40.841554Z","title":"Maskmark: Robust neu- ralwatermarking for real and synthetic speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.841554Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:d94af5da7079ea6e4e129c8262d6b6e7858e980df14a5a8aaa4ba790bb874908","observation_id":"5e7347d4-519b-418d-bf00-40b42663e6df","resolution":{"observed_at":"2026-08-02T18:03:40.841554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:40.955096Z","title":"Silentci- pher: Deep audio watermarking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:40.955096Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:2e6a36ad2c48e071658c054806c3f4049c7bdde53b82e393119fcd2623c5dc17","observation_id":"63796681-a48e-409e-8fc7-bf12106c1482","resolution":{"observed_at":"2026-08-02T18:03:40.955096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.08553","last_updated":"2022-11-15T22:48:16Z","snapshot_observed_at":"2026-08-05T13:46:42.563921Z","submitted_at":"2022-11-15T22:48:16Z","title":"Hybrid Transformers for Music Source Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.08553","snapshot_observed_at":"2026-08-02T18:03:41.035860Z","title":"Hybrid transformers for music source separation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.035860Z"},"links":{"cited_paper":"/paper/2211.08553","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:3c57cc2ba4159e1ccea0f7299d60a7c675f5b8e3503bb7347678e5b05c14cbc7","observation_id":"53bffafb-423c-45c9-89f0-cc72ef788c8a","resolution":{"observed_at":"2026-08-02T18:03:41.035860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.03952","last_updated":"2023-03-15T16:01:40Z","snapshot_observed_at":"2026-08-09T14:53:49.910703Z","submitted_at":"2022-09-08T17:56:35Z","title":"TF-GridNet: Making Time-Frequency Domain Models Great Again for Monaural Speaker Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.03952","snapshot_observed_at":"2026-08-02T18:03:41.137465Z","title":"Tf-gridnet: Making time-frequency domain mod- els great again for monaural speaker separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.137465Z"},"links":{"cited_paper":"/paper/2209.03952","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:fa0e60e082bae6fcc1b5730e5feb9f63b03ea9ef384ebf788d65b33fb03327a3","observation_id":"038509e1-0816-485e-b164-c5f229689d3c","resolution":{"observed_at":"2026-08-02T18:03:41.137465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:41.197167Z","title":"Open-unmix - a reference imple- mentation for music source separation,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.197167Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:d73e4124cc366d29e7a1af28a9c39cb3061fbb63009571c1cbe6bf6cfc258d90","observation_id":"99f3b199-2a20-40ff-98a4-73f67df10bad","resolution":{"observed_at":"2026-08-02T18:03:41.197167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:41.324195Z","title":"Spleeter: a fast and efficient music source separation tool with pre-trained models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.324195Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:25e6d2acd7db1846628b7164d0beb060010ce5c3601888d91fd2f4ef0f0db0ec","observation_id":"abc55813-17bc-4066-b1d8-6a1155c8195d","resolution":{"observed_at":"2026-08-02T18:03:41.324195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.03600","last_updated":"2022-08-30T16:07:25Z","snapshot_observed_at":"2026-08-09T01:10:41.785557Z","submitted_at":"2021-11-05T16:37:45Z","title":"Hybrid Spectrogram and Waveform Source Separation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.03600","snapshot_observed_at":"2026-08-02T18:03:41.434039Z","title":"Hybrid spectrogram and waveform source separa- tion,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.434039Z"},"links":{"cited_paper":"/paper/2111.03600","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:1106e3f357395ecf145d0b2457fda724f561074247058b773adc1ebf3bdf9ecc","observation_id":"6b5856eb-1bcf-4fc9-9aa1-c11c7cf43d11","resolution":{"observed_at":"2026-08-02T18:03:41.434039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-02T18:03:41.525577Z","title":"Con- former: Convolution-augmented transformer for speech recogni- tion,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.525577Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:d9093af09e6ae486673a655d71fe32d02e20e17a9d60f4bd59218702ae7054ec","observation_id":"0c892742-1fd4-400a-bd8a-c6751a917048","resolution":{"observed_at":"2026-08-02T18:03:41.525577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:41.597480Z","title":"Aura: A stegaformer-based scalable deep audio wa- termark with extreme robustness,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.597480Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:1d3d01a0e3f76e3f2ea05d3fd4b029900f5b174a156ba936a008b061a7b35809","observation_id":"574f46d1-3428-4df6-a6c9-888afe8c17e7","resolution":{"observed_at":"2026-08-02T18:03:41.597480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.07871","last_updated":"2017-12-18T21:25:53Z","snapshot_observed_at":"2026-08-09T02:11:05.733726Z","submitted_at":"2017-09-22T17:54:12Z","title":"FiLM: Visual Reasoning with a General Conditioning Layer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.07871","snapshot_observed_at":"2026-08-02T18:03:41.661694Z","title":"Film: Visual reasoning with a general conditioning layer,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.661694Z"},"links":{"cited_paper":"/paper/1709.07871","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:5915c96f454c65d3481a56b2ec270fbb083123a450b69aa41abd3a9601debca7","observation_id":"cc2bc651-a8ab-4625-a234-0c758f4dbbcd","resolution":{"observed_at":"2026-08-02T18:03:41.661694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:41.789963Z","title":"Robust speech watermarking by a jointly trained embedder and detector using a dnn,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.789963Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:ac51299735031a4b343f50cd140f998b445ae7fd97968de17c4a90cabbd736e0","observation_id":"5a2c8fa7-cfe5-493e-a49b-63dfaa1f8206","resolution":{"observed_at":"2026-08-02T18:03:41.789963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:41.974092Z","title":"Wave-u-net: A multi-scale neural network for end-to-end audio source separation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:41.974092Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:8966077bfadb069de96b488a3cd25b7b823980ea9cd41f3ad66bf1f113918e52","observation_id":"2fa367fd-061b-4282-81cd-f68e58ef216d","resolution":{"observed_at":"2026-08-02T18:03:41.974092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:42.085674Z","title":"Bidirectional recurrent neural networks,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.085674Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:3e5f234ebdc45b47fb4ff09a3238299d79599b0db9ae186aea6cb00304a8b3dc","observation_id":"fe3fc82d-380f-4a08-91e2-8636820a9b4e","resolution":{"observed_at":"2026-08-02T18:03:42.085674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:42.166168Z","title":"Musical source separation: An introduction,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.166168Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:4c034b8e40b127d6e54893a1911df74b79683363f1971f6c02185aa9ea058c2d","observation_id":"8e876df4-ebdd-455b-9dcc-c250e554ba5f","resolution":{"observed_at":"2026-08-02T18:03:42.166168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:42.290913Z","title":"Performance mea- surement in blind audio source separation,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.290913Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:cd5caa4394d746004fa1d1121b472e2dfaa19fc21242a314cfa1c25213c52e7e","observation_id":"dcdd2f65-8a93-4e74-85dd-56cbd601492d","resolution":{"observed_at":"2026-08-02T18:03:42.290913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-07-06T05:21:33.309016Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-02T18:03:42.342050Z","title":"Fma: A dataset for music analysis,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.342050Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:59b0c21b52df4b7ef5debc2d9e1a6ba032cb0e3af4a253204ef3aecb3cdbe425","observation_id":"3349f34a-a4ba-4c31-b76e-bfc992d08c79","resolution":{"observed_at":"2026-08-02T18:03:42.342050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05361","last_updated":"2024-09-07T15:08:24Z","snapshot_observed_at":"2026-08-07T13:19:22.496186Z","submitted_at":"2024-07-07T13:24:54Z","title":"Emilia: An Extensive, Multilingual, and Diverse Speech Dataset for Large-Scale Speech Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05361","snapshot_observed_at":"2026-08-02T18:03:42.435007Z","title":"Emilia: An extensive, multilingual, and diverse speech dataset for large-scale speech generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.435007Z"},"links":{"cited_paper":"/paper/2407.05361","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:e1fdc450bc7d1ec5107f6a142f9647b58f135817af29ea3c6f1427603bf8c04d","observation_id":"74e8b097-9b56-4718-84c0-761387fba4d7","resolution":{"observed_at":"2026-08-02T18:03:42.435007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:42.511762Z","title":"The musdb18 corpus for music separation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.511762Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:34e8177aeefb5ff8dbef9435d8ae1b605312f8b56263c7b5db43d0070985fcef","observation_id":"42ca25ff-c58d-4cf9-8c72-b797e366800e","resolution":{"observed_at":"2026-08-02T18:03:42.511762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04658","last_updated":"2023-02-16T18:48:56Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:56:10Z","title":"BigVGAN: A Universal Neural Vocoder with Large-Scale Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04658","snapshot_observed_at":"2026-08-02T18:03:42.596651Z","title":"Bigvgan: A universal neural vocoder with large-scale training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.596651Z"},"links":{"cited_paper":"/paper/2206.04658","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:aa594dd7ebf36b1d2d1eabe8a9ad100a7b0d9f426879fca6b35f1e0da55c726c","observation_id":"226673d6-99e2-4c78-aaa2-02f64a4e0c1d","resolution":{"observed_at":"2026-08-02T18:03:42.596651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T18:03:42.653314Z","title":"Noise-to-mask ratio loss for deep neural network based audio watermarking,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.653314Z"},"links":{"citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:4034a269bb9c612c3a188db29d91e4d0dfc3d5ddfaab0cab1d99db40fc5e89d3","observation_id":"6831850f-cf73-4a3f-ad19-13c231338263","resolution":{"observed_at":"2026-08-02T18:03:42.653314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.09584","last_updated":"2020-04-20T19:19:26Z","snapshot_observed_at":"2026-08-05T04:43:49.261929Z","submitted_at":"2020-04-20T19:19:26Z","title":"ViSQOL v3: An Open Source Production Ready Objective Speech and Audio Metric","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.09584","snapshot_observed_at":"2026-08-02T18:03:42.705090Z","title":"Visqol v3: An open source production ready objec- tive speech and audio metric,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T18:03:42.705090Z"},"links":{"cited_paper":"/paper/2004.09584","citing_paper":"/paper/2603.16805"},"observation_digest":"sha256:943dec52ff733cf5909367bd1d7c88c450015affb7484dba7afa4400991c8670","observation_id":"98b2569b-0c78-4d37-a140-1877a79b48be","resolution":{"observed_at":"2026-08-02T18:03:42.705090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.16805","last_updated":"2026-07-16T07:47:56Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-09T03:29:09.729679Z","submitted_at":"2026-03-17T17:09:45Z","title":"Making Separation-First Multi-Stream Audio Watermarking Feasible via Joint Training"},"reference_resolution":{"displayed":32,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":32},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 32 of 32 outbound references and 1 inbound Pith citation observation for arXiv:2603.16805."}