{"as_of":"2026-08-09T11:19:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9dbacded5e6ba8d7a682431edeff860cbec9d0b7789d5b9eb404217779e9fca9","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:10.917974Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:26:08.307554Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T10:01:29.067292Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02499","snapshot_observed_at":"2026-08-07T11:26:08.307554Z","title":"Typically, this task defines speech, music, and effects as the exclusive target stems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.307554Z"},"links":{"cited_paper":"/paper/2506.02499","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:a8cb1c54c728df5616306d70f95f30ebca5651b82705bb9dadb477bea6635843","observation_id":"4bc3b4e2-93ef-4f46-ba8b-e6b2a40ac92e","resolution":{"observed_at":"2026-08-07T11:26:08.307554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"cited_work":{"arxiv_id":"2506.02499","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.02499","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dnr-nonverbal: Cinematic audio source separation dataset containing non-verbal sounds","venue":null,"work_id":"b97d9fec-a715-4cce-a83a-a2cad3c260c4","year":2025},"citing_paper":{"arxiv_id":"2604.27403","last_updated":"2026-07-08T04:19:16Z","snapshot_observed_at":"2026-08-02T15:09:56.130206Z","submitted_at":"2026-04-30T04:14:58Z","title":"A Knowledge-Driven Approach to Target Speech Extraction in the Presence of Background Sound Effects for Cinematic Audio Source Separation (CASS)","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T08:16:56.671345Z"},"links":{"cited_paper":"/paper/2506.02499","citing_paper":"/paper/2604.27403"},"observation_digest":"sha256:121eae3195b364242fd301165d2824618330bd3f529a93c567ab1a2c49ff94c7","observation_id":"caee2fc7-fefb-4d55-bb43-363e3ab0548b","resolution":{"observed_at":"2026-05-12T10:01:29.070570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.02499/citation-record","integrity":"/paper/2506.02499/integrity","json":"/paper/2506.02499/citation-record.json","paper":"/paper/2506.02499"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02499","snapshot_observed_at":"2026-08-07T11:26:08.307554Z","title":"Typically, this task defines speech, music, and effects as the exclusive target stems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.307554Z"},"links":{"cited_paper":"/paper/2506.02499","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:a8cb1c54c728df5616306d70f95f30ebca5651b82705bb9dadb477bea6635843","observation_id":"4bc3b4e2-93ef-4f46-ba8b-e6b2a40ac92e","resolution":{"observed_at":"2026-08-07T11:26:08.307554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.663524Z","title":null,"venue":null,"work_id":"691b6bef-1b6d-4127-a159-4246e4a2648d","year":null},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.397233Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:23733309a6d8a5969b21446fce929fab26e51f6fdac3948fa65adf0620b463c3","observation_id":"477113ed-8c3a-4570-9f59-53ac54726830","resolution":{"observed_at":"2026-08-07T11:26:13.691594Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.627617Z","title":"Motivation In the actual movie audio, we can decomposex s as follows: xs =x v +x n,(2) wherex v andx n correspond to the waveforms of verbal and non-verbal sounds, respectively","venue":null,"work_id":"6a8d255f-8572-4e3e-a2a2-6a08105c2ec1","year":1968},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.494147Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:a89195935dbc510e51b38cae73f75d2a02e763c750ad0fa8911cb274e352a825","observation_id":"240f02a4-00a8-467e-85ed-205cb400a7a6","resolution":{"observed_at":"2026-08-07T11:26:13.633367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.607983Z","title":"Settings To evaluate the effectiveness of the proposed dataset, we con- ducted CASS experiments","venue":null,"work_id":"c21af749-dbc7-4f18-88ab-af5449524395","year":null},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.559016Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:cd8a3b0b29ad84b3a97f40f6452aeebf984d01735ef4462470fc73101b9d4c60","observation_id":"863e12a4-1327-4f5c-9934-ab957207a5b1","resolution":{"observed_at":"2026-08-07T11:26:13.612512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.590035Z","title":"To address this issue, we built a new dataset containing non-verbal sounds namedDnR- nonverbal","venue":null,"work_id":"4980aadf-f9bb-4333-a20f-c519b5a4dd21","year":null},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.675340Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:d7bcbf92a0a8a4d95623fd74c0f03d989da32e463136ddcff23d68fe625b46a0","observation_id":"3b355aea-c3fd-4d79-9704-b58a086f8e51","resolution":{"observed_at":"2026-08-07T11:26:13.596545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.573387Z","title":"The sound demixing challenge 2023-cinematic demixing track,","venue":null,"work_id":"d9bd7663-7fe3-485b-921c-6414b139c433","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.754633Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:5ca91d08894b371b9a912ba285a60e4d090aac0eec59262fe5e18a3a18bf83d4","observation_id":"5260f1eb-e6ad-44bd-9c9d-4ddd636f6c02","resolution":{"observed_at":"2026-08-07T11:26:13.579211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.555343Z","title":"Supervised speech separation based on deep learning: An overview,","venue":null,"work_id":"dbcaf6ef-06fc-4a41-b188-154636baa7c6","year":2018},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.834619Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:d0080c723387033ca4a4dd4884cae1975bbfb1ccb20a2d9b8f0b8044332c6122","observation_id":"853dc9ba-605b-4674-a8fc-b52f466a530d","resolution":{"observed_at":"2026-08-07T11:26:13.561698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.533663Z","title":"Conv-TasNet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":"9cac7c1c-983c-4a90-861b-cfbe9fbfd804","year":2019},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:08.966726Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:19e64904875f287e32cf81fafc69548552d9a20c5bd1f007d426a6e13de70dc0","observation_id":"a6eadb68-fd61-42e2-9745-bdf983223694","resolution":{"observed_at":"2026-08-07T11:26:13.542876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:09.054261Z","title":"TF-GridNet: Integrating full- and sub-band modeling for speech separation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.054261Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:7d024604d781476be354863fb762789b1282a4b3838775607b05a768dbb2ceca","observation_id":"bbb4d0b9-de4e-40fc-88e8-c020c634f3c7","resolution":{"observed_at":"2026-08-07T11:26:09.054261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.505936Z","title":"The 2018 signal separation eval- uation campaign,","venue":null,"work_id":"a672f192-c546-4137-92ff-3965411bf1ed","year":2018},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.130709Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:fe1e8e336dc4752d51ef870ec9026ad72b196c3e8e50642ee164293678925334","observation_id":"c314b9b3-8fe4-4a57-b994-a22666d5099c","resolution":{"observed_at":"2026-08-07T11:26:13.513919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.484223Z","title":"Open- Unmix - a reference implementation for music source separation,","venue":null,"work_id":"7bf223fe-4508-4452-8876-734359e3b4da","year":2019},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.206282Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:ffafc92d4019ff7a2b75a24bceb80e3c0ad9b0c811a2df6a83e08a9c1282b671","observation_id":"08e9fa2b-41cb-4588-8611-2d27d872c9a3","resolution":{"observed_at":"2026-08-07T11:26:13.492320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.464332Z","title":"Hybrid transformers for music source separation,","venue":null,"work_id":"66d865b5-9cbc-4e36-a327-b8dbf825b5de","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.309694Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:0ab8cf75389de09c80c87e4b46748f66edca3baa201d6b9adb5d7484e886bd64","observation_id":"94ae7cea-4d47-4906-bd38-e3e254de2160","resolution":{"observed_at":"2026-08-07T11:26:13.470963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.443518Z","title":"Universal sound separation,","venue":null,"work_id":"30bb1ec4-6dc6-4124-affe-ecb1e7b81e0e","year":2019},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.391215Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:7f9f923a4114b6fd6d3476f82e6289c3bd7f45ae7f93cb3e879b021a9ab77fbe","observation_id":"452d209e-b91f-4382-aa50-02423d4e3b70","resolution":{"observed_at":"2026-08-07T11:26:13.451787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.424687Z","title":"The cocktail fork problem: Three-stem audio separation for real- world soundtracks,","venue":null,"work_id":"f46acc24-5cbb-45f6-a787-d188ba1cba63","year":2022},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.462321Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:0df944d1fb8e0f9ed877795db8c0af2cf2525ed4cbf2d78a1bafa03a85b2e39b","observation_id":"8841dde0-c76c-43ad-a949-2bfb315154a6","resolution":{"observed_at":"2026-08-07T11:26:13.432325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.405764Z","title":"A general- ized bandsplit neural network for cinematic audio source separa- tion,","venue":null,"work_id":"67523f5b-4c5e-4c4d-a858-fc66fa9ab84d","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.546046Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:3c516a920f7a822fe24e72422b9869ece7f42abecd592277491755a1f849741d","observation_id":"21b927c6-b541-4d7e-a111-79d74a476add","resolution":{"observed_at":"2026-08-07T11:26:13.413048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.384220Z","title":"Music source separation with band-split RNN,","venue":null,"work_id":"6469342c-7291-4a9b-aa7f-2bbe9c3ce647","year":1901},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.655749Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:69361e9c25d2b55d01ae0b17ab469dfec4a18725af9de04896945244180e02e5","observation_id":"b136c3a8-04ec-4a30-ac97-fbd73ea42424","resolution":{"observed_at":"2026-08-07T11:26:13.392521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.365380Z","title":"Lib- riSpeech: an ASR corpus based on public domain audio books,","venue":null,"work_id":"51fd529b-610a-4f63-8fb3-386210d27546","year":2015},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.733574Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:db926393e9471e9e8846d9bf1ed33028d5c47c539c0b2705052c17238a56d6f6","observation_id":"ec275346-37c0-4174-9872-8a9592af11af","resolution":{"observed_at":"2026-08-07T11:26:13.369763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.273355Z","title":"FMA: A dataset for music analysis,","venue":null,"work_id":"6ba68a84-4dcb-401a-8368-960fdc66f0ac","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.819652Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:19f93ba757fd4446bf0a3c756fea655df32babc0db15f442b6800a23cbd3313e","observation_id":"9b6ec578-7f61-4172-9148-91bed59b0c0b","resolution":{"observed_at":"2026-08-07T11:26:13.322807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-02T22:15:33.611696Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-08-07T11:26:09.913604Z","title":"FSD50K: an open dataset of human-labeled sound events","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:09.913604Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:6af201b0abce6b21551ca1f4da8489825325bb8de8cfd1927b9708d0045fc913","observation_id":"67de3525-a519-43b2-88af-a073a98efd70","resolution":{"observed_at":"2026-08-07T11:26:09.913604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:13.074123Z","title":"Remastering di- vide and remaster: A cinematic audio source separation dataset with multilingual support,","venue":null,"work_id":"d21a1dc9-5ede-43d7-95cc-86d66728242a","year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.009245Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:f4f58ad605d7d42b56c30c956d017889c34dcac052abe2cd192a89c670212780","observation_id":"188cfe9e-2344-4090-b6b5-6b75da1901db","resolution":{"observed_at":"2026-08-07T11:26:13.168035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:12.849383Z","title":"Hy- perbolic audio source separation,","venue":null,"work_id":"766561c5-2381-4dca-9b1a-43b110cc4fda","year":2023},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.138699Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:f953907772064f93a8dea7cafc4e9960422953e4c879286b09eedc8c94ca99ce","observation_id":"7fff145e-f462-4997-a7c8-7e4cb70e19e4","resolution":{"observed_at":"2026-08-07T11:26:12.918502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:12.671110Z","title":"PodcastMix: A dataset for separating music and speech in podcasts,","venue":null,"work_id":"0b08f75c-947f-486e-8f0a-531fe46c0a54","year":2022},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.209784Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:09756eab0eaac9ad58df84f5f575d37ff5ee4ba305003949430bb2907f9cc2e8","observation_id":"e4b34b3d-ccec-44a3-a532-c59dc6312802","resolution":{"observed_at":"2026-08-07T11:26:12.830047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11275","last_updated":"2024-04-17T11:31:16Z","snapshot_observed_at":"2026-08-08T06:17:03.893613Z","submitted_at":"2024-04-17T11:31:16Z","title":"Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation","version":1},"cited_work":{"arxiv_id":"2404.11275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.11275","snapshot_observed_at":"2026-08-07T11:26:11.024932Z","title":"Jointly Recognizing Speech and Singing Voices Based on Multi-Task Audio Source Separation","venue":"cs.SD","work_id":"bc6f7c29-0b78-469f-8073-4aa70dff11cd","year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.280208Z"},"links":{"cited_paper":"/paper/2404.11275","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:af2e037bf290f5c4be229a00af9e4abab6216a5a4ac882fff74ee880b3ff3640","observation_id":"bc6ca3bc-edb9-4db9-81d4-183c49c8bdc7","resolution":{"observed_at":"2026-08-07T11:26:11.116952Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:12.325796Z","title":"CSTR VCTK corpus: English multi-speaker corpus for CSTR voice cloning toolkit,","venue":null,"work_id":"91e7409f-2e08-4da4-b5ac-5cb94717ac89","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.372449Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:a1bb825d43494f4fae12ef07fd60ad2b6ce7322a06820cba791eb7279e564217","observation_id":"cfd91ca2-5a4d-4c17-a42d-6061da0cf752","resolution":{"observed_at":"2026-08-07T11:26:12.496001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.935907Z","title":"AISHELL-1: An open-source Mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":"0ce2bfa6-e494-4115-9667-2bca736d09be","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.443563Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:6e505f677d6f8af9a6b0ece91dcabe9302480264d96355446e47c137c9564bf2","observation_id":"ba438656-0a9a-4d98-b8b3-3e3e0131593e","resolution":{"observed_at":"2026-08-07T11:26:12.158601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.568977Z","title":"Audio set: An ontology and human-labeled dataset for audio events,","venue":null,"work_id":"26862de7-84fd-45aa-a7bb-664aabf9d635","year":2017},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.537215Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:5c4a9b1d934c55b8e048b3554f969a0bcc757dbbcd2170b3504bf6de67236926","observation_id":"da66c525-b791-4f70-b319-f46780d29c71","resolution":{"observed_at":"2026-08-07T11:26:11.749914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:26:10.608433Z","title":"GPT-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.608433Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:0b197733c69dfdb59fc3b452bceff0b5d311876f26ac506e0d6f9f9410e50c07","observation_id":"2f38cb89-90c3-4efc-a684-0e9f230f34ef","resolution":{"observed_at":"2026-08-07T11:26:10.608433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.509090Z","title":"Toward a recommendation for a European standard of peak and LKFS loudness levels,","venue":null,"work_id":"9ce86138-d767-4ea1-8d22-cc36c3d306cd","year":2010},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.684202Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:2ba7bd44f4f0e63d68669b7fbcb2e50df2e1d21d1bca3a08eb7afdf0e0291ad6","observation_id":"2b12572a-98b7-40e1-982f-7e4a3623e13e","resolution":{"observed_at":"2026-08-07T11:26:11.515817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:10.770747Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.770747Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:30759cb96cacb7ecdd3a4dd65070c5ea64b086e591f23281394a41bf9fae590b","observation_id":"59bec6dc-e9bc-4d7a-9212-5e66caa09e6b","resolution":{"observed_at":"2026-08-07T11:26:10.770747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.363747Z","title":"Adam: A method for stochastic opti- mization","venue":null,"work_id":"0495a5fc-3d9d-4a1a-88fc-117d7db88f2a","year":2015},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.865536Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:e9021b471639ece1bd4507f6be242204c5216b36793348909c48f49efe36b8ca","observation_id":"b1910e17-cd90-41d9-b1cc-604b71c8a438","resolution":{"observed_at":"2026-08-07T11:26:11.421775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:26:11.243161Z","title":"Why does music source separation benefit from cacophony?","venue":null,"work_id":"51c97b25-cdad-4c43-b07c-ba0a347b0c59","year":2024},"citing_paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:26:10.917974Z"},"links":{"citing_paper":"/paper/2506.02499"},"observation_digest":"sha256:b4c07428d494b4f95daa5eaa52b7e72ad4240027f41285c3749a4c92cf1af5b2","observation_id":"29f827db-996a-4237-a769-64a90c6b7694","resolution":{"observed_at":"2026-08-07T11:26:11.293933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02499","last_updated":"2025-06-09T02:25:27Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T11:20:18.837174Z","submitted_at":"2025-06-03T06:25:53Z","title":"DnR-nonverbal: Cinematic Audio Source Separation Dataset Containing Non-Verbal Sounds"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":1,"verified_fuzzy":24},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 2 inbound Pith citation observations for arXiv:2506.02499."}