{"as_of":"2026-08-09T18:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48bf0d222fccb2a082c3666efa764616e6b83c8d37d28f71d45797307fdb1bbd","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:36:20.739422Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:36:17.487287Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22504","snapshot_observed_at":"2026-08-03T06:36:17.487287Z","title":"Spatial Semantic Segmentation of Sound Scenes (S5) 1,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:17.487287Z"},"links":{"cited_paper":"/paper/2601.22504","citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:7498809d45ba65ee9096404678947f697ad0230f8ab1bf915cd35dbe253e5fb8","observation_id":"df17951e-f422-4499-b041-d7774b497274","resolution":{"observed_at":"2026-08-03T06:36:17.487287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.22504/citation-record","integrity":"/paper/2601.22504/integrity","json":"/paper/2601.22504/citation-record.json","paper":"/paper/2601.22504"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22504","snapshot_observed_at":"2026-08-03T06:36:17.487287Z","title":"Spatial Semantic Segmentation of Sound Scenes (S5) 1,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:17.487287Z"},"links":{"cited_paper":"/paper/2601.22504","citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:7498809d45ba65ee9096404678947f697ad0230f8ab1bf915cd35dbe253e5fb8","observation_id":"df17951e-f422-4499-b041-d7774b497274","resolution":{"observed_at":"2026-08-03T06:36:17.487287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:17.550821Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:17.550821Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:29410d1d861b809451c21bdedec289e10763affa5dd7dad46360afefdad47ef3","observation_id":"65b18697-f10a-4607-ae06-dbccec36f949","resolution":{"observed_at":"2026-08-03T06:36:17.550821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:17.664736Z","title":"Audio tagging model Figure 3 illustrates the modified M2D AT architecture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:17.664736Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:00b3e8704747a77461435f774b7087bf15980e8c79c630d2dde595831e899501","observation_id":"4c2f6663-d5fb-4234-b9c3-161b8a3704ea","resolution":{"observed_at":"2026-08-03T06:36:17.664736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:17.884405Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:17.884405Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:288f9b93c88fa92af7393b9c2ca310912b72d2c671c4387672d9448df41d8d24","observation_id":"7cca14be-a78e-43da-bdbc-82d7d28ab25a","resolution":{"observed_at":"2026-08-03T06:36:17.884405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:17.769959Z","title":"The order of input labels is also used to align the estimated and reference sources to calculate the SDR loss function","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:17.769959Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:553e9602bfd359c396c2b2f221af3aa2cf1382770f219230867cafbec81aa8e5","observation_id":"38046b06-c0b4-4a43-865a-448f1ce6c98e","resolution":{"observed_at":"2026-08-03T06:36:17.769959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:17.993759Z","title":"We also propose an evaluation metric to address the confusion caused by duplicated labels","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:17.993759Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:da8ee288fe5a14ed6af2fc3a02b677b67026a5f4b86a5863faeb23b9806e1fc8","observation_id":"b39f801c-a3f1-42b3-9168-194a263df96e","resolution":{"observed_at":"2026-08-03T06:36:17.993759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.134729Z","title":"Immersive voice and audio services (IV AS) codec-the new 3GPP standard for immersive communication,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.134729Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:940a5c2062c4b0b2446f624749a73ed50b4f4895e30a2e626a594906eb065c34","observation_id":"70fcb112-d350-4735-a88b-fb96e8e3f3c1","resolution":{"observed_at":"2026-08-03T06:36:18.134729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.248977Z","title":"Metadata-assisted spatial audio coding in IV AS codec,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.248977Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:cf25f266b276e2128624f2d2f904930810cc83d585311764830d27cd95f40952","observation_id":"4a1ea614-8ca6-4ccd-bff5-6581c8ad4a13","resolution":{"observed_at":"2026-08-03T06:36:18.248977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.372348Z","title":"3GPP IV AS codec–perspectives on development, testing and standardiza- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.372348Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:6db6e10cbd544526e5392c2ce93c59541544bfc0470bda256d2475273311a6b2","observation_id":"b1c2e27f-175e-413e-ad07-280f89522e1c","resolution":{"observed_at":"2026-08-03T06:36:18.372348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.474971Z","title":"De- scription and discussion on DCASE 2025 challenge task 4: Spatial semantic segmentation of sound scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.474971Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:e3ea3f507d79b4a6eac5ec5c9c5de386674ecbe4bd0b5691a9d963e5427f502c","observation_id":"9eebb139-8628-4781-bb7d-968c0db505bf","resolution":{"observed_at":"2026-08-03T06:36:18.474971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.590809Z","title":"Baseline systems and evaluation metrics for spatial semantic segmentation of sound scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.590809Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:386de6825a944a00a8a6f9a2688c4af4f83aac032af1a27eef80404ff71c9672","observation_id":"b7fedba4-7ca3-4b1a-a82f-33afe246e73d","resolution":{"observed_at":"2026-08-03T06:36:18.590809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.702728Z","title":"Transformer-aided audio source separation with temporal guidance and iterative refine- ment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.702728Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:9b1193df117345dede0e880dc4c7c14eeaf8c8bef99769b639360a3df40c72bc","observation_id":"16e735ce-66e2-4034-8922-45df4c29427f","resolution":{"observed_at":"2026-08-03T06:36:18.702728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.880711Z","title":"TS-TFGRIDNET: Extend- ing tfgridnet for label-queried target sound extraction via em- bedding concatentaiton,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.880711Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:84586e098c4efe72774833107848316da005fd05f36ebbd8ca3c3bb69c1d44f2","observation_id":"d73198d3-15e2-4437-a855-5935ef0ca366","resolution":{"observed_at":"2026-08-03T06:36:18.880711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:18.983090Z","title":"Self-guided target sound extraction and classifi- cation through universal sound separation model and multiple clues,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:18.983090Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:289ae6da9e23eaa1d9a6dd2ae41800f92582b9f9cd1f3a5e9e6db7bed0e3ef96","observation_id":"e444fa05-21fc-4e3e-b038-34da565f1760","resolution":{"observed_at":"2026-08-03T06:36:18.983090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.098403Z","title":"Performance improvement of spatial semantic segmentation with enriched audio features and agent-based error correction for DCASE 2025 Challenge Task 4,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.098403Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:a96eca93d8cea4974d645718a9087edafe177a88873fb52509608801aaf8018d","observation_id":"a6d564e4-2b65-4a51-9f9f-06530cec6192","resolution":{"observed_at":"2026-08-03T06:36:19.098403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.245518Z","title":"REDUX: An iterative strategy for semantic source separation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.245518Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:5c3d58c95dbc334c3c4ecf8e8d0522376526c995baeee9697a08a3aef345c43f","observation_id":"6dd41bcd-db68-4c09-b3d3-e743f947eb89","resolution":{"observed_at":"2026-08-03T06:36:19.245518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.364114Z","title":"SJTU-AUDIOCC system for DCASE 2025 Challenge Task 4: Spatial semantic segmentation of sound scenes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.364114Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:7bc772557127cae285f041635165b29895a04189a6450332140b9e6ce2f03308","observation_id":"8619264d-b833-4c9d-b75c-8cb548be150a","resolution":{"observed_at":"2026-08-03T06:36:19.364114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.473441Z","title":"A hybrid S5 system based on neural blind source separation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.473441Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:5c7c710d2741c58c1ca8096cc08bef48a4197cacfe0a6fd0c9a7cc2bede12676","observation_id":"4bc805f5-f82a-441c-9040-8ed6c3dc7bad","resolution":{"observed_at":"2026-08-03T06:36:19.473441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.585308Z","title":"Permutation invariant training of deep models for speaker- independent multi-talker speech separation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.585308Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:cc6bd29db2cf39f69fec57870186df3acd21e55d6960c0b377145c10cb2eef83","observation_id":"8ffe3599-aa96-4857-b891-baffa8136112","resolution":{"observed_at":"2026-08-03T06:36:19.585308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.701734Z","title":"An improved event- independent network for polyphonic sound event localization and detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.701734Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:6774170634d4b71079845aad4ced382fe1ea0024fa92d6be17529a9160d2d1cc","observation_id":"99c8fcb4-894b-4ea9-ba6c-b58640434f0b","resolution":{"observed_at":"2026-08-03T06:36:19.701734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.807464Z","title":"Zero-and few-shot sound event localization and detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.807464Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:72f9e5e1200ea0a3e8ea5240fe8b4cc7ab656d5ecac565c0c7c04e0262e5ddde","observation_id":"aaf2b0e6-0bd9-4906-a07f-e41aa50b4b39","resolution":{"observed_at":"2026-08-03T06:36:19.807464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:19.922593Z","title":"Cross-attention inspired selective state space models for tar- get sound extraction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:19.922593Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:02d9932eb3ed4790779cd293eaea492a59c9c852fcd2172381809cd99acb9a12","observation_id":"1ffdbdc7-66cb-4958-85a0-4d2e491fd173","resolution":{"observed_at":"2026-08-03T06:36:19.922593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:20.027080Z","title":"Real-time tar- get sound extraction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:20.027080Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:8b008e902ef6d146190e82bddd78122f56a1586d2ee3bf1b56e583b94b8362f5","observation_id":"8d5ecf20-02aa-4235-851d-9524e696a0ee","resolution":{"observed_at":"2026-08-03T06:36:20.027080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:20.136821Z","title":"Soundbeam meets M2D: Target sound extrac- tion with audio foundation model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:20.136821Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:6d01da0ba317be291d791b8c674175f24212ef77b8feec14b51f7bc97232675c","observation_id":"b8757b51-e071-44ae-a35d-84c4cbfaf12e","resolution":{"observed_at":"2026-08-03T06:36:20.136821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07447","last_updated":"2023-05-11T16:41:55Z","snapshot_observed_at":"2026-08-03T04:37:00.279223Z","submitted_at":"2023-05-11T16:41:55Z","title":"Universal Source Separation with Weakly Labelled Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07447","snapshot_observed_at":"2026-08-03T06:36:20.258010Z","title":"Universal source separation with weakly labelled data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:20.258010Z"},"links":{"cited_paper":"/paper/2305.07447","citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:39245f387fe91a3f8c587b61b7f6d232fe59ae59f7a95a0d15ca82d1a3584cf4","observation_id":"590e13b6-74f1-417f-9b70-0e66f52297ec","resolution":{"observed_at":"2026-08-03T06:36:20.258010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:20.378620Z","title":"Masked modeling duo: Towards a universal audio pre-training framework,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:20.378620Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:138fe00deb756c5a07eead0af2d81e3ed32365d22a75f7961383fd9362a9e548","observation_id":"19104afa-571e-43d3-838d-987dea9cf1a0","resolution":{"observed_at":"2026-08-03T06:36:20.378620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:20.483496Z","title":"Spatial scaper: a library to simulate and augment soundscapes for sound event localiza- tion and detection in realistic rooms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:20.483496Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:e321ffb7f2ec734f461b1400e076fb232c7699d2f4965f98ef29548017fc1374","observation_id":"891b0184-3843-4204-820c-950a97eecebb","resolution":{"observed_at":"2026-08-03T06:36:20.483496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:20.620920Z","title":"Semantic hearing: Programming acoustic scenes with binaural hearables,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:20.620920Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:3974e2312c397b25d9d2f56a6e79175ba216cd4d9c4ae81b77375efab22f0b38","observation_id":"1981802e-c176-4a14-89e5-51a8af57a1ea","resolution":{"observed_at":"2026-08-03T06:36:20.620920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:36:20.739422Z","title":"Echo-aware adaptation of sound event localization and de- tection in unknown environments,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T06:36:20.739422Z"},"links":{"citing_paper":"/paper/2601.22504"},"observation_digest":"sha256:a7c04814010e7d3665f75f94ad9b3ded3c92914905eedfb6a1ecc97354106c38","observation_id":"33f01359-b034-44b3-bcdc-a1c9150edb49","resolution":{"observed_at":"2026-08-03T06:36:20.739422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22504","last_updated":"2026-01-30T03:31:20Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-03T06:36:16.318203Z","submitted_at":"2026-01-30T03:31:20Z","title":"Class-Aware Permutation-Invariant Signal-to-Distortion Ratio for Semantic Segmentation of Sound Scene with Same-Class Sources"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2601.22504."}