{"as_of":"2026-08-17T20:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e6ee07a97f508952c228cede519a4ad4fc9d478ee1f24200948caf2a37881dbd","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:54:58.313374Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:54:55.658293Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10391","snapshot_observed_at":"2026-08-04T17:54:55.658293Z","title":"Supervised methods such as RDrop [22] and cosub [23] have demonstrated the advantage of CR by encouraging agreement between model predictions on different augmentations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.658293Z"},"links":{"cited_paper":"/paper/2509.10391","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:60243e4d9d65eccf6014eab6d028a77241bebfb9407a18f7248e553653c42057","observation_id":"41cbc572-9de4-4bf3-9aa5-b599c347ad15","resolution":{"observed_at":"2026-08-04T17:54:55.658293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.10391/citation-record","integrity":"/paper/2509.10391/integrity","json":"/paper/2509.10391/citation-record.json","paper":"/paper/2509.10391"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.572272Z","title":"Many se- tups, including supervised and self-supervised audio representation learning, have shown significant results on AER datasets","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.572272Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:03e2bab8758686803f68afed15c0b72c78e65528cc00c27a8709c6804aaeba68","observation_id":"5fab59f5-cb00-403f-8630-707cb6cc7490","resolution":{"observed_at":"2026-08-04T17:54:55.572272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.10391","snapshot_observed_at":"2026-08-04T17:54:55.658293Z","title":"Supervised methods such as RDrop [22] and cosub [23] have demonstrated the advantage of CR by encouraging agreement between model predictions on different augmentations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.658293Z"},"links":{"cited_paper":"/paper/2509.10391","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:60243e4d9d65eccf6014eab6d028a77241bebfb9407a18f7248e553653c42057","observation_id":"41cbc572-9de4-4bf3-9aa5-b599c347ad15","resolution":{"observed_at":"2026-08-04T17:54:55.658293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.731836Z","title":"pseudo-label","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.731836Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:aae6c2ee186a36799dbed0004e569a1d7d9accf6e832f0dca1fc5e9942169ba8","observation_id":"df7df6db-3906-4f02-bdfb-7828e8505070","resolution":{"observed_at":"2026-08-04T17:54:55.731836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.799201Z","title":"Experimental Setup AudioSet:AudioSet [33] is a multi-label audio dataset with 2 mil- lion audio clips of length 10 seconds, totalling to 5,800 hours","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.799201Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:7bb6de66674561a5d3e9a4c2bda8d14047e2fb41b7e8e7f2fb8680a119593769","observation_id":"9cb17ecf-091a-4572-ab33-a769680aab6e","resolution":{"observed_at":"2026-08-04T17:54:55.799201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.873977Z","title":"Additionally, we apply consistency regularization to a semi-supervised setting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.873977Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:ab08c6ce32e9080654d35cd0ee2030419ae2d3912dae81fc550e216debad6ea2","observation_id":"775da48e-e088-4064-9bfa-c7e0e679a1b9","resolution":{"observed_at":"2026-08-04T17:54:55.873977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:55.913886Z","title":"Cr-ctc: Consistency regularization on ctc for improved speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.913886Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:7fdffb6d0470b7657a56f9d37db364c286564a9c0dbe0b73bf9ab757d0a709cf","observation_id":"7c13b5ea-4cf9-45d2-b0b2-ff7a588d3a70","resolution":{"observed_at":"2026-08-04T17:54:55.913886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08907","last_updated":"2025-04-25T15:21:54Z","snapshot_observed_at":"2026-08-16T12:41:55.501850Z","submitted_at":"2025-04-11T18:19:59Z","title":"Spatial Audio Processing with Large Language Model on Wearable Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08907","snapshot_observed_at":"2026-08-04T17:54:55.978834Z","title":"Spatial audio processing with large language model on wear- able devices,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:55.978834Z"},"links":{"cited_paper":"/paper/2504.08907","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:429573a1f21963486a146e3a81033f76723dbea2777506a2480b4e16d3458955","observation_id":"8c72077b-f085-4b3e-aeac-18747d273cfe","resolution":{"observed_at":"2026-08-04T17:54:55.978834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.038170Z","title":"Audio-based event recognition system for smart homes,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.038170Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:b68f1e5284060b2208f02ee980f2173ad4ca6bec1929a782dad77e42bc39e0e7","observation_id":"84465527-f406-42cc-8385-921fe031e341","resolution":{"observed_at":"2026-08-04T17:54:56.038170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.127391Z","title":"homesound: Real-time audio event detection based on high performance computing for behaviour and surveillance remote monitoring,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.127391Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:adcff9d0568e4c8c04a853ba73eff6ba5c30b3693a7a39d36f24719eb064e83a","observation_id":"5d9b7153-dbed-428f-86fe-3a59e9d21402","resolution":{"observed_at":"2026-08-04T17:54:56.127391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.202835Z","title":"Audio-assisted smart home security monitor- ing with few samples,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.202835Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:a97b8be04cc79a563186bc235a15b65c994fe980eef2f8ac7cb3f460b5debf1c","observation_id":"61af8ba0-259c-4757-8bcf-c416105a1793","resolution":{"observed_at":"2026-08-04T17:54:56.202835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.237233Z","title":"Smart home security through real-time audio event detection systems using convo- lutional neural network (cnn),","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.237233Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:0104e7fb01d73fc672607e3ef4f4592d3189307d8237f983ee475be1b12680dc","observation_id":"dd575010-e277-4372-a837-9c637068adf0","resolution":{"observed_at":"2026-08-04T17:54:56.237233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.300609Z","title":"Real-time sound event classification for human activity of daily living using deep neural network,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.300609Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:45c1fe23923a9d79670513d9d393faadc38d9360be082dbeae7267af96875afc","observation_id":"f8932d10-baf1-4465-82ba-1cda6eb16532","resolution":{"observed_at":"2026-08-04T17:54:56.300609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.379270Z","title":"Occupant behavior monitoring and emergency event detection in single-person households using deep learning-based sound recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.379270Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:2049331c208a78fbb30df409199ed53a159280ffd2bf672415e75dddf1ebc2d2","observation_id":"64ebe1bb-7f89-4ea6-8cd6-657ab172bf9e","resolution":{"observed_at":"2026-08-04T17:54:56.379270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.520887Z","title":"Cnn architectures for large-scale audio clas- sification,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.520887Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:e0fc8c9e85e8fc625a9ed939568979c985e0cbbb519d2bc89cf3e03bc1450b94","observation_id":"1378a346-3243-4f3d-a2b7-04a48250434e","resolution":{"observed_at":"2026-08-04T17:54:56.520887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.595990Z","title":"Panns: Large-scale pretrained audio neural net- works for audio pattern recognition,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.595990Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:d6d36cbec535e6720e85b13982bc43537c8aa9ec631894059302a23b39a23719","observation_id":"41102d5d-64fa-41cf-a591-8a6fc4740735","resolution":{"observed_at":"2026-08-04T17:54:56.595990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.634845Z","title":"Contrastive audio-visual masked autoencoder,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.634845Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:863802a194c9d1ced6927d1c3a15a932c2bb29836fb69a69358c841753d42240","observation_id":"79b91458-5449-44f5-b5c9-3ccc0a77a1e2","resolution":{"observed_at":"2026-08-04T17:54:56.634845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.706804Z","title":"Masked autoencoders that listen,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.706804Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:8b680b1f0fd9108680c3dad273d450eb844a8260d8cc1ab1732765ce532cf28c","observation_id":"b29ba5f3-9719-4979-8d5c-7c683345e8d0","resolution":{"observed_at":"2026-08-04T17:54:56.706804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.779425Z","title":"Clap learning audio concepts from natural language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.779425Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:44782681c3694494a5fc23083c8e2060290c0f671c6330bcb852ec8b7751bccb","observation_id":"1685133c-6c83-4731-bd50-adfb2e3439a5","resolution":{"observed_at":"2026-08-04T17:54:56.779425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:56.945663Z","title":"Ast: audio spectrogram transformer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.945663Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:dd72191357d6cb7bd3e2df2c698ee288b681bcb55edf3f67c7ef095ead07f1ea","observation_id":"746e463a-996a-4d3f-92df-312166d3562e","resolution":{"observed_at":"2026-08-04T17:54:56.945663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09502","last_updated":"2024-06-20T06:23:16Z","snapshot_observed_at":"2026-08-16T14:09:46.484218Z","submitted_at":"2024-03-14T15:44:19Z","title":"EquiAV: Leveraging Equivariance for Audio-Visual Contrastive Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09502","snapshot_observed_at":"2026-08-04T17:54:56.999046Z","title":"Equiav: Leveraging equivariance for audio-visual contrastive learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:56.999046Z"},"links":{"cited_paper":"/paper/2403.09502","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:58bd5f72a8a2792fb9126d0ea3f49d2c1782025b0826fc62347831c3b15c9558","observation_id":"a0c86cee-3235-40d1-a4f9-d7d346f5ebc2","resolution":{"observed_at":"2026-08-04T17:54:56.999046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10790","last_updated":"2024-02-19T23:51:49Z","snapshot_observed_at":"2026-08-16T15:32:05.728576Z","submitted_at":"2023-05-18T08:03:37Z","title":"Listen, Think, and Understand","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10790","snapshot_observed_at":"2026-08-04T17:54:57.049705Z","title":"Lis- ten, think, and understand,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.049705Z"},"links":{"cited_paper":"/paper/2305.10790","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:b9393e9a3f99d1bbd49e6be95b45cbff235cd441247c0167ff5457e3eddf7ef7","observation_id":"bac6bdd2-ca36-427f-a2f2-b3064ac08d97","resolution":{"observed_at":"2026-08-04T17:54:57.049705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-16T16:37:20.878280Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-04T17:54:57.124210Z","title":"Gama: A large audio-language model with ad- vanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.124210Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:6cb8325ef4a524fca5959ad95ff09577296f8df08fc006c1fd31e299cfcca0fa","observation_id":"aaef49ed-b065-46dc-bb5a-1772b68ba670","resolution":{"observed_at":"2026-08-04T17:54:57.124210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.197440Z","title":"A simple framework for contrastive learning of visual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.197440Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:2295afa56d67816f9a8d5f504d2db2899964429b7d1027fca8bc275b10591434","observation_id":"15ae1774-7b0f-4977-9df4-8ac50f2cc36c","resolution":{"observed_at":"2026-08-04T17:54:57.197440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.234879Z","title":"Bootstrap your own latent-a new approach to self-supervised learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.234879Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:8e87a599955a7ed056f31e4bb3e8f8f5ef56967e6709c1d8c830bda823378a3d","observation_id":"e34d7145-6e28-455f-8c31-199fcb2ffb43","resolution":{"observed_at":"2026-08-04T17:54:57.234879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.303026Z","title":"Momentum contrast for unsupervised visual repre- sentation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.303026Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:cfb6253969b25feaec068c850ba21b3f3fc4c5e49f662f466153bbc4373db971","observation_id":"b36e53a4-e120-4453-bf76-8e56fb5c5cd3","resolution":{"observed_at":"2026-08-04T17:54:57.303026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.376908Z","title":"Exploring simple siamese rep- resentation learning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.376908Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:3ac5daf66aad236ded010258440e889ad03f081fea799cbbf31080534104e7df","observation_id":"b82042f3-51f5-431d-9aa3-ded83a0f0004","resolution":{"observed_at":"2026-08-04T17:54:57.376908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.395393Z","title":"R-drop: Regularized dropout for neural networks,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.395393Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:bb3bc4db2573bf23afbe4b4469530193032ad3aa7093d7f86a5d8bd65e40f60f","observation_id":"1c1bfa2c-31ff-476b-8b82-2abaddfa1008","resolution":{"observed_at":"2026-08-04T17:54:57.395393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.452260Z","title":"Co-training 2l submodels for visual recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.452260Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:5f2bcd43a89124a208ea34865c65b3e034239128c340334784c0869113770ff1","observation_id":"a8e1e356-eed7-4b77-9273-4974853e7509","resolution":{"observed_at":"2026-08-04T17:54:57.452260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.490188Z","title":"Deep convolutional neural net- works and data augmentation for environmental sound classi- fication,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.490188Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:c5da3407ef1ef94959fd54cb9c5af70c08d8339e67614bcf4600e3ffd8b7e2f0","observation_id":"5eed9c7e-bce0-4f0b-a2b9-c5c5ae3783f2","resolution":{"observed_at":"2026-08-04T17:54:57.490188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.567030Z","title":"Random erasing data augmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.567030Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:7721c7d04d33351cfd93bf9ac4ea7ba3aa764b20f618c7702e2878473eb7440f","observation_id":"66daf5af-67e0-466f-9886-2e2b8fdd52fe","resolution":{"observed_at":"2026-08-04T17:54:57.567030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.637876Z","title":"V ocal tract length perturbation (vtlp) improves speech recognition,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.637876Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:9e61dd43e1ed15ec2948588c4c959702ecea2c4596c840be3d6d075aaeb0fc4a","observation_id":"1c0c0a2b-2802-4aab-8af6-6b57bcd4d1b9","resolution":{"observed_at":"2026-08-04T17:54:57.637876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.707699Z","title":"Audio aug- mentation for speech recognition,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.707699Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:042fbccd918f5822cb8e1f6df592149e04aa7d9da19e0046c7801c7d4360bf3c","observation_id":"36559119-e772-4285-a058-2c22718db8ce","resolution":{"observed_at":"2026-08-04T17:54:57.707699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.09412","last_updated":"2018-04-27T21:39:25Z","snapshot_observed_at":"2026-08-08T10:28:19.597631Z","submitted_at":"2017-10-25T18:30:49Z","title":"mixup: Beyond Empirical Risk Minimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.09412","snapshot_observed_at":"2026-08-04T17:54:57.774269Z","title":"mixup: Beyond empirical risk minimization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.774269Z"},"links":{"cited_paper":"/paper/1710.09412","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:bd4b6f3808a95048adac5116d7fef47a52fbdc299dfd453b112bf13ca35e71b0","observation_id":"d452d497-5849-48dd-acb7-15891240bf6e","resolution":{"observed_at":"2026-08-04T17:54:57.774269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-04T17:54:57.852370Z","title":"Bert: Pre- training of deep bidirectional transformers for language under- standing,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.852370Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:482450b3b0911075a97869c67e6116a5c69a866fb0d09b618be91025a06fbeec","observation_id":"10c7888f-8269-40c4-bc91-54f388d1bc81","resolution":{"observed_at":"2026-08-04T17:54:57.852370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.894992Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.894992Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:44e41b78bb4d5be3d6b6690139dcb529f987f22a92981e79e1714a8757e691a8","observation_id":"ed96774f-5476-4466-be92-594222c1916c","resolution":{"observed_at":"2026-08-04T17:54:57.894992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:57.990296Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.990296Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:5905abe2774c2edb9863267c58c060d2e5e9c61d9fa6fcad9b0fb8cd760f2eac","observation_id":"16ca6a12-9148-4908-93e8-76e934bee121","resolution":{"observed_at":"2026-08-04T17:54:57.990296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.039016Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.039016Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:30465b8b4c4f8d3df4667ed3c287271dd2e4cdbf1978c6ea2c1126d0bfae3b78","observation_id":"96e63ba2-f83e-4b94-829d-12f1f14f5314","resolution":{"observed_at":"2026-08-04T17:54:58.039016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.087215Z","title":"Audio set: An ontology and human- labeled dataset for audio events,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.087215Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:d138edf8a6097089dd3dda14200dc312bf3a9c362703f9c00b6cf03150f1ec96","observation_id":"962a4e47-9ec5-4509-97bc-1f7571441f72","resolution":{"observed_at":"2026-08-04T17:54:58.087215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.199273Z","title":"Ss- lam: Enhancing self-supervised models with audio mixtures for polyphonic soundscapes,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.199273Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:4b5316b100199510eb8751be447085443be9770aeb6a463cc97682a294186530","observation_id":"a0caf519-07e0-4992-901a-91802b48bf1d","resolution":{"observed_at":"2026-08-04T17:54:58.199273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:54:58.255522Z","title":"Salmonn: Towards generic hearing abilities for large language models.,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.255522Z"},"links":{"citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:91834e46a8f62837e52d4a0924db3439ec73d039637957f150ffcc116f4b00a3","observation_id":"1c86ccf6-0e39-439b-b93f-a9feb8e60acb","resolution":{"observed_at":"2026-08-04T17:54:58.255522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-04T17:54:58.313374Z","title":"Qwen- audio: Advancing universal audio understanding via uni- fied large-scale audiolanguage models.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:58.313374Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:ee0c230be42785ff9dac86f0b29d38a878e5c69a5a2bfedfca6462e9ecc2e9b3","observation_id":"208ad9f5-e36e-4155-b04d-dc81513863e4","resolution":{"observed_at":"2026-08-04T17:54:58.313374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-15T03:47:35.529855Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2509.10391."}