{"as_of":"2026-08-17T15:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e57c754e6a0d5ad981b409c99af5fc7159a0422dc8a96557e4f646db9b1a5b4","coverage":[{"denominator":204,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:54:55.095895Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T06:40:47.064894Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10924","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"ASAudio: A survey of advanced spatial audio research.arXiv preprint arXiv:2508.10924, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-16T10:05:58.256899Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2508.10924","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:3a5a1304cd1aa2bb13bd2b03486569b43b54dad29c920fe9eef8ad7999a760d8","observation_id":"2365060b-cabb-408f-9874-a1a9419f67b2","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.10924/citation-record","integrity":"/paper/2508.10924/integrity","json":"/paper/2508.10924/citation-record.json","paper":"/paper/2508.10924"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.793353Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.793353Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:dffaee05c9198cba8a32a863b7484b18b3932b9255526733fe06e5c53d0203ea","observation_id":"731e284f-3816-4fd8-aec3-d61535dab873","resolution":{"observed_at":"2026-08-05T22:54:54.793353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T22:54:54.797641Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.797641Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:cf3cadf30a93bd709c0ea970ec284a89b58d2aeb8bb87c984d00ef3833f3e1dd","observation_id":"c37d59a3-4f3f-43bc-8a83-6713e485f981","resolution":{"observed_at":"2026-08-05T22:54:54.797641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.801238Z","title":"Sound event localization and detection of overlapping sources using convolutional recurrent neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.801238Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:14eb5b9433ee0fb5a40e1aef20ac3edabf8f0a5fe8339a206e11e6bb4f264449","observation_id":"340eb3e8-23f2-45ea-95f7-dbde9726aafe","resolution":{"observed_at":"2026-08-05T22:54:54.801238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.804358Z","title":"Direction of arrival estimation for multiple sound sources using convolutional recurrent neural network","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.804358Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4d36bac64d18af5ccbbd90282fcaf0c22cc7861e0815bf87c75897edabd55ab2","observation_id":"8ea59419-5f37-43cb-980f-709993c18bfb","resolution":{"observed_at":"2026-08-05T22:54:54.804358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1212.6080","last_updated":"2012-12-25T19:58:02Z","snapshot_observed_at":"2026-08-17T14:18:04.727825Z","submitted_at":"2012-12-25T19:58:02Z","title":"Beamforming Techniques for Multichannel audio Signal Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1212.6080","snapshot_observed_at":"2026-08-05T22:54:54.807832Z","title":"Beamforming techniques for multichannel audio signal separation","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.807832Z"},"links":{"cited_paper":"/paper/1212.6080","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:01fed4b65301a4b3f1e4d032eb0a8bc6bbc2bbd03bd9b4b9c9477dfc6a1f5dab","observation_id":"a75fd770-d9fc-46bd-862c-d4348b0cc616","resolution":{"observed_at":"2026-08-05T22:54:54.807832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04121","last_updated":"2018-06-19T17:51:32Z","snapshot_observed_at":"2026-08-17T07:06:00.355847Z","submitted_at":"2018-04-11T17:57:28Z","title":"The Conversation: Deep Audio-Visual Speech Enhancement","version":2},"cited_work":{"arxiv_id":"1804.04121","doi":null,"metadata_source":"pith","pith_arxiv_id":"1804.04121","snapshot_observed_at":"2026-08-05T22:54:56.220834Z","title":"The Conversation: Deep Audio-Visual Speech Enhancement","venue":"cs.CV","work_id":"7c8d94c5-21eb-4190-97b0-2883c290ae07","year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.811265Z"},"links":{"cited_paper":"/paper/1804.04121","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f1d90cc8efe6e7c1dcbedaa2a0f48cf8495b96c7fe549907b963ae302cca9fe3","observation_id":"16eb41df-4e87-45c0-9236-50e632c31bd7","resolution":{"observed_at":"2026-08-05T22:54:56.224414Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15130","last_updated":"2024-08-16T01:35:52Z","snapshot_observed_at":"2026-08-16T14:49:39.169304Z","submitted_at":"2023-10-23T17:34:31Z","title":"Novel-View Acoustic Synthesis from 3D Reconstructed Rooms","version":2},"cited_work":{"arxiv_id":"2310.15130","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.15130","snapshot_observed_at":"2026-08-05T22:54:56.207162Z","title":"Novel-View Acoustic Synthesis from 3D Reconstructed Rooms","venue":"cs.SD","work_id":"a42a39a3-0f02-4fcc-8955-78b86ae499f5","year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.816024Z"},"links":{"cited_paper":"/paper/2310.15130","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:c0441f94e851a1fac5f86cdd2eaa51fd7f0d84962b719189e838d34d74510b62","observation_id":"6e9c2040-c385-4bde-a991-e75956c30cc7","resolution":{"observed_at":"2026-08-05T22:54:56.210521Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.819470Z","title":"L., and Rafaely, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.819470Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:df68fb28933b576afe7156524d4f1e4af4a27c6e1b91c2ecf0f5c4cf41fafed7","observation_id":"503590a4-a52d-4fc6-86ad-1833692ec56f","resolution":{"observed_at":"2026-08-05T22:54:54.819470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11805","last_updated":"2020-10-22T15:37:39Z","snapshot_observed_at":"2026-08-16T19:11:26.076602Z","submitted_at":"2020-10-22T15:37:39Z","title":"Urban Sound Classification : striving towards a fair comparison","version":1},"cited_work":{"arxiv_id":"2010.11805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.11805","snapshot_observed_at":"2026-08-05T22:54:56.193703Z","title":"Urban Sound Classification : striving towards a fair comparison","venue":"cs.SD","work_id":"7574efd2-8332-431b-83b1-704e88c78352","year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.822214Z"},"links":{"cited_paper":"/paper/2010.11805","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a93e129b8d0a31be0175d1a108d8acdd7f41e0805f4d5e29affde8f36a6270f9","observation_id":"f672948b-8f99-4fff-b394-32060d677d80","resolution":{"observed_at":"2026-08-05T22:54:56.197240Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.825704Z","title":"and Schechner, Y","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.825704Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:424d8dd30813d2deb8619d33d56f25ea9865cb98220d4280369d6be00b288017","observation_id":"fba30600-b84c-4b00-8e4e-b12569fd4524","resolution":{"observed_at":"2026-08-05T22:54:54.825704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.828469Z","title":"A french corpus for distant-microphone speech processing in real homes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.828469Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:508e3a7dcd740d304125e998b2b0c4bddb8a8f36071e0348bafffc17b765d226","observation_id":"74168355-3ee3-4ce2-99f0-14c552ebefa5","resolution":{"observed_at":"2026-08-05T22:54:54.828469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.831316Z","title":"J., Gannot, S., and Gerstoft, P","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.831316Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:7115c05e416d764e6e26f1017a948d7b59ecbb911d7f71992a5589cf5c0c1a5d","observation_id":"9cecdb60-f301-4a76-b848-e812dd51458d","resolution":{"observed_at":"2026-08-05T22:54:54.831316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.834203Z","title":"J., Gannot, S., Fernandez-Grande, E., and Gerstoft, P","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.834203Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:adcb1fc53910bceef6c3c683f72b94b54ceb622070ac4013176498d19623d313","observation_id":"6e83aae9-48c0-4a0c-b705-d3e2eccadf9f","resolution":{"observed_at":"2026-08-05T22:54:54.834203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.836815Z","title":"On the authenticity of individual dynamic binaural synthesis","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.836815Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:ca9d1af6226a64ec7a6e77ce8f3b5e87a8700ae7a05aaa10b07b75048ca31979","observation_id":"3d9086c3-2254-4c0d-8e18-6f093600f175","resolution":{"observed_at":"2026-08-05T22:54:54.836815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.839746Z","title":"The importance of spatial audio in modern games and virtual environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.839746Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:5921d60d85f0e2fa5f4b29637f93e023bfa3570fda0640b21924ac3c8c4a9a87","observation_id":"14f6d5a4-0146-4c95-af78-d0b5e76b36b6","resolution":{"observed_at":"2026-08-05T22:54:54.839746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.842581Z","title":"Secl-umons database for sound event classification and localization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.842581Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:25c0788dacd1fd425a04cb0dd634745ba92fdfe45d6418efbb97db21b63120b5","observation_id":"34719950-d22d-4793-8b93-9940b822f4fa","resolution":{"observed_at":"2026-08-05T22:54:54.842581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.845207Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.845207Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0c51d182bf99c485e4e5c2d0d9d30aff12e99348791bbf2f0538e8c1fb396802","observation_id":"d7bc0dba-818b-4a35-b4d9-d18ed56f54d7","resolution":{"observed_at":"2026-08-05T22:54:54.845207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.848014Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.848014Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:938e708b0a7dbab2baa162adec8543c87bf3767b64c1c653fe0d3b2c5d1f6960","observation_id":"6353eb45-da09-444c-9194-ed03cf0d6be9","resolution":{"observed_at":"2026-08-05T22:54:54.848014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.00268","last_updated":"2019-11-05T10:18:18Z","snapshot_observed_at":"2026-08-14T16:38:50.734765Z","submitted_at":"2019-05-01T11:27:28Z","title":"Polyphonic Sound Event Detection and Localization using a Two-Stage Strategy","version":4},"cited_work":{"arxiv_id":"1905.00268","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.00268","snapshot_observed_at":"2026-08-05T22:54:56.179792Z","title":"Polyphonic Sound Event Detection and Localization using a Two-Stage Strategy","venue":"cs.SD","work_id":"2a71225f-ce7f-4cb6-bc0c-0c3ae6f241ae","year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.850775Z"},"links":{"cited_paper":"/paper/1905.00268","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3a7dd8ba97da269f34e4b49d794861e66593f10fd0e5117f9879b8094e911897","observation_id":"2337e80c-5b09-40bb-9229-159ad234d37a","resolution":{"observed_at":"2026-08-05T22:54:56.183619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.853868Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.853868Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9615cc64d9392a0a7f6d20b1ae7f15cfde91cbb88b252a8df1ca7296c7bdcbdb","observation_id":"600b03f5-af8c-48d7-a8da-80065568267a","resolution":{"observed_at":"2026-08-05T22:54:54.853868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.06158","last_updated":"2017-09-18T20:34:48Z","snapshot_observed_at":"2026-08-14T20:32:01.406964Z","submitted_at":"2017-09-18T20:34:48Z","title":"Matterport3D: Learning from RGB-D Data in Indoor Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.06158","snapshot_observed_at":"2026-08-05T22:54:54.856698Z","title":"Matterport3d: Learning from rgb-d data in indoor environments","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.856698Z"},"links":{"cited_paper":"/paper/1709.06158","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0c6b28bcba98910f5e1eb1aeb49dfc98ed549c53455b1911084c08b05ffbc0d7","observation_id":"56b21862-6f20-466c-b175-e1402f70df2f","resolution":{"observed_at":"2026-08-05T22:54:54.856698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.859814Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.859814Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:d3af549add62227c8d3b3b504800ae2aadbcdba5d15ecb17c4b85c58ef652fa8","observation_id":"3d72f939-35e4-4ae5-ab1e-c8a29aa38e50","resolution":{"observed_at":"2026-08-05T22:54:54.859814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.862866Z","title":"Visual acoustic matching","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.862866Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a2c9b27ffec14d95ec0d7b7c4a8607cf40a48ce332868c68723e6582f5ed2e24","observation_id":"77cc9042-d549-4a49-87a9-efb89b617895","resolution":{"observed_at":"2026-08-05T22:54:54.862866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.865668Z","title":"Spatial video streaming on apple vision pro xr headset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.865668Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3664f5634d33723d85e2ebbc16014b6030f558f695a3f15020c3f9bc5ddada8e","observation_id":"38617bef-70cb-4ed5-81d8-5b501e5a2805","resolution":{"observed_at":"2026-08-05T22:54:54.865668Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.868506Z","title":"Vggsound: A large-scale audio-visual dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.868506Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:633f7722ac5ce936d8c3c4e2739511d431b69244b45d325b52546f4f80ec4fc1","observation_id":"e791db6c-b705-4392-8156-c324976e55ea","resolution":{"observed_at":"2026-08-05T22:54:54.868506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.871219Z","title":"iquery: Instruments as queries for audio-visual sound separation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.871219Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4789e84a0df7b9049482208ef787fdd27992430295dc1ead770958989f97f2ce","observation_id":"46d358f5-1d7d-404a-8020-598a8536c3b2","resolution":{"observed_at":"2026-08-05T22:54:54.871219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.874420Z","title":"and Shlizerman, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.874420Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b69d20996a1411456f79d375f6fdf0e0a1629a1f376343184de2a7ed1e68c3a8","observation_id":"5788b6a5-5fa3-472c-a639-c97bacb8da2a","resolution":{"observed_at":"2026-08-05T22:54:54.874420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.08290","last_updated":"2023-09-15T10:11:37Z","snapshot_observed_at":"2026-08-16T15:00:27.829833Z","submitted_at":"2023-09-15T10:11:37Z","title":"Head-Related Transfer Function Interpolation with a Spherical CNN","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.08290","snapshot_observed_at":"2026-08-05T22:54:54.877936Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.877936Z"},"links":{"cited_paper":"/paper/2309.08290","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f06da707e6162464f83675a459fdc5029291b352508979615c6e9ae7f5161510","observation_id":"9562a13c-5020-4c7a-9d63-ece96822c3d1","resolution":{"observed_at":"2026-08-05T22:54:54.877936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.881118Z","title":"D., Richardt, C., Kumar, A., Laney, W., Owens, A., and Richard, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.881118Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f78a10f1d3b839307f1408737fdf1d6107971ad56dc2760cbf32ff044884dc13","observation_id":"629c6370-c830-4fbe-af80-b8fecc995c5c","resolution":{"observed_at":"2026-08-05T22:54:54.881118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21269","last_updated":"2024-10-28T17:58:15Z","snapshot_observed_at":"2026-08-17T04:41:21.308128Z","submitted_at":"2024-10-28T17:58:15Z","title":"OmniSep: Unified Omni-Modality Sound Separation with Query-Mixup","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21269","snapshot_observed_at":"2026-08-05T22:54:54.883876Z","title":"Omnisep: Unified omni-modality sound separation with query-mixup","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.883876Z"},"links":{"cited_paper":"/paper/2410.21269","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0651e266b654bee481b5ce54153a4402f51089b17f0c8c06e899e36372e13a3b","observation_id":"d29a328b-f890-42be-b96a-87c822fe79bc","resolution":{"observed_at":"2026-08-05T22:54:54.883876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.887065Z","title":"Multi-channel mosra: Mean opinion score and room acoustics estimation using simulated data and a teacher model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.887065Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f789bee0a0a80bb2a61a5b86aadf851a7f81be4756961e1bc101e08e4e672a43","observation_id":"df4d5e4e-08b4-4b6a-8a91-42b1e16109cc","resolution":{"observed_at":"2026-08-05T22:54:54.887065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.889863Z","title":"Simple and controllable music generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.889863Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:7de50896c00c87497c5f6582d54a001a37acedf91852e1d4dda93a5d3fe84298","observation_id":"32022a98-d3e3-434d-ad4e-9a200dad759a","resolution":{"observed_at":"2026-08-05T22:54:54.889863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06612","last_updated":"2025-07-07T17:42:19Z","snapshot_observed_at":"2026-08-16T13:45:20.103216Z","submitted_at":"2024-06-06T22:55:01Z","title":"SEE-2-SOUND: Zero-Shot Spatial Environment-to-Spatial Sound","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06612","snapshot_observed_at":"2026-08-05T22:54:54.892832Z","title":"See-2-sound: Zero-shot spatial environment-to-spatial sound","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.892832Z"},"links":{"cited_paper":"/paper/2406.06612","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:06d16ff42ff20ea53f28700b7d50f7dd258df230184975224bb9f9a8fa0c18af","observation_id":"43423162-7edc-4601-817e-3132bcde3197","resolution":{"observed_at":"2026-08-05T22:54:54.892832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.01840","last_updated":"2017-09-05T18:38:33Z","snapshot_observed_at":"2026-08-14T21:26:53.042056Z","submitted_at":"2016-12-06T14:58:59Z","title":"FMA: A Dataset For Music Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.01840","snapshot_observed_at":"2026-08-05T22:54:54.895720Z","title":"Fma: A dataset for music analysis","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.895720Z"},"links":{"cited_paper":"/paper/1612.01840","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3e5ed8862340d297873e9133861416d3bd2740a2769a647c8da511b2b1ef0f39","observation_id":"b3f266ff-b6c0-487d-94c1-046df61f1605","resolution":{"observed_at":"2026-08-05T22:54:54.895720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01174","last_updated":"2019-09-03T13:41:56Z","snapshot_observed_at":"2026-08-16T07:11:14.895015Z","submitted_at":"2019-09-03T13:41:56Z","title":"Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01174","snapshot_observed_at":"2026-08-05T22:54:54.898960Z","title":"Demucs: Deep extractor for music sources with extra unlabeled data remixed","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.898960Z"},"links":{"cited_paper":"/paper/1909.01174","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:412a692aa34b991b64739c3bebe567a62e73bf5a235efb8f1c033176366f5b20","observation_id":"8bca52d8-ec09-4372-add7-bca760b11d05","resolution":{"observed_at":"2026-08-05T22:54:54.898960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.902001Z","title":"and Horaud, R","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.902001Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:7b8c7bb4860809be8a86b534c0d203cbf5eb50b657144db695b2c1b0b12fe9e1","observation_id":"49fa6d91-7233-46a1-a132-74b32d7de4a1","resolution":{"observed_at":"2026-08-05T22:54:54.902001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.904887Z","title":"Learning spatially-aware language and audio embeddings","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.904887Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6badc39e5bdcc92733b589990cffa2e3c491363bddfa6b7b66ce7e8922ec940b","observation_id":"77645958-9417-40a4-b455-84e576bba4ee","resolution":{"observed_at":"2026-08-05T22:54:54.904887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13168","last_updated":"2021-04-27T13:23:56Z","snapshot_observed_at":"2026-08-16T18:28:47.006437Z","submitted_at":"2021-04-27T13:23:56Z","title":"dEchorate: a Calibrated Room Impulse Response Database for Echo-aware Signal Processing","version":1},"cited_work":{"arxiv_id":"2104.13168","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.13168","snapshot_observed_at":"2026-08-05T22:54:56.106146Z","title":"dEchorate: a Calibrated Room Impulse Response Database for Echo-aware Signal Processing","venue":"eess.AS","work_id":"7d35a178-65bb-4a97-9686-d955ae72d443","year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.907979Z"},"links":{"cited_paper":"/paper/2104.13168","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9ef9df564b470391e23c3e2c9e00c9b727c2fba05920acc3d8904713036aa899","observation_id":"9da60d12-15f9-4f58-8183-aab58c8866df","resolution":{"observed_at":"2026-08-05T22:54:56.109782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04174","last_updated":"2021-10-18T22:37:53Z","snapshot_observed_at":"2026-08-16T18:11:16.185602Z","submitted_at":"2021-07-09T02:00:47Z","title":"EasyCom: An Augmented Reality Dataset to Support Algorithms for Easy Communication in Noisy Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04174","snapshot_observed_at":"2026-08-05T22:54:54.911389Z","title":"K., and Mehra, R","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.911389Z"},"links":{"cited_paper":"/paper/2107.04174","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6b3ffc16d3b13c22db8f4f08bed243bb5b94fb27be428cdc5d7a49d652fd0a38","observation_id":"e31c0ead-cff0-40ac-a556-dc630a2b20f1","resolution":{"observed_at":"2026-08-05T22:54:54.911389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.03619","last_updated":"2018-08-09T21:22:37Z","snapshot_observed_at":"2026-08-14T19:27:22.210405Z","submitted_at":"2018-04-10T16:28:59Z","title":"Looking to Listen at the Cocktail Party: A Speaker-Independent Audio-Visual Model for Speech Separation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.03619","snapshot_observed_at":"2026-08-05T22:54:54.914412Z","title":"T., and Rubinstein, M","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.914412Z"},"links":{"cited_paper":"/paper/1804.03619","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:10632f3b728757a4e0b7616c9499712a031cfb9091fbe5c9325601fe73ce82a5","observation_id":"20105ac9-44ba-429a-b3c3-fdda802ecad4","resolution":{"observed_at":"2026-08-05T22:54:54.914412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.917463Z","title":"H., and Pons, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.917463Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:39c7a48522f0d8cd8c339e54a7df76066e7106e1f90c91bc4598156d5acf2129","observation_id":"c393cec3-2df4-40a1-8e47-42d0a2f39ecc","resolution":{"observed_at":"2026-08-05T22:54:54.917463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10301","last_updated":"2024-07-29T14:52:26Z","snapshot_observed_at":"2026-08-17T11:23:59.787786Z","submitted_at":"2024-04-16T06:09:33Z","title":"Long-form music generation with latent diffusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10301","snapshot_observed_at":"2026-08-05T22:54:54.920307Z","title":"D., Carr, C., Zukowski, Z., Taylor, J., and Pons, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.920307Z"},"links":{"cited_paper":"/paper/2404.10301","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:00eea7fa5a4d855710a408e7814f9381391ab4a023d58f6e429ff59b739a4d64","observation_id":"10d9b764-8e6b-474f-819d-61db03b33a6b","resolution":{"observed_at":"2026-08-05T22:54:54.920307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.923178Z","title":"W., Darrell, T., Freeman, W., and Viola, P","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.923178Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:beb5c3fe8e55a4d6c9f9f0dd7b0894df41da8c9dbac9a35ba008aed344ef17a7","observation_id":"7932d811-4334-4a9d-8659-7e499591e74a","resolution":{"observed_at":"2026-08-05T22:54:54.923178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.925901Z","title":"Fsd50k: an open dataset of human-labeled sound events","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.925901Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4cf6ba35f3b092871401c6092a82109be883c53a50ac615be6b71118bab7c590","observation_id":"e0849334-236f-4f13-8323-54df1c8fc1e1","resolution":{"observed_at":"2026-08-05T22:54:54.925901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.928853Z","title":"Freesound technical demo","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.928853Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:ae2668d1d5ec40c5080a008e75d642681b4a2f9247daed211f78f17094c6c0d5","observation_id":"e859816c-dd02-4493-88e6-4784d37fcc00","resolution":{"observed_at":"2026-08-05T22:54:54.928853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.931560Z","title":"and Scholz, M","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.931560Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b0131ff58ac88801a6a318b6a0292c3c74a96cfbc06fefbf04639e162aaf5282","observation_id":"c3fe9074-3f0b-4a71-bf55-b7150f12f571","resolution":{"observed_at":"2026-08-05T22:54:54.931560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.934717Z","title":"Self-supervised moving vehicle tracking with stereo sound","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.934717Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0700330d68c8b4f12fb189d5ed1736edbdf8d848bfec5cec4871e59ce7983a0b","observation_id":"a275fc92-a570-46d7-a3d4-9b55155f4426","resolution":{"observed_at":"2026-08-05T22:54:54.934717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.937548Z","title":"and Grauman, K","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.937548Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9d886079d3910cb530bfc4c83429a7f08c9c9a73a4a9b124737ea1ecaccbbd6a","observation_id":"27dfe371-7ca3-4ae7-8d04-d0c4ac404420","resolution":{"observed_at":"2026-08-05T22:54:54.937548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.940293Z","title":"and Grauman, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.940293Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3470c5ae5bb4fe8f11d76abbabe51e4a9c880e73cb3f8b82aa6b5da1d8ed2b23","observation_id":"5466e4df-a1df-49e1-92e0-f212084f0058","resolution":{"observed_at":"2026-08-05T22:54:54.940293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.943091Z","title":"Learning to separate object sounds by watching unlabeled video","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.943091Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:10a62c4aba20d2d22c5fdb017c3b6e073dea1be786f8da3c933d4cbd9c144553","observation_id":"688157ef-ea60-4427-b873-93bb85cacdb4","resolution":{"observed_at":"2026-08-05T22:54:54.943091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.946099Z","title":"A., Politis, A., Mesaros, A., Guti \\'e rrez-Arriola, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.946099Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0b00d37524d68a379cfa632fac5154a51da4c6587f77025ab237581a88ccd002","observation_id":"cfd8d176-1c5d-42b0-9cb2-be6ce818207f","resolution":{"observed_at":"2026-08-05T22:54:54.946099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.10882","last_updated":"2021-11-21T19:26:45Z","snapshot_observed_at":"2026-08-16T17:40:22.464755Z","submitted_at":"2021-11-21T19:26:45Z","title":"Geometry-Aware Multi-Task Learning for Binaural Audio Generation from Video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.10882","snapshot_observed_at":"2026-08-05T22:54:54.949182Z","title":"Geometry-aware multi-task learning for binaural audio generation from video","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.949182Z"},"links":{"cited_paper":"/paper/2111.10882","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f5af9225325e1a0688307bc90d1f524afd6370dbcec1d2f08acc91214cf4b031","observation_id":"2fe10395-c8fa-48a4-bef9-979cd38fef6f","resolution":{"observed_at":"2026-08-05T22:54:54.949182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.952499Z","title":"Visually-guided audio spatialization in video with geometry-aware multi-task learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.952499Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:13062c6e3bb8f3751862a8f8dd960b3472c3c88b54b03ba77c8d2ac2017080b3","observation_id":"3dab6090-36b0-47b1-89cf-9b834063ccee","resolution":{"observed_at":"2026-08-05T22:54:54.952499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09930","last_updated":"2020-10-19T23:55:48Z","snapshot_observed_at":"2026-08-16T19:12:15.681602Z","submitted_at":"2020-10-19T23:55:48Z","title":"BIRD: Big Impulse Response Dataset","version":1},"cited_work":{"arxiv_id":"2010.09930","doi":null,"metadata_source":"pith","pith_arxiv_id":"2010.09930","snapshot_observed_at":"2026-08-05T22:54:56.055137Z","title":"BIRD: Big Impulse Response Dataset","venue":"cs.SD","work_id":"6733641d-9923-4b6d-902c-07ab58ef1031","year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.955452Z"},"links":{"cited_paper":"/paper/2010.09930","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1e527f5be46cace9f4cbe984bfa360fbbb6e75eb8c61b59907735caeb01d93ad","observation_id":"0e13cbb2-0284-4d59-9eb2-6175738099b0","resolution":{"observed_at":"2026-08-05T22:54:56.058387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.06183","last_updated":"2020-03-13T10:13:17Z","snapshot_observed_at":"2026-08-11T19:56:48.648699Z","submitted_at":"2020-03-13T10:13:17Z","title":"HRTF Individualization: A Survey","version":1},"cited_work":{"arxiv_id":"2003.06183","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.06183","snapshot_observed_at":"2026-08-05T22:54:56.041622Z","title":"HRTF Individualization: A Survey","venue":"eess.AS","work_id":"8fde6dc9-08ac-4008-9cda-c56b01866985","year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.958933Z"},"links":{"cited_paper":"/paper/2003.06183","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:cd05c9ae763216a7cc3b4e27b220b6112813f69a2db39eb386369d73dd8cb72b","observation_id":"61daa74d-2386-4f01-98be-6ad4cca791f3","resolution":{"observed_at":"2026-08-05T22:54:56.044789Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.962053Z","title":"Psychoacoustic cues in room size perception","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.962053Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6388cd2253d6407a5a41ac0ca5e21e5be2e832735057d7536c1f94c05bec2cd4","observation_id":"72daa11b-eb06-492e-9d7b-0018cfa961ab","resolution":{"observed_at":"2026-08-05T22:54:54.962053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.965008Z","title":"Real-time binaural speech separation with preserved spatial cues","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.965008Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:d45ea23f9467f5928b6f118f9dd782e5f8f1d087115882de8f71d9574e683ce2","observation_id":"7f9a587f-a8c3-45b3-b09f-982d2bd21609","resolution":{"observed_at":"2026-08-05T22:54:54.965008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.968292Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.968292Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:9a99d6f21c775352acda5f9b796bff40d4decb90fb39a3c7f993ab869f401456","observation_id":"60a6290a-0572-421a-91f5-947baba5eddc","resolution":{"observed_at":"2026-08-05T22:54:54.968292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.971352Z","title":"Immersediffusion: A generative spatial audio latent diffusion model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.971352Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1e5de46746c5617244c6286adf9e4b5150759bcbfdf4eb9634ee1b64384da977","observation_id":"a4d8dd83-f6f1-4bf2-abad-d7f2a4c060e4","resolution":{"observed_at":"2026-08-05T22:54:54.971352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.974390Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.974390Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:d261c086938c6f48d52598c3bb92016415d42087da8c523e32340c1c4b2caf8d","observation_id":"fb9706a8-376e-48d9-8c19-67d76d3cb96b","resolution":{"observed_at":"2026-08-05T22:54:54.974390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.977600Z","title":"Classification of spatial audio location and content using convolutional neural networks","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.977600Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:225cda7d1a0c413d6cbf1eb9689df4a092679a435e0ab15332821dc9f8b3890e","observation_id":"ffa78cb2-0b89-405d-a861-17af6c979ff5","resolution":{"observed_at":"2026-08-05T22:54:54.977600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.981235Z","title":"O., Jenkins, M., Liu, H., Squires, I., Cooper, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.981235Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6097e8a9e679cbc4e354592600c43d38c5d3612f1df8905cd680dd12092a56d2","observation_id":"250e1681-c5f8-4ff6-82d9-dfa29224e2ab","resolution":{"observed_at":"2026-08-05T22:54:54.981235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.03697","last_updated":"2022-07-08T05:18:36Z","snapshot_observed_at":"2026-08-16T16:47:28.919687Z","submitted_at":"2022-07-08T05:18:36Z","title":"End-to-End Binaural Speech Synthesis","version":1},"cited_work":{"arxiv_id":"2207.03697","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.03697","snapshot_observed_at":"2026-08-05T22:54:56.027536Z","title":"End-to-End Binaural Speech Synthesis","venue":"cs.SD","work_id":"83267ddb-ce65-4c01-a3d8-f7cef132d2a8","year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.984907Z"},"links":{"cited_paper":"/paper/2207.03697","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a7658c55493ee8cdfb319e7d0019ceb4e01935d1346a936e468e74a8ea3c4014","observation_id":"1207cd67-93de-4441-9ef9-7d2254b59af6","resolution":{"observed_at":"2026-08-05T22:54:56.031062Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.988237Z","title":"A time-domain unsupervised learning based sound source localization method","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.988237Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a7888b2b57ab1c21a267281ba866d5b955587354c2129e824ea4cf1375042fe2","observation_id":"f5c384b2-1df8-44d3-b05c-39c17ff0ed22","resolution":{"observed_at":"2026-08-05T22:54:54.988237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.991312Z","title":"acoustics—measurement of room acoustic parameters—part 1: Performance spaces,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.991312Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:e62d6e6175a6602aea551662579a9607694b4acc1eb792faf87c4a038ecfaaf4","observation_id":"1274e5d7-b8ef-4408-8e0a-64bc761fe551","resolution":{"observed_at":"2026-08-05T22:54:54.991312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.994626Z","title":"Head-related transfer function interpolation from spatially sparse measurements using autoencoder with source position conditioning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.994626Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:3d3d6fab59c0511fb14916e53e4f30e78ecf232d9999ea93c8eb3e0c9c76683b","observation_id":"1ec8f2e3-7336-4166-a138-142eeb1b8f06","resolution":{"observed_at":"2026-08-05T22:54:54.994626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:54.998068Z","title":"A binaural room impulse response database for the evaluation of dereverberation algorithms","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:54.998068Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:0113f572b0611b64c756461ad66300b06fe697803b0ced9506c859940d717bf2","observation_id":"6ba53848-e3ed-4936-9e9f-74ff5b55ddf0","resolution":{"observed_at":"2026-08-05T22:54:54.998068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.001090Z","title":"Exploring audio-visual information fusion for sound event localization and detection in low-resource realistic scenarios","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.001090Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:b2c987f4dcf31e18274e6ee0c4f6d1161f1fc81b782a41bbe1247f8072516752","observation_id":"79c38e96-55c7-4351-b639-c9b6ed176abe","resolution":{"observed_at":"2026-08-05T22:54:55.001090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.004235Z","title":"Modeling individual head-related transfer functions from sparse measurements using a convolutional neural network","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.004235Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4276cec5898512d2cee8a365eab00c7a7cbb93f5f71bb9b07345d55401fe6e43","observation_id":"e51b317b-342b-46d5-a040-39a3465fa9d1","resolution":{"observed_at":"2026-08-05T22:54:55.004235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.007271Z","title":"L., Gan, W.-S., et al","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.007271Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:32edfe7342765d68dfadc709290d4a8c76b7929765a5285b3d5891eb92a7cba5","observation_id":"86947315-bf7e-48e0-af3e-c5abb8724de0","resolution":{"observed_at":"2026-08-05T22:54:55.007271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.010388Z","title":"J., and Hilton, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.010388Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:2f78833a91be4b3f63de00e0e10d9e8c3af02565a4f39cf8c798d6a40817a7d5","observation_id":"ae989b1c-8fec-413f-9841-15374fc6a1d1","resolution":{"observed_at":"2026-08-05T22:54:55.010388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.013230Z","title":"Visage: Video-to-spatial audio generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.013230Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:23ffb27560790ab652b8fb3a705840d0db03f44bc010aa1c99ad0e74d3cafada","observation_id":"54c44478-db7e-4ea6-9fc3-507bf19bf5b4","resolution":{"observed_at":"2026-08-05T22:54:55.013230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.016162Z","title":"S., Park, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.016162Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:c6dd4e29cb9d81c7eacae4080bc53f5a48b713dff7ed44ebae85d0c4d7e4e676","observation_id":"a75b32f1-9104-4064-a9d4-ab10d09e4d46","resolution":{"observed_at":"2026-08-05T22:54:55.016162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-05T22:54:55.019077Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.019077Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:74c076ead62f3ce6769b34c173fcaf19d8df1ec81dee3f15aa9d87ee02eb80e0","observation_id":"4a2f5d9c-726d-4bac-b2a9-808ea9070e1a","resolution":{"observed_at":"2026-08-05T22:54:55.019077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.022111Z","title":"Habets, E","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.022111Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:ab02dc24cc2a0c012e5ec7fcd649545847250d23c636ce2ca40ded3472cbc866","observation_id":"e34966ca-65af-4b46-b77e-c0d96b0089ca","resolution":{"observed_at":"2026-08-05T22:54:55.022111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.025159Z","title":"Panoptic segmentation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.025159Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:cb72c4faf427b85eff411805b92cbdea6f9863ce0f93a4f989ebcab245a1cc44","observation_id":"6812aa59-dba9-4b9d-bfec-f75a9ce2ee45","resolution":{"observed_at":"2026-08-05T22:54:55.025159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05069","last_updated":"2022-03-29T12:25:02Z","snapshot_observed_at":"2026-08-16T17:50:24.547828Z","submitted_at":"2021-10-11T08:07:50Z","title":"Efficient Training of Audio Transformers with Patchout","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05069","snapshot_observed_at":"2026-08-05T22:54:55.028080Z","title":"Efficient training of audio transformers with patchout","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.028080Z"},"links":{"cited_paper":"/paper/2110.05069","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:aeb26230c85f094e8792c4313eb82b1c742ee497bbf66eb27205f1dff4c70d84","observation_id":"cc184448-28f0-4ecf-8a6c-d0a68be61084","resolution":{"observed_at":"2026-08-05T22:54:55.028080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.031180Z","title":"Meshrir: A dataset of room impulse responses on meshed grid points for evaluating sound field analysis and synthesis methods","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.031180Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:829d45ab408331d91a730e1315ab86674ed51890c26161a0e0d6aa10eb486728","observation_id":"1769fbe0-ece4-4d95-88ee-0145adff4b9b","resolution":{"observed_at":"2026-08-05T22:54:55.031180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.034380Z","title":"A., Garc \\' a-Barrios, G., Politis, A., and Mesaros, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.034380Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:c5cb683ca318f6118a572757c6f32cdacf3feaa4ca0976d7adc73e72ca2cdad8","observation_id":"cd9a41a5-0736-4110-bbdb-39961f659fdd","resolution":{"observed_at":"2026-08-05T22:54:55.034380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15352","last_updated":"2023-03-05T09:14:16Z","snapshot_observed_at":"2026-08-16T16:27:53.560021Z","submitted_at":"2022-09-30T10:17:05Z","title":"AudioGen: Textually Guided Audio Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.15352","snapshot_observed_at":"2026-08-05T22:54:55.037230Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.037230Z"},"links":{"cited_paper":"/paper/2209.15352","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:c7ed4a86308e9d5d099ae940ac954754febe03b7e4ea7866fddb7cb22dae8b86","observation_id":"1d21322c-37df-411b-af3b-985273ffd8b9","resolution":{"observed_at":"2026-08-05T22:54:55.037230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.03927","last_updated":"2024-08-07T13:15:55Z","snapshot_observed_at":"2026-08-16T16:47:21.772639Z","submitted_at":"2022-07-08T14:27:52Z","title":"BAST: Binaural Audio Spectrogram Transformer for Binaural Sound Localization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.03927","snapshot_observed_at":"2026-08-05T22:54:55.040419Z","title":"Bast: Binaural audio spectrogram transformer for binaural sound localization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.040419Z"},"links":{"cited_paper":"/paper/2207.03927","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:68556eeaaa2d994e6ff7a1a2a7587d959cf4adbf0395293537b0213a23d8deb4","observation_id":"4a00a202-2e8c-4f76-b74c-c5e814bd9444","resolution":{"observed_at":"2026-08-05T22:54:55.040419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.043431Z","title":"S., Ma, J., Thomas, M","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.043431Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a97d0aa6237bf4f78de2574849363be7f404403df5244aa5856de3db7715acee","observation_id":"96b82b60-e6ab-45ab-9d37-12215cc7a89c","resolution":{"observed_at":"2026-08-05T22:54:55.043431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.046198Z","title":"Sound event detection in synthetic audio: Analysis of the dcase 2016 task results","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.046198Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:5d865af8179abd3c7625f99687ec44e64419c01e07e89cd255cc985204bfbb1e","observation_id":"19fd9aba-14fd-4d20-a6ed-3748e5406111","resolution":{"observed_at":"2026-08-05T22:54:55.046198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.049057Z","title":"Gradient-based learning applied to document recognition","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.049057Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:944896c29cf156952c86d43b8712ea68fd098ce10930496ea579ee64872c1802","observation_id":"306ec36a-0fbb-445c-8edf-768f71412a5e","resolution":{"observed_at":"2026-08-05T22:54:55.049057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2022.0068","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.972211Z","title":"Context-based evaluation of the opus audio codec for spatial audio content in virtual reality","venue":null,"work_id":"999010e3-ec80-4d70-9078-e8ec746d978e","year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.051868Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6388894ef8d20d17cc0e65fcc245a02ac2e5414ee14436e397a91a584d50f59c","observation_id":"9dc13d30-c6c4-4c5d-9856-118138bb88f7","resolution":{"observed_at":"2026-08-05T22:54:55.977882Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.054653Z","title":"Looking into your speech: Learning cross-modal affinity for audio-visual speech separation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.054653Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:6209903cceb807302614aaa7a402e58f8d801963737fa1e5c7787dcf13a7d978","observation_id":"bfb6da14-fbdc-444e-8fd0-5593aecc91bb","resolution":{"observed_at":"2026-08-05T22:54:55.054653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.058011Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.058011Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:69a6718e2ac2c12f481ff62556b89d781fbf190af2d66ec1dbd9dea91a49acd1","observation_id":"80bcd70b-4243-48a9-8839-a074a78da518","resolution":{"observed_at":"2026-08-05T22:54:55.058011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.061066Z","title":"W., Lee, S., and Lee, K","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.061066Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f3a580860bc98dfd64e5e87ec788f09f00e832500a2b44bce18efda0758bd096","observation_id":"d164dad8-c895-47bb-b4c6-f2d0ad17c29e","resolution":{"observed_at":"2026-08-05T22:54:55.061066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.064197Z","title":"Binauralgrad: A two-stage conditional diffusion probabilistic model for binaural audio synthesis","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.064197Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:841820257d7211f4d9f0d4e1c565075ff82a06d81239e2e4e44c79efa58e221c","observation_id":"26439711-d4df-459d-93c9-3d30f1ea68bc","resolution":{"observed_at":"2026-08-05T22:54:55.064197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.067111Z","title":"See and listen: Score-informed association of sound tracks to players in chamber music performance videos","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.067111Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f4ebb2fe959354ee49b7602b6f92ca09fd665dbd325eaaff64f1673040479aee","observation_id":"c5011edc-b491-4fde-b9b3-0b02d6ca331e","resolution":{"observed_at":"2026-08-05T22:54:55.067111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01481","last_updated":"2025-03-06T04:11:26Z","snapshot_observed_at":"2026-08-16T13:13:23.805458Z","submitted_at":"2024-10-02T12:33:59Z","title":"SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios","version":2},"cited_work":{"arxiv_id":"2410.01481","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.01481","snapshot_observed_at":"2026-08-05T22:54:55.894099Z","title":"SonicSim: A customizable simulation platform for speech processing in moving sound source scenarios","venue":"cs.SD","work_id":"d7d7e481-e8e9-45a1-973e-423ab10c1d4a","year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.070127Z"},"links":{"cited_paper":"/paper/2410.01481","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:f8626ca5f5ff9e5737c428a7f5ee0cd2292b424e98bfdd545305a4909ddcaaf8","observation_id":"5232f87d-f1cb-492a-bb37-a4163ad85988","resolution":{"observed_at":"2026-08-05T22:54:55.898028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.073261Z","title":"Binaural audio generation via multi-task learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.073261Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:734d08ef9f164e2b68c70e7e491b643a18813e75951cfa7b3fd2d49721179de3","observation_id":"5af43f6d-bf53-4e8a-bb87-ac2c6ba98131","resolution":{"observed_at":"2026-08-05T22:54:55.073261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.075990Z","title":"Binauralmusic: A diverse dataset for improving cross-modal binaural audio generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.075990Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:8362bf73807fedcd165a79e080ba0d9216bebd6f73702f6160bc927d0169b7d3","observation_id":"1aeaa763-2c5c-4602-b798-309913bb6973","resolution":{"observed_at":"2026-08-05T22:54:55.075990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.078726Z","title":"Cross-modal generative model for visual-guided binaural stereo generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.078726Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:a21a07ddd24f2f7828994091f2953cda81adf7df144e1548e79a93a76faadd85","observation_id":"cb3a37cc-203b-4ae0-87e9-9fedb651b1ed","resolution":{"observed_at":"2026-08-05T22:54:55.078726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.081760Z","title":"Av-nerf: Learning neural fields for real-world audio-visual scene synthesis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.081760Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:5bb73a1c5af7209040e7529974c111af16d5c2a9235143af9afa51e39d86cf97","observation_id":"33d47c11-458c-463f-bfeb-910acc271e4e","resolution":{"observed_at":"2026-08-05T22:54:55.081760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.084649Z","title":"and Nam, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.084649Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:169bd8b1cdd494c18fb6ee3f8850c0be2b74aada015279fb158d21ac2c762d4f","observation_id":"29e8cc89-22c5-4582-ba7e-d2bf8e496aad","resolution":{"observed_at":"2026-08-05T22:54:55.084649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:54:55.087332Z","title":"T., Ben-Hamu, H., Nickel, M., and Le, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.087332Z"},"links":{"citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:37311375bc31f1ed87ab2c3d1027c056ac81f69d938ee2380467a08f4876c468","observation_id":"26b3dba4-491e-4ede-ba27-91be7ecda36d","resolution":{"observed_at":"2026-08-05T22:54:55.087332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12503","last_updated":"2023-09-09T15:27:58Z","snapshot_observed_at":"2026-08-16T15:59:22.404915Z","submitted_at":"2023-01-29T17:48:17Z","title":"AudioLDM: Text-to-Audio Generation with Latent Diffusion Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12503","snapshot_observed_at":"2026-08-05T22:54:55.090118Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.090118Z"},"links":{"cited_paper":"/paper/2301.12503","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:c71f454c8adc51f5f0abfd911bdd9896bd7a04251fea213e4edc3b9d20f52812","observation_id":"986d2272-7240-4034-913a-4c095f3bd0ca","resolution":{"observed_at":"2026-08-05T22:54:55.090118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14906","last_updated":"2025-06-03T03:27:47Z","snapshot_observed_at":"2026-08-16T11:35:20.016174Z","submitted_at":"2025-04-21T07:21:28Z","title":"OmniAudio: Generating Spatial Audio from 360-Degree Video","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14906","snapshot_observed_at":"2026-08-05T22:54:55.093055Z","title":"Omniaudio: Generating spatial audio from 360-degree video","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.093055Z"},"links":{"cited_paper":"/paper/2504.14906","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:1a1543a690212eee1d9d75f94f95297b30ce8f67633be24b274fa4a75327eb92","observation_id":"35a49eb7-ace0-4491-98cd-092299126a7f","resolution":{"observed_at":"2026-08-05T22:54:55.093055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07000","last_updated":"2023-06-01T07:35:11Z","snapshot_observed_at":"2026-08-16T16:08:50.090687Z","submitted_at":"2022-12-14T03:18:21Z","title":"DopplerBAS: Binaural Audio Synthesis Addressing Doppler Effect","version":3},"cited_work":{"arxiv_id":"2212.07000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.07000","snapshot_observed_at":"2026-08-05T22:54:55.863096Z","title":"DopplerBAS: Binaural Audio Synthesis Addressing Doppler Effect","venue":"eess.AS","work_id":"9d86c765-af71-453a-9773-0c631417bb66","year":2022},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.095895Z"},"links":{"cited_paper":"/paper/2212.07000","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:70a5ba586509359d7d3742ac88901f7eb820e61bf613ea8b4e8bc04e211e6701","observation_id":"0c60096d-7bf2-4fa9-b69b-f9cfbbb40632","resolution":{"observed_at":"2026-08-05T22:54:55.866351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-16T18:58:36.678739Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":89,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":204},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 100 of 204 outbound references and 1 inbound Pith citation observation for arXiv:2508.10924."}