{"as_of":"2026-08-09T06:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c141f24af520593e9683686675e7507fca80954ef79e23a22ae26bce2a9ee969","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:30:26.197293Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:04:00.782536Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-05T22:54:55.849359Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07538","snapshot_observed_at":"2026-08-06T14:04:00.782536Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19835","last_updated":"2025-07-26T07:12:02Z","snapshot_observed_at":"2026-08-07T16:55:18.620169Z","submitted_at":"2025-07-26T07:12:02Z","title":"SonicGauss: Position-Aware Physical Sound Synthesis for 3D Gaussian Representations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T14:04:00.782536Z"},"links":{"cited_paper":"/paper/2502.07538","citing_paper":"/paper/2507.19835"},"observation_digest":"sha256:6450455e662e9edd3bb7cd6dbdcd5aea1343e73e04c2a4748865f3d11f27729a","observation_id":"e32e88ea-5594-4674-8822-0c9f4b73b63c","resolution":{"observed_at":"2026-08-06T14:04:00.782536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"cited_work":{"arxiv_id":"2502.07538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07538","snapshot_observed_at":"2026-08-05T22:54:55.849359Z","title":"Visual-based spatial audio generation system for multi-speaker environments","venue":"cs.MM","work_id":"f46d09e4-17c9-4a8b-bffe-5442bf293fc4","year":2025},"citing_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-08-05T22:54:55.101714Z"},"links":{"cited_paper":"/paper/2502.07538","citing_paper":"/paper/2508.10924"},"observation_digest":"sha256:4748964b502f7c52b213a419b8cb1b7d917f30047e62f6a4e11b23adf5f33fcb","observation_id":"2eafc3f1-4726-4f15-9c63-e70ead68af53","resolution":{"observed_at":"2026-08-05T22:54:55.853160Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07538/citation-record","integrity":"/paper/2502.07538/integrity","json":"/paper/2502.07538/citation-record.json","paper":"/paper/2502.07538"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.532309Z","title":"Exploring audio- visual information fusion for sound event localization and detection in low-resource realistic scenarios,","venue":null,"work_id":"445b0f1d-8085-4c05-ad8c-faf28a0a2941","year":2024},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.103584Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:64e1a7214fb8794cfea32bdf816fe93482397fec4cc2cb2d3ec911ddeae737ad","observation_id":"01c1e241-7246-4d53-9b27-b2b1450eed7a","resolution":{"observed_at":"2026-08-08T12:30:26.536832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.517861Z","title":"Aligning audiovisual features for audiovisual speech recognition,","venue":null,"work_id":"c0f1ccd8-d371-4b59-a292-df30800b9432","year":2018},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.108687Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:1dc9dbc4a14411af576312956a93d30dcc96e80ee54e2c6960b740ed7b5df474","observation_id":"047e4701-6346-4cf6-8f4d-9ca1b7958006","resolution":{"observed_at":"2026-08-08T12:30:26.522970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.503553Z","title":"Immersive spatial audio reproduction for vr/ar using room acoustic modelling from 360° images,","venue":null,"work_id":"a1206112-61ac-4a69-b6da-b2a8e5862ee1","year":2019},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.113528Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:83aaf01ab07e7964bc77dc911865bd7e27e5ff7e3809a39d4ef2221edfb3ba50","observation_id":"c3174224-52d0-4dab-9458-417abf7c78be","resolution":{"observed_at":"2026-08-08T12:30:26.508310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.490010Z","title":"Scene-aware audio for 360° videos,","venue":null,"work_id":"895e629f-cd08-439c-8ff1-41efd4d9e9d3","year":2018},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.118296Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:708f4a413136d2e2aea5ae10982c82df899de6789835510bac6e1f9f70f8a300","observation_id":"0a28dc3b-e7de-4625-87b6-e6a8ac9ff269","resolution":{"observed_at":"2026-08-08T12:30:26.494322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.475989Z","title":"Analysis of a distributed processing model for spatialized audio conferences,","venue":null,"work_id":"7874d661-0abd-4f88-89f7-3e5296a52612","year":2008},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.122985Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:5daeb7c057cc04e4c428061227beefa18e5132a2423e72be65415d08dc0cd014","observation_id":"f115ea40-7d76-4016-b312-4845ec80fcd7","resolution":{"observed_at":"2026-08-08T12:30:26.480615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.460847Z","title":"Realistic audio in immersive video conferencing,","venue":null,"work_id":"96262633-fca3-4b91-b793-e2d3591b4665","year":2011},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.127638Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:abe4e872a6b51aedd3329586bfd9eab27e2667a3a7003b880b314861ca31be48","observation_id":"78e8b1d3-6199-452e-a843-782c4e2ff069","resolution":{"observed_at":"2026-08-08T12:30:26.465535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.445958Z","title":"Audio-visual sensing from a quadcopter: dataset and baselines for source localization and sound enhancement,","venue":null,"work_id":"da77c0b1-55b1-4ec7-baf6-2c682390305d","year":2018},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.132615Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:fcd55eed68b7373990721f0a64da5d746f2c845d11b23c06b78b3c71c5c4309c","observation_id":"69c65982-9250-4479-9afb-2e3243dc5188","resolution":{"observed_at":"2026-08-08T12:30:26.451213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.429520Z","title":"2.5d visual sound,","venue":null,"work_id":"ae3389b0-d560-458b-b1d2-28f034d7ec71","year":2019},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.136964Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:00af4f9fcac1b66b7d458b0f3e4fddf26d424a4835c9e2ff1a05aba0c14fe9ca","observation_id":"55096907-3dba-4bce-b6ba-1c792c2ef5a4","resolution":{"observed_at":"2026-08-08T12:30:26.434867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.413253Z","title":"Visually informed binaural audio generation without binaural audios,","venue":null,"work_id":"196f2fca-f476-4dc6-bd08-d9863e22a437","year":2021},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.141461Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:47c379be6fb8be868203407fe5928b6941a587ca2155ca1b8d71a2f1ea777171","observation_id":"118c667c-4c36-4529-bc12-a5fddc806369","resolution":{"observed_at":"2026-08-08T12:30:26.418915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.398268Z","title":"A review on yolov8 and its advancements,","venue":null,"work_id":"9bdc067e-9403-4e8d-8a18-2895e029025a","year":2024},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.145960Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:921ee8e7c7c72c12e03c96b18b10592c7cee7663ea22893ceb450df82f3877f3","observation_id":"ed4ccc89-e858-4317-8a1e-85e3381ececf","resolution":{"observed_at":"2026-08-08T12:30:26.403157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.382803Z","title":"Wider face: A face detection benchmark,","venue":null,"work_id":"a295f320-d7a2-4887-841b-d1f0a985157c","year":2016},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.150357Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:cbc422ab8c98c456c52c3b0de72a43366427277fe226f48231c77036ab721d53","observation_id":"7687ebb2-2f03-4d28-adb5-1085d7bacbe0","resolution":{"observed_at":"2026-08-08T12:30:26.388110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.366892Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data,","venue":null,"work_id":"a6af29a7-dfdb-4c28-9a81-b360b9ea545b","year":2024},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.154803Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:037c5c89e1e17609dc75cb5430b91bacc9fccb9d5961db1947cf5c7c81339382","observation_id":"b017bd20-49bb-4854-bd06-289fa64f87f5","resolution":{"observed_at":"2026-08-08T12:30:26.372085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.350704Z","title":"You only look once: Unified, real-time object detection,","venue":null,"work_id":"9eab249d-acdf-4a34-a231-9396b24fe14a","year":2016},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.160648Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:ac47bf8be15e760b24acf7c9d9a762eea424d0d8a3d3089abe7a3009c8e2a439","observation_id":"535446c5-1b96-47b9-aefd-f809af2ef142","resolution":{"observed_at":"2026-08-08T12:30:26.356023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.334100Z","title":"Conv-tasnet: Surpassing ideal time– frequency magnitude masking for speech separation,","venue":null,"work_id":"435cd017-04f3-4302-b027-19377e60a52d","year":2019},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.165241Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:0bfc86e396a0246882cf3d2c9f8ee53784264485274da3d30802a909a0c3aac3","observation_id":"e8396a1d-7eb7-4c8d-aedc-f42dbcdd999c","resolution":{"observed_at":"2026-08-08T12:30:26.339161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.01174","last_updated":"2019-09-03T13:41:56Z","snapshot_observed_at":"2026-08-08T18:45:21.285803Z","submitted_at":"2019-09-03T13:41:56Z","title":"Demucs: Deep Extractor for Music Sources with extra unlabeled data remixed","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.01174","snapshot_observed_at":"2026-08-08T12:30:26.169424Z","title":"Demucs: Deep extractor for music sources with extra unlabeled data remixed,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.169424Z"},"links":{"cited_paper":"/paper/1909.01174","citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:d1599f254eb45f2debb9069732d768c5fe9203a746fb1532d520f8b19c6eabca","observation_id":"f09ed45e-7d93-432f-83d1-ddcd5ac4e1e3","resolution":{"observed_at":"2026-08-08T12:30:26.169424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.317803Z","title":"A perceptual evaluation of individual and non-individual hrtfs: A case study of the sadie ii database,","venue":null,"work_id":"94c54fd7-7094-4ea4-9586-0fc5b2340163","year":2018},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.174917Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:c8b0da86dc19585cd66fcf67a1f56178cbd0f3dedc8b81e7e70f6e3e386ec638","observation_id":"f87a8c9c-c216-4bbd-b62f-33cba63d9bda","resolution":{"observed_at":"2026-08-08T12:30:26.322485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.02882","last_updated":"2019-04-05T06:05:00Z","snapshot_observed_at":"2026-08-07T13:32:24.356336Z","submitted_at":"2019-04-05T06:05:00Z","title":"LibriTTS: A Corpus Derived from LibriSpeech for Text-to-Speech","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.02882","snapshot_observed_at":"2026-08-08T12:30:26.180184Z","title":"Libritts: A corpus derived from librispeech for text-to-speech,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.180184Z"},"links":{"cited_paper":"/paper/1904.02882","citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:9ff375b7bd20fc0a661bd59fcb3fa0aee427ed52909996d45eb96c0b74edb47d","observation_id":"df9dfaea-879f-4ace-9f8d-7a3361eb6daa","resolution":{"observed_at":"2026-08-08T12:30:26.180184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.303404Z","title":"Self- supervised generation of spatial audio for 360 video,","venue":null,"work_id":"8e5aeb2d-6902-4849-82ca-eea1916ea19c","year":2018},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.184894Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:e1120d9fc39ed9d675c45165fa27bca6af0a95c2b1cd9e742ae1d70dde9e7fda","observation_id":"ca24f598-e728-466c-8ccb-b99e6fe79ba8","resolution":{"observed_at":"2026-08-08T12:30:26.308132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.288264Z","title":"Peaq-the itu standard for objective measurement of perceived audio quality,","venue":null,"work_id":"d236bdfe-d824-43a0-b2e0-1713fab7f1d7","year":2000},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.188982Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:0b34b02d009986108fc22d1c2ab1ec7b756be70e01c3076dc9ef6b7eccb8f266","observation_id":"37c35292-c3e0-4301-a298-4f30aa1ebff7","resolution":{"observed_at":"2026-08-08T12:30:26.293031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T12:30:26.271617Z","title":"An algorithm for predicting the intelligibility of speech masked by modulated noise maskers,","venue":null,"work_id":"5f9c2b20-8abe-433f-92af-3042cdae338a","year":2009},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.193102Z"},"links":{"citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:b0a1b629e27dfe15ddc3e86e1c1cd221a2bca619ed0c50c6df4ef149a92eb2a0","observation_id":"196a87c3-a672-415b-8523-196aa0eb2830","resolution":{"observed_at":"2026-08-08T12:30:26.278058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08352","last_updated":"2021-07-14T07:32:49Z","snapshot_observed_at":"2026-08-08T00:23:46.265688Z","submitted_at":"2019-04-17T16:38:31Z","title":"MOSNet: Deep Learning based Objective Assessment for Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08352","snapshot_observed_at":"2026-08-08T12:30:26.197293Z","title":"Mosnet: Deep learn- ing based objective assessment for voice conversion,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T12:30:26.197293Z"},"links":{"cited_paper":"/paper/1904.08352","citing_paper":"/paper/2502.07538"},"observation_digest":"sha256:b0659eae2f129b7d6e810a6ae6620d8514b64d6a29ce39ff6a090dc918ef3f29","observation_id":"35500a2e-48ca-4ba1-8b71-f261a0836319","resolution":{"observed_at":"2026-08-08T12:30:26.197293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07538","last_updated":"2025-02-13T14:21:12Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-09T03:21:31.025973Z","submitted_at":"2025-02-11T13:24:38Z","title":"Visual-based spatial audio generation system for multi-speaker environments"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 2 inbound Pith citation observations for arXiv:2502.07538."}