{"as_of":"2026-08-09T15:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:652342e72945c9fbd5fd5582ed911d9f2b37d7422929eddf519ede651288b0e6","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-13T06:40:47.064894Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.08800/citation-record","integrity":"/paper/2607.08800/integrity","json":"/paper/2607.08800/citation-record.json","paper":"/paper/2607.08800"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:33be38cbfb8c5816f8b4d1b6ee069328a2b7c962f6d0c5adcc072453ce8e14fa","observation_id":"3141d366-95db-46a1-b5af-39f0bbe6ce36","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Salmonn: Towards generic hearing abilities for large language models.arXiv preprint arXiv:2310.13289, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:dc20e93c569cbe3bea55480201e26752036bc9da803d5e5da84ea81f546ee63a","observation_id":"e4af976e-d5d4-4f96-acf3-729c44b78b4e","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:184d4d65f7115aba029f41d0553e93d3d70ce79821993fb3d2c3615c413201da","observation_id":"a572e75a-d3b7-4493-aee3-20f497bcf805","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Music flamingo: Scaling music understanding in audio language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:dc6a313a6087a14dfacdd223d60d10a9caf5e9ed71b55e4807a8b31ee384c8d8","observation_id":"36686df0-b898-4084-857a-3298764186fc","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:8e7ab0721b3b2b0ea40af216161e72d3b034f4d7d65e97ea55b8c88f734df710","observation_id":"d53abd26-f7d9-44e5-90dd-5fd12224af35","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"CLAP learning audio concepts from natural language supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:53aa5b553d0d3c2bb10be1a9896da63dec51fbbeafa1ece5e7f1bdf8fce76080","observation_id":"30c12158-ca6c-4ecc-a762-e35f3f1fc86c","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:e2da5e10d56ec54d3863185f19c47091de899a5c07f43159551720a5047031f1","observation_id":"94b61a9c-e131-48c1-b4e2-060520a10fc2","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:0baa407a01080af1d180d4ca013abb9aa617810b460271447c4f76e589da6897","observation_id":"497bd5ba-8d1f-4666-bfaf-897214b33930","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Gemini: A family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:82def895376b16c18b13937436099b8358733a16fb38b274e1b259f1f5338d30","observation_id":"1f5c90b6-0282-4607-ad68-7e64290021a4","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01591","last_updated":"2025-05-17T22:03:39Z","snapshot_observed_at":"2026-07-06T17:24:24.953352Z","submitted_at":"2024-02-02T17:34:53Z","title":"BAT: Learning to Reason about Spatial Sounds with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01591","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Spatial-ast: Binaural audio spectrogram transformer.arXiv preprint arXiv:2402.01591, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2402.01591","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:e868673ebc542044055e4bced52f3fccabe703a3c3ca0cecb3604413b454fbcb","observation_id":"336152a5-29f1-4a4e-920f-705d969699a9","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"OWL: Geometry-aware spatial reasoning for audio large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:616584e28734a4fee137fa0d20c2f190a00580fb48e2d6c8f22670b3e58be852","observation_id":"2ea61db3-61a6-4c46-bf4c-b0a5f561e0a4","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Beats: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:d41337066389e858e29bcaad3b190f776ad8e1da8ed0ae7aaf60b402f3770641","observation_id":"2ecffda7-00fe-45b7-a76c-47f3f713826f","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Layer normalization.arXiv preprint arXiv:1607.06450, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:d44aa7a81d10c293dcb292d40c7dc6f2d592bdc4379361b6c51973399e3d454e","observation_id":"28e69ef7-b6e1-4c24-825a-25692626ab6e","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:4dc8ac5d684d75a1637ddbc194576a0ea2380491ce7cc940ecd4fcd06e61b2b4","observation_id":"9f877949-22cd-4c6c-8d34-dd75d76d6f98","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"GAMA: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:7af4e7e5b0d10da7b1d5e76fcd8a3d3aff6fd1c4be8e95c7d5ece1641bb3ccae","observation_id":"4f5ee3ff-fb0a-4882-869f-c9c097847636","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:1eb7f6910eae7a073b1f7e6180332b88bbb56a7de5895010a3c17bb3204c77bc","observation_id":"e7ef35ac-48f8-4aee-8447-9218db54996f","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 29:3451–3460, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:dbf5e8e0575b5f47dcea9dab6d08520a1075bcb4f5f30e2a352717488a569ee8","observation_id":"f8958af7-7a14-43f0-b15b-a33e8479c934","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.02954","last_updated":"2026-05-10T15:03:28Z","snapshot_observed_at":"2026-07-06T22:40:51.136169Z","submitted_at":"2026-01-06T11:54:47Z","title":"The World is Not Mono: Enabling Spatial Understanding in Large Audio-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.02954","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"The world is not mono: Enabling spatial understanding in large audio-language models.arXiv preprint arXiv:2601.02954, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2601.02954","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:a9639baa05ce15b130e12d07df46b5b489d8d45a419a2757709e4c431b951870","observation_id":"288b36cd-e95e-4b26-b3c7-663dd5b33071","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10924","last_updated":"2025-08-20T08:48:57Z","snapshot_observed_at":"2026-08-08T05:49:19.993515Z","submitted_at":"2025-08-08T09:03:13Z","title":"ASAudio: A Survey of Advanced Spatial Audio Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10924","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"ASAudio: A survey of advanced spatial audio research.arXiv preprint arXiv:2508.10924, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2508.10924","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:9370db8d0f889e3adbb135374813faea48952072740b9607434261b7250461e5","observation_id":"2365060b-cabb-408f-9874-a1a9419f67b2","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12042","last_updated":"2025-07-16T08:59:09Z","snapshot_observed_at":"2026-08-06T16:53:06.713004Z","submitted_at":"2025-07-16T08:59:09Z","title":"Stereo Sound Event Localization and Detection with Onscreen/offscreen Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12042","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Stereo sound event localization and detection with onscreen/offscreen classification","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2507.12042","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:81a56e335344b3f68cae80a7643b6446584e9d93971a0a9b788f9184d24c68e0","observation_id":"e47c89a9-877e-40db-96f1-b23ec854f35f","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07914","last_updated":"2024-06-14T10:42:12Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T06:34:21Z","title":"Can Large Language Models Understand Spatial Audio?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07914","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Can large language models understand spatial audio?arXiv preprint arXiv:2406.07914, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/2406.07914","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:5f6f6c7888633c497e77347c286288f1ef1134f4cea56477f768850ab1bf8fa2","observation_id":"6e08b097-96ae-4402-b35c-1dad1b6692ff","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"SA VVY: Spatial awareness via audio-visual LLMs through seeing and hearing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:135f95cd172d379fac51ee8634731be56f1690b2ac6cef183d620b7984aeb283","observation_id":"9747cc0e-34df-429c-8f0d-4d905ab203fc","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Phasecoder: Microphone geometry-agnostic spatial audio understanding for multimodal llms.arXiv preprint arXiv:2601.21124, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:d9e02336864ad13fdc83058fa78a1ba3696524e7a7d1d115e7e50d19122d77aa","observation_id":"97deb7aa-e88f-46e4-8513-950327ffe0dc","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Spatial audio question answering and reasoning on dynamic source movements.arXiv preprint arXiv:2509.14666, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:6273ec55416b308a25c0c54df9cd38131cd16a5dbff7732771324bd9729a5745","observation_id":"6f28fbe7-f804-44dc-ab79-3608fb686fa3","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Bartoldson, Bhavya Kailkhura, Avi Schwarzschild, Aniruddha Saha, Micah Goldblum, Jonas Geiping, and Tom Goldstein","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:460640c5f4dd03c0a647b59875b173f7780bc17d32a86f43b010979076eea92e","observation_id":"518c1d3a-3848-45ad-884b-85f7309e7a42","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Towards evaluating the robustness of neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:e34e1af22093bb84b278c844932da99a4b24ac44d79eaf06c1b6c0c86620fd82","observation_id":"7bb164e9-a4e6-4245-8a43-3beedb367c1a","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"The mechanism of stochastic resonance.Journal of Physics A: mathematical and general, 14(11):L453, 1981","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:01ed4561d05cd456504869f14c05f113eeebef9b1be65767f99ebfbe32a97492","observation_id":"a1c2482f-5d4a-4427-9747-b45d6f560001","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Dither in digital audio.Journal of the Audio Engineering Society, 35(12):966–975, 1987","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:23c9c334be20b286514480ef211f833ee78d81cb64b62b58decd1246f004ce71","observation_id":"69f37a8c-5c5d-4244-99fe-ee3c4b033bb6","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Sigmoid-weighted linear units for neural network function approximation in reinforcement learning.Neural Networks, 107:3–11, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:0d777db260e373b5855d3c4f8a972eed895ba9045ff0a031f6382029d8d8657e","observation_id":"09bfcea0-ab86-418c-bee0-f14c08f87e99","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-07-06T05:01:27.910364Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Gaussian error linear units (gelus).arXiv preprint arXiv:1606.08415, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:c5d8808eb8a633b50fe29ea341f21d4635e96dc1b84cc08b3f48375848e095d7","observation_id":"7bc366f8-9b8d-4759-abe9-65c5094df11e","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Shortcut learning in deep neural networks.Nature Machine Intelligence, 2(11):665–673, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:12177422b393373335c9c35c22819cd2dede9cb31c827ee05887d615b3e7c588","observation_id":"ce3c7165-0008-48e8-8bf3-161b41e1ef33","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Gemmeke, Daniel P","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:91976d58305eced01a0989bcc0ea1facfdca814095c07361fd45df12e0f1df51","observation_id":"c640400b-f969-43d3-85a7-05fb7fd6e319","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"QLoRA: Efficient finetuning of quantized LLMs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:892b53532a1cf5a3add83c3e9f4c792e4c8c4d15f9475ef4e1a96a4a1129160e","observation_id":"f905f1b8-2603-4fbe-9f0c-cb9e500d2ed5","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-13T06:40:47.064894Z","title":"Music” and “Speech","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-13T06:40:47.064894Z"},"links":{"citing_paper":"/paper/2607.08800"},"observation_digest":"sha256:63e199fd25c0aae41896e482f47811c54b61a08625c9a0c4e7d5d6dc277905e9","observation_id":"98df9a73-031f-4871-ae1a-18a7d6c17776","resolution":{"observed_at":"2026-07-13T06:40:47.064894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.08800","last_updated":"2026-07-09T03:10:16Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T21:35:03.515361Z","submitted_at":"2026-07-09T03:10:16Z","title":"Dual-BEATs: Unlocking Zero-Shot Stereo Audio Perception in Audio Large Language Models via Dithering"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.08800."}