{"as_of":"2026-08-09T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fe57786931ac2e201356c40c1988471b1a38bbc6d81b46aae1b3ba281e6d165f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":45,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:05:52.235239Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-08T00:04:22.466366Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-11T08:52:31.686474Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2501.09747"},"observation_digest":"sha256:9874a028f52b743bae7d4d7e8666d2a92ba43d2ecf3e60e2ff3c801070f99a3d","observation_id":"0fd8edf6-6bcf-447c-a786-d6886f7d1814","resolution":{"observed_at":"2026-05-11T08:52:31.926052Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-09T18:05:52.235239Z","title":"Beats: Audio pre-training with acoustic tokenizers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00718","last_updated":"2025-07-10T14:44:44Z","snapshot_observed_at":"2026-08-09T17:56:41.707033Z","submitted_at":"2025-02-02T08:36:23Z","title":"\"I am bad\": Interpreting Stealthy, Universal and Robust Audio Jailbreaks in Audio-Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T18:05:52.235239Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2502.00718"},"observation_digest":"sha256:541d4214041d8737be23bf35c28e0ac507db655786477fff9a3fda30e8de8157","observation_id":"21115587-0540-47a4-9271-0a6430d890cd","resolution":{"observed_at":"2026-08-09T18:05:52.235239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-08T14:47:07.989640Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.06664","last_updated":"2025-02-24T10:07:54Z","snapshot_observed_at":"2026-08-08T14:41:57.380685Z","submitted_at":"2025-02-10T16:51:11Z","title":"Evaluation of Deep Audio Representations for Hearables","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:47:07.989640Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2502.06664"},"observation_digest":"sha256:dc215f24e59cc221b50a9500e88a75fc65e2644b4ce82b4c081f264a634f608b","observation_id":"9ba18c47-ad51-489b-a2ad-5cbd56f2e8e3","resolution":{"observed_at":"2026-08-08T14:47:07.989640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:05:15.772955Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.16369","last_updated":"2025-05-27T06:49:39Z","snapshot_observed_at":"2026-08-09T02:59:05.011197Z","submitted_at":"2025-05-22T08:23:54Z","title":"X-ARES: A Comprehensive Framework for Assessing Audio Encoder Performance","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.772955Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.16369"},"observation_digest":"sha256:08f031904240324a885c2a0b45a1e7d077bdecce0531f75e647f9228a305b114","observation_id":"7beb06ff-c36e-4a0f-a60f-e687ac17af26","resolution":{"observed_at":"2026-08-07T15:05:15.772955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:43:05.080883Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17076","last_updated":"2025-06-13T17:21:25Z","snapshot_observed_at":"2026-08-07T23:08:52.484966Z","submitted_at":"2025-05-20T06:01:19Z","title":"Impact of Frame Rates on Speech Tokenizer: A Case Study on Mandarin and English","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:43:05.080883Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.17076"},"observation_digest":"sha256:c88d153c5fe1e6fa5816969673186a85315681ca7ec14092f88df830427271f2","observation_id":"44c14ae2-aab0-4e07-b60d-3d12d1b66ed7","resolution":{"observed_at":"2026-08-07T15:43:05.080883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T15:19:10.885941Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17114","last_updated":"2025-09-05T17:40:14Z","snapshot_observed_at":"2026-08-09T12:54:04.107707Z","submitted_at":"2025-05-21T14:33:36Z","title":"RAVEN: Query-Guided Representation Alignment for Question Answering over Audio, Video, Embedded Sensors, and Natural Language","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:19:10.885941Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.17114"},"observation_digest":"sha256:6cf5dbd4be805c3400e66ce01230174a12fee7ab8512f5be972d1ca20e89fd65","observation_id":"4df0c23c-75af-4104-9e04-af14abb2e49d","resolution":{"observed_at":"2026-08-07T15:19:10.885941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T14:33:48.281447Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18517","last_updated":"2025-05-24T05:28:22Z","snapshot_observed_at":"2026-08-09T04:18:06.978746Z","submitted_at":"2025-05-24T05:28:22Z","title":"LiSTEN: Learning Soft Token Embeddings for Neural Audio LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:33:48.281447Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.18517"},"observation_digest":"sha256:8afdd92bd64470da3bc302ceb9dd05c22fb408292073b010b142f4b19d2c5166","observation_id":"e0ee79de-2d55-4c4a-9c8b-f63aba10c8d7","resolution":{"observed_at":"2026-08-07T14:33:48.281447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-07T13:46:40.632711Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20961","last_updated":"2025-05-27T09:56:16Z","snapshot_observed_at":"2026-08-08T07:05:09.085449Z","submitted_at":"2025-05-27T09:56:16Z","title":"Efficient and Microphone-Fault-Tolerant 3D Sound Source Localization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:46:40.632711Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2505.20961"},"observation_digest":"sha256:65038a0f6e0b920097f919a9ab22f2ee0ddda4954dece9770ca2205cbc90514b","observation_id":"1c2b0f6c-cf99-4bb2-b38e-37f4ea4a29c6","resolution":{"observed_at":"2026-08-07T13:46:40.632711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T23:41:49.677614Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.17351","last_updated":"2025-06-20T01:28:43Z","snapshot_observed_at":"2026-08-08T18:40:49.656734Z","submitted_at":"2025-06-20T01:28:43Z","title":"Zero-Shot Cognitive Impairment Detection from Speech Using AudioLLM","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:49.677614Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2506.17351"},"observation_digest":"sha256:ea39f79f0c25cd1860e61e64b02b456f5645d5167548abd89c8b4cb490f8f932","observation_id":"d39d2e9c-6acf-4e67-9491-54518e61f564","resolution":{"observed_at":"2026-08-06T23:41:49.677614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T19:46:10.747215Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-09T02:06:38.978195Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:10.747215Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:c888b2461b36b1168523817fd64c9609c5919976b2d5c83a54e0c9cb4a56d476","observation_id":"9917f026-aa6d-414f-b692-c025fa093fe7","resolution":{"observed_at":"2026-08-06T19:46:10.747215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T17:46:13.348025Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10109","last_updated":"2025-07-14T09:50:53Z","snapshot_observed_at":"2026-08-08T02:46:03.641224Z","submitted_at":"2025-07-14T09:50:53Z","title":"DualDub: Video-to-Soundtrack Generation via Joint Speech and Background Audio Synthesis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:46:13.348025Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.10109"},"observation_digest":"sha256:a21bbdbee37c457c352cabc3d044036c326d67e9043fbe22ab493c54a98de960","observation_id":"e6801440-a98a-4f92-acfd-75a1da97f3bc","resolution":{"observed_at":"2026-08-06T17:46:13.348025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T16:47:34.333552Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12701","last_updated":"2025-07-17T00:32:07Z","snapshot_observed_at":"2026-08-08T13:02:50.918593Z","submitted_at":"2025-07-17T00:32:07Z","title":"Task-Specific Audio Coding for Machines: Machine-Learned Latent Features Are Codes for That Machine","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T16:47:34.333552Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.12701"},"observation_digest":"sha256:aff5d1c1916723a4e2674229f9fd783e4dbbbfb4278062f54fb20ebc7b9c5f02","observation_id":"043fba0e-52af-41da-b7cc-98f402ff4421","resolution":{"observed_at":"2026-08-06T16:47:34.333552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:5e84aa920db55bd1b9642c991cf4f3c648ca9eb5b74f34d958401f57cabd492f","observation_id":"cc072def-b9ec-4f42-bd4c-f70984df4af5","resolution":{"observed_at":"2026-05-16T05:59:50.976241Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T05:02:24.509860Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-08T01:53:05.709859Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.509860Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6bd8e23c529cdae7660b41110c5f5d1d8d8d5cf6601457cdfa0972928db8765d","observation_id":"d32b479c-3c7f-4f03-9026-72d988877b7b","resolution":{"observed_at":"2026-08-06T05:02:24.509860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:51:29.678062Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.04195","last_updated":"2025-08-06T08:25:26Z","snapshot_observed_at":"2026-08-06T17:34:54.346667Z","submitted_at":"2025-08-06T08:25:26Z","title":"NVSpeech: An Integrated and Scalable Pipeline for Human-Like Speech Modeling with Paralinguistic Vocalizations","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T00:51:29.678062Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04195"},"observation_digest":"sha256:b374ae91d624a1246d5430ecc82833a7b2b79dbbf3af896c8359acf4083cb535","observation_id":"f7251430-0160-4158-b836-a7496021ba59","resolution":{"observed_at":"2026-08-06T00:51:29.678062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:01:17.525381Z","title":"In AAAI, volume 39, 15567–15575","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04416","last_updated":"2025-09-03T07:11:03Z","snapshot_observed_at":"2026-08-09T07:51:37.523530Z","submitted_at":"2025-08-06T13:03:21Z","title":"Thinking With Videos: Multimodal Tool-Augmented Reinforcement Learning for Long Video Reasoning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:01:17.525381Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04416"},"observation_digest":"sha256:262c5e013ab74a69b81551189ebe81cf947cdbc861bb1e27b7b0a9a4c1f957f2","observation_id":"0fc7d1e3-6c86-42ca-a4ee-6686936fc6ae","resolution":{"observed_at":"2026-08-06T00:01:17.525381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T00:04:54.793915Z","title":"In AAAI, volume 39, 15567–15575","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.04418","last_updated":"2025-08-06T13:05:09Z","snapshot_observed_at":"2026-08-07T15:28:01.237780Z","submitted_at":"2025-08-06T13:05:09Z","title":"Think Before You Segment: An Object-aware Reasoning Agent for Referring Audio-Visual Segmentation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:04:54.793915Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.04418"},"observation_digest":"sha256:28098c739ae5adadd1a7b9cdf4065bef4f0ea7a441150666411c4e70a9ea3e2c","observation_id":"22662b78-6232-4296-82c8-475b2160c9ad","resolution":{"observed_at":"2026-08-06T00:04:54.793915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T23:32:18.136571Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-09T09:33:06.733360Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:18.136571Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:412fb98e5ba3f39c03046eee5e4f97f1700fb7a515c5e0d94bd649900bed479c","observation_id":"9463a595-eb51-4039-85fc-e466eb461fa9","resolution":{"observed_at":"2026-08-05T23:32:18.136571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T17:57:32.271114Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15429","last_updated":"2025-08-21T10:30:01Z","snapshot_observed_at":"2026-08-07T06:19:10.166447Z","submitted_at":"2025-08-21T10:30:01Z","title":"AudioSet-R: A Refined AudioSet with Multi-Stage LLM Label Reannotation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:57:32.271114Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.15429"},"observation_digest":"sha256:0dd6de199f5d136989cc0f100a853bd870406fd2374e77da00859c4f1170833f","observation_id":"4d40ba64-a9e4-4823-8020-9045121195db","resolution":{"observed_at":"2026-08-05T17:57:32.271114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T11:17:54.443943Z","title":"Beats: Au- dio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.02969","last_updated":"2025-09-03T03:14:23Z","snapshot_observed_at":"2026-08-09T15:33:15.778335Z","submitted_at":"2025-09-03T03:14:23Z","title":"VQualA 2025 Challenge on Engagement Prediction for Short Videos: Methods and Results","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:17:54.443943Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2509.02969"},"observation_digest":"sha256:b07bbb7f9986e0c3fbbbb5db1b21e3355eead68db61c435de42bdc305fa61929","observation_id":"88a4edce-cff7-4396-89c3-402c0ff4e7df","resolution":{"observed_at":"2026-08-05T11:17:54.443943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-04T11:29:30.654795Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.04593","last_updated":"2026-06-08T05:49:30Z","snapshot_observed_at":"2026-08-06T08:55:28.794308Z","submitted_at":"2025-10-06T08:47:38Z","title":"UniVoice: Unifying Autoregressive ASR and Flow-Matching based TTS with Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:29:30.654795Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2510.04593"},"observation_digest":"sha256:596b3d0c85fb503c0a6c913c9d620aaf6ab908037c6b526b0573d3947b49244a","observation_id":"be8b3450-5551-4e9d-97c3-ecd45d3e549a","resolution":{"observed_at":"2026-08-04T11:29:30.654795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-04T00:29:45.976102Z","title":"Beats: Audio pre-training with acoustic tokenizers, 2022 b","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.05550","last_updated":"2026-05-26T23:40:49Z","snapshot_observed_at":"2026-08-05T14:57:28.629677Z","submitted_at":"2025-11-02T18:08:26Z","title":"Assessing Factual Music Comprehension in Large Audio Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T00:29:45.976102Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2511.05550"},"observation_digest":"sha256:c26906f216775a8ed25563092917e9d9fd417dbd3ecaabbec580962fb5e36531","observation_id":"dc38e2c6-390a-4c8f-b3a3-9680f939ff1f","resolution":{"observed_at":"2026-08-04T00:29:45.976102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T21:42:47.142235Z","title":"BEATs: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-06T18:33:53.894178Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:47.142235Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:bdddb2d81fd9c0826d7007f39836dd0ecbe3dd88f5e826ce939b23aaf07dfae1","observation_id":"560dcc23-698d-4244-813f-07ce1600afe7","resolution":{"observed_at":"2026-08-03T21:42:47.142235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T17:16:36.790900Z","title":"Beats: Audio pre- training with acoustic tokenizers.arXiv:2212.09058, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2512.10324","last_updated":"2026-06-22T06:41:41Z","snapshot_observed_at":"2026-08-03T17:16:35.340426Z","submitted_at":"2025-12-11T06:18:58Z","title":"EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T17:16:36.790900Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2512.10324"},"observation_digest":"sha256:63e6a7b3b1caeeab209da0bed2d76d3bdbdd3bccaa6de547f32795815fc4c5dc","observation_id":"3e716b4b-02e4-436e-8cbf-b5b1995e2786","resolution":{"observed_at":"2026-08-03T17:16:36.790900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T10:53:15.264765Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.08480","last_updated":"2026-06-30T06:17:39Z","snapshot_observed_at":"2026-08-07T22:08:02.763541Z","submitted_at":"2026-01-13T12:12:29Z","title":"Quantitative Analysis of Proxy Tasks for Anomalous Sound Detection","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T10:53:15.264765Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2601.08480"},"observation_digest":"sha256:0c016d2eaf327bc6d982ed9a7d8b5f6c05b58586247ecd02ea17478bdf4dc918","observation_id":"0ee47b9f-1b44-48b2-b38b-b9af80c234d7","resolution":{"observed_at":"2026-08-03T10:53:15.264765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.06702","last_updated":"2026-04-08T05:42:03Z","snapshot_observed_at":"2026-07-06T22:55:06.424752Z","submitted_at":"2026-04-08T05:42:03Z","title":"ULTRAS -- Unified Learning of Transformer Representations for Audio and Speech Signals","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T18:30:30.431777Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.06702"},"observation_digest":"sha256:b09da1608f59173a9d3510278fc7583720f940f21bc81f64225d16cdbaa4be5b","observation_id":"e8c87b1f-9aa7-4e45-826a-1b53a4dda16e","resolution":{"observed_at":"2026-05-11T00:30:50.864486Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.14129","last_updated":"2026-04-15T17:51:28Z","snapshot_observed_at":"2026-07-06T23:02:00.082783Z","submitted_at":"2026-04-15T17:51:28Z","title":"Don't Let the Video Speak: Audio-Contrastive Preference Optimization for Audio-Visual Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T13:57:47.356373Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.14129"},"observation_digest":"sha256:694b2b3c5642fe602ae0bd975040ec42ca5bd7fb279dd45284bb131e34f76867","observation_id":"f0e867ad-df14-4bcb-a331-78aa73ff8341","resolution":{"observed_at":"2026-05-10T14:00:28.946896Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.15849","last_updated":"2026-04-17T08:57:44Z","snapshot_observed_at":"2026-07-06T23:03:16.345488Z","submitted_at":"2026-04-17T08:57:44Z","title":"TinyMU: A Compact Audio-Language Model for Music Understanding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-10T08:17:23.740979Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.15849"},"observation_digest":"sha256:742c2a7738ec460ace62cad904981d4d30422cdb74d009e647bbf96857682b8a","observation_id":"bc82c1a8-7dd8-41eb-ae7c-23fcade130d1","resolution":{"observed_at":"2026-05-10T08:17:36.935059Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.15929","last_updated":"2026-05-18T12:22:43Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:39:01Z","title":"MUSCAT: MUltilingual, SCientific ConversATion Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-10T09:20:22.200577Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.15929"},"observation_digest":"sha256:84d2e1de18d5a42716305393b14905e3605c8f511d836edc67a109564048c317","observation_id":"b07ddca6-efdf-41f7-bd4e-e639700fdbb5","resolution":{"observed_at":"2026-05-10T09:23:37.191807Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.15929","last_updated":"2026-05-18T12:22:43Z","snapshot_observed_at":"2026-07-06T23:03:21.422544Z","submitted_at":"2026-04-17T10:39:01Z","title":"MUSCAT: MUltilingual, SCientific ConversATion Benchmark","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T00:45:01.115573Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.15929"},"observation_digest":"sha256:08968d6c35e56c1450d9ec422c25992bdddddf9a2ebcfe77aa35431fb3c8e634","observation_id":"a0570288-70ac-4bfc-8f51-75240f384f19","resolution":{"observed_at":"2026-05-21T00:49:19.547770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2604.18460","last_updated":"2026-04-20T16:16:36Z","snapshot_observed_at":"2026-07-06T23:05:17.639285Z","submitted_at":"2026-04-20T16:16:36Z","title":"Learning Invariant Modality Representation for Robust Multimodal Learning from a Causal Inference Perspective","version":1},"reference_index":291,"source":"arxiv_source","source_observed_at":"2026-05-10T04:32:29.428080Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2604.18460"},"observation_digest":"sha256:407f3e0180047c506a38fb06b89182c542aeef112b551fd3bbbab6dbb6769daf","observation_id":"c413f0d0-e26d-49e0-803b-013725d60ad6","resolution":{"observed_at":"2026-05-11T11:51:03.124351Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2605.06357","last_updated":"2026-05-07T14:35:04Z","snapshot_observed_at":"2026-08-08T14:20:01.894187Z","submitted_at":"2026-05-07T14:35:04Z","title":"Memory Efficient Full-gradient Attacks (MEFA) Framework for Adversarial Defense Evaluations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-08T12:53:11.185208Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2605.06357"},"observation_digest":"sha256:8e68df5c3089cc632a2057ec1c7b2f4e2db530da01d492a6892f98fa28feaba8","observation_id":"5721e150-1e14-4978-a682-d84a42bec402","resolution":{"observed_at":"2026-05-11T19:01:18.489162Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2605.13672","last_updated":"2026-05-13T15:32:57Z","snapshot_observed_at":"2026-08-02T22:33:46.962628Z","submitted_at":"2026-05-13T15:32:57Z","title":"SpurAudio: A Benchmark for Studying Shortcut Learning in Few-Shot Audio Classification","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-14T20:31:49.239866Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2605.13672"},"observation_digest":"sha256:92eb515ff2caee439182c20f57009a083613680eee69fa926b32b44dc1c7e0d6","observation_id":"137c5f66-8d64-444b-85bf-8641c9512bbe","resolution":{"observed_at":"2026-05-14T20:32:57.059110Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2605.26641","last_updated":"2026-05-26T07:26:23Z","snapshot_observed_at":"2026-08-06T17:24:19.284916Z","submitted_at":"2026-05-26T07:26:23Z","title":"OmniRetriever: Any-to-Any Audio-Video-Text Retrieval via Fusion-as-Teacher Distillation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-29T18:08:50.574960Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2605.26641"},"observation_digest":"sha256:2e5bfa3631b79141f32be8bc23d473a383395440f25e1effffc714726f2f35eb","observation_id":"bd003016-04bf-488f-a810-4d272627b8f3","resolution":{"observed_at":"2026-06-29T18:13:48.563590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2606.03821","last_updated":"2026-06-30T13:17:03Z","snapshot_observed_at":"2026-08-01T16:26:57.690975Z","submitted_at":"2026-06-02T16:01:22Z","title":"Finding Needles in the Haystack: Transductive Active Labeling in Ecology","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T10:52:23.274642Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2606.03821"},"observation_digest":"sha256:6c6985dc3ce2c6ba35f981d65afcbc03d5fe26a2a04d1d682ea48e0178a52710","observation_id":"87328366-cfcc-4fad-a0ae-6cf828e5d1b3","resolution":{"observed_at":"2026-07-02T02:26:27.405444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2606.03821","last_updated":"2026-06-30T13:17:03Z","snapshot_observed_at":"2026-08-01T16:26:57.690975Z","submitted_at":"2026-06-02T16:01:22Z","title":"Finding Needles in the Haystack: Transductive Active Labeling in Ecology","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-01T07:48:01.274555Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2606.03821"},"observation_digest":"sha256:a4bc13b0e044ec9a60ce7444d01927bc83640648267079619a44a3c5bf17692f","observation_id":"2dcc5b3f-0b7e-46cd-947b-6663208e311c","resolution":{"observed_at":"2026-07-01T07:55:31.231791Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2607.00387","last_updated":"2026-07-01T03:32:08Z","snapshot_observed_at":"2026-08-01T10:46:33.437238Z","submitted_at":"2026-07-01T03:32:08Z","title":"From Objectives to Applications: Aligning Architectural Biases in Audio Self-Supervised Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-02T05:52:55.818877Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.00387"},"observation_digest":"sha256:9b258c63c2677688fa1a1b22ab7a792100fca1791665b9042aafdfe3c6f1c9fa","observation_id":"f7a930f7-f2ed-43c5-8098-c40fa06e921e","resolution":{"observed_at":"2026-07-02T05:56:39.917414Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-12T03:24:13.814557Z","title":"https://doi.org/10.48550/ arXiv.2212.09058, http://arxiv.org/abs/2212.09058, arXiv:2212.09058 [eess]","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03304","last_updated":"2026-07-03T13:16:30Z","snapshot_observed_at":"2026-08-06T16:38:09.160220Z","submitted_at":"2026-07-03T13:16:30Z","title":"Adaptive Loss Balancing for Multi-Task Bioacoustic Classification of Bird Species and Call Types","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-12T03:24:13.814557Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.03304"},"observation_digest":"sha256:dbadf3938ce159b873207baf082e528fe4e9b7362e1ee8f85658171e27699941","observation_id":"e9834dc0-8da9-4b02-8df1-75ca93cd477b","resolution":{"observed_at":"2026-07-12T03:24:13.814557Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":"2212.09058","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-08T00:04:22.466366Z","title":"Wei-Lin Chiang, Zhuohan Li, Zi Lin, Ying Sheng, Zhanghao Wu, Hao Zhang, Lianmin Zheng, Siyuan Zhuang, Yonghao Zhuang, Joseph E Gonzalez, et al","venue":"eess.AS","work_id":"6fa1caca-8b5c-4837-97d3-f7a701a963d6","year":2022},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":274,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:a4b0271b9eaa993ff351287d8eb9bab3a71f69606214550119aa5f70a7ad2eb3","observation_id":"5ea85c91-d981-4e74-9f00-cad0e7b98f56","resolution":{"observed_at":"2026-07-08T00:04:22.467634Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:2212.09058 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-08-09T15:40:13.197295Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":274,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:d8886f1d337cfcac38825bd78d92b515a0c07379eb13ebad0c4c4c7959726f22","observation_id":"fb69bebd-0691-40d1-99ec-d89a0164e2c9","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-14T11:52:50.598080Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10421","last_updated":"2026-07-11T17:59:32Z","snapshot_observed_at":"2026-08-07T22:08:00.566907Z","submitted_at":"2026-07-11T17:59:32Z","title":"FdAudio: MeanFlow-Anchored Fr\\'echet-Distance Post-Training for One-Step Text-to-Audio Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T11:52:50.598080Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.10421"},"observation_digest":"sha256:041cf4877d36ec7db83bea1364c4efb81b745ad1bfdff40f94493d39bf312af4","observation_id":"35666e69-0923-4e17-9b60-173abe7283e8","resolution":{"observed_at":"2026-07-14T11:52:50.598080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-02T02:03:37.761113Z","title":"Proceedings of the 40th","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14474","last_updated":"2026-07-16T01:37:39Z","snapshot_observed_at":"2026-08-08T13:45:48.611646Z","submitted_at":"2026-07-16T01:37:39Z","title":"Can Tokens Compete? Token Representations against Supervised CNN Backbones for BirdCLEF+ 2026","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-02T02:03:37.761113Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.14474"},"observation_digest":"sha256:4f1e2b53b117caae1179e0e6f24601f9334011d7cd89aa2218d1f06136041203","observation_id":"11f819c1-a7d3-476d-9f32-67771820b54c","resolution":{"observed_at":"2026-08-02T02:03:37.761113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-07-30T10:35:03.133791Z","title":"BEATs: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-08T08:33:39.848789Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-30T10:35:03.133791Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:ec483cf7b048a713342c574eb21d6ee06d15f5a7f3f391259694a62c9f994736","observation_id":"9b447bf8-04ab-4d19-b867-a62cfef7b3a3","resolution":{"observed_at":"2026-07-30T10:35:03.133791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-03T01:51:00.418732Z","title":"BEATs: Audio pre-training with acoustic tokenizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23855","last_updated":"2026-07-31T15:34:14Z","snapshot_observed_at":"2026-08-08T08:33:39.848789Z","submitted_at":"2026-07-26T21:51:28Z","title":"OmniVAE: An Audio-Video VAE with Cross-Modal Alignment for Joint Generation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T01:51:00.418732Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2607.23855"},"observation_digest":"sha256:1006b2e3b4daa101138a7b459a7837a42bfcb5275d924e8c0f1512b2801a91ca","observation_id":"3cdad4a4-601b-452a-afb4-4458397ec441","resolution":{"observed_at":"2026-08-03T01:51:00.418732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-05T00:54:45.434431Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.00493","last_updated":"2026-08-01T07:32:54Z","snapshot_observed_at":"2026-08-08T02:53:16.735340Z","submitted_at":"2026-08-01T07:32:54Z","title":"Hidden-Domain Routing for All-Type Audio Deepfake Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T00:54:45.434431Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2608.00493"},"observation_digest":"sha256:7679cb6af1f266d3a13b84a963a01f19f0e652c31a166d75bf014269420f5939","observation_id":"6b1606f0-2d5d-4d48-9dd8-a5d38a722a5e","resolution":{"observed_at":"2026-08-05T00:54:45.434431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2212.09058/citation-record","integrity":"/paper/2212.09058/integrity","json":"/paper/2212.09058/citation-record.json","paper":"/paper/2212.09058"},"outbound":[],"paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T22:06:19.360625Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 45 inbound Pith citation observations for arXiv:2212.09058."}