{"as_of":"2026-08-20T10:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c011d8b2319d737ff503340342332b766db3d992473e03b50f5fd397de52d9ca","coverage":[{"denominator":71,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":71,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:28:45.760195Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:29:37.954753Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T20:58:15.805732Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2506.05140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiolens: A closer look at auditory attribute percep- tion of large audio-language models","venue":null,"work_id":"8dd24cf8-e623-4632-8803-7781e663564e","year":2025},"citing_paper":{"arxiv_id":"2604.02605","last_updated":"2026-04-03T00:48:49Z","snapshot_observed_at":"2026-07-31T12:45:01.220506Z","submitted_at":"2026-04-03T00:48:49Z","title":"Do Audio-Visual Large Language Models Really See and Hear?","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-13T20:56:19.815569Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2604.02605"},"observation_digest":"sha256:a6b436aca7b2d37a0e599924216805cbaefe5b4754d8c0a2e1bb693d1a045e76","observation_id":"4b4c16e3-ffa9-4279-b092-f29e7075d693","resolution":{"observed_at":"2026-05-13T20:58:15.807264Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2506.05140","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiolens: A closer look at auditory attribute percep- tion of large audio-language models","venue":null,"work_id":"8dd24cf8-e623-4632-8803-7781e663564e","year":2025},"citing_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-08-15T03:10:55.387410Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-07T17:39:38.234052Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2604.24401"},"observation_digest":"sha256:b9198ece916d66d11554405f5de9b08c807cfe61e07286e5fb387475cc35f3f8","observation_id":"8c896b53-acc0-4529-9cc0-d8c7d500e765","resolution":{"observed_at":"2026-05-11T23:16:36.162279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-07-11T23:50:12.369547Z","title":"Audiolens: A closer look at auditory attribute perception of large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03806","last_updated":"2026-07-04T10:27:18Z","snapshot_observed_at":"2026-08-13T00:32:17.358952Z","submitted_at":"2026-07-04T10:27:18Z","title":"Probing Low-Level Acoustic Attribute Encoding in CLAP Audio Embeddings","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T23:50:12.369547Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2607.03806"},"observation_digest":"sha256:91f367e6ada808d3107d4c13ae9190fc1a953c15b8e89f8ee55bf0cc737930bc","observation_id":"81c5aee3-dbe6-4897-8bb8-a06c1a164750","resolution":{"observed_at":"2026-07-11T23:50:12.369547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-08-10T04:32:31.824223Z","title":"AudioLens: A closer look at auditory attribute perception of large audio-language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06409","last_updated":"2026-08-03T17:34:33Z","snapshot_observed_at":"2026-08-14T11:38:26.117081Z","submitted_at":"2026-08-03T17:34:33Z","title":"Separating Decision-Rule Misalignment from Readout-Coverage Limitations in Speech Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T04:32:31.824223Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2608.06409"},"observation_digest":"sha256:d954f39355b651e038081a139394777bbfaefb896eb934ad05bcbf8f188caf4d","observation_id":"9b8cb20c-c684-4561-851e-9dbd9768238f","resolution":{"observed_at":"2026-08-10T04:32:31.824223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05140","snapshot_observed_at":"2026-08-14T04:29:37.954753Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.08772","last_updated":"2026-08-09T15:42:55Z","snapshot_observed_at":"2026-08-20T00:26:05.676128Z","submitted_at":"2026-08-09T15:42:55Z","title":"Multilingual Emotion Neurons in Large Audio-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-14T04:29:37.954753Z"},"links":{"cited_paper":"/paper/2506.05140","citing_paper":"/paper/2608.08772"},"observation_digest":"sha256:45bd26bef5ec41225ad38f962ac50c156c532c668e04ff5a358147dc07414480","observation_id":"c046baf5-8646-49bd-a110-8e7a730758c2","resolution":{"observed_at":"2026-08-14T04:29:37.954753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05140/citation-record","integrity":"/paper/2506.05140/integrity","json":"/paper/2506.05140/citation-record.json","paper":"/paper/2506.05140"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-14T10:40:26.323157Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-07T10:28:39.289563Z","title":"A survey of large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.289563Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:ad649e23c6b9eaf5505963424c0c1df5080afc2834af10b95cf6a420d1cf4415","observation_id":"d255a0df-3d68-409c-b1c0-c4e4b494e658","resolution":{"observed_at":"2026-08-07T10:28:39.289563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:28:39.368889Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.368889Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:68145cf95363fec4a216a763acb28c751b6c15c7fbf01a483546563c7664fcfd","observation_id":"09a13ad8-30a3-4816-90a7-3fe3e762fe76","resolution":{"observed_at":"2026-08-07T10:28:39.368889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T10:28:39.425083Z","title":"Gpt-4o system card,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.425083Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:5c4179980ee829a7e54cd0120c9579dc7e9be4e1d3a1897d813ec2c0735b076a","observation_id":"3e11c524-40f8-470b-ace5-40f1b20f116c","resolution":{"observed_at":"2026-08-07T10:28:39.425083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.358065Z","title":"Listen, think, and understand,","venue":null,"work_id":"08c4b39e-8280-4916-85f4-7c4d81f66b7b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.511419Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d15a4e5eaf9a4340d6ee54fbaf4f02ec9164be36b58205915f4eee9b60e64b3e","observation_id":"74343a86-4951-42cf-b9ba-192289de4466","resolution":{"observed_at":"2026-08-07T10:28:56.449419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T10:28:39.609105Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.609105Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:8e018ddc792786f5e730318b9e5fcd28f9499bd5356a8764f57d3fa5e3f7266b","observation_id":"06c2db3d-8dc4-43c5-93ed-13457067cb84","resolution":{"observed_at":"2026-08-07T10:28:39.609105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-08-14T01:27:16.843576Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T10:28:39.675867Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.675867Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:aa116100385239c967629f68d5275547bbcb31075f60438122d37ac5b9fb5f06","observation_id":"f9d1cb11-b26b-4789-89c6-6ab6f631035e","resolution":{"observed_at":"2026-08-07T10:28:39.675867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:56.155174Z","title":"Developing instruction-following speech language model without speech instruction-tuning data,","venue":null,"work_id":"30f71d0c-a54a-4f05-9916-3d8461e7e784","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.744849Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:8642359342ab4fe491fe9e0c534618bfd264c00eb488f718b91ed78b7dd22edc","observation_id":"0aa6d605-d714-4d2c-aec3-1d12316476a5","resolution":{"observed_at":"2026-08-07T10:28:56.244037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.980480Z","title":"Gama: A large audio- language model with advanced audio understanding and complex rea- soning abilities,","venue":null,"work_id":"e9dd4c44-4d7f-444b-8734-7d6f11e36bf0","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.817469Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:97f548261345b554a7955d0278e930972c1c66f5e889d8a76654d7cacfe92b9b","observation_id":"268f2fec-eaef-4029-b141-05f4e0660226","resolution":{"observed_at":"2026-08-07T10:28:56.069942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.762268Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"3a42835f-87f4-4c56-9dd0-221a3a0dda8b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.893515Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:8c2e38852d38d2f02765a15f89fbb4a1e474521743f50dd10d6d463dba6ab76a","observation_id":"e83d794b-92f2-4d92-bab5-8f4112697b21","resolution":{"observed_at":"2026-08-07T10:28:55.881715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.544973Z","title":"Speech- copilot: Leveraging large language models for speech processing via task decomposition, modularization, and program generation,","venue":null,"work_id":"d3dc1f8e-4d65-478e-9e60-713663df0937","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:39.944369Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d3abc6026a90935606fe779bc0a682b24ae44f158377c8e10092bc6e44420ba9","observation_id":"b1ef3cf5-5cc5-493c-b006-a94f6d3ef0fe","resolution":{"observed_at":"2026-08-07T10:28:55.670146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.375762Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"80d8b51b-2847-4379-ace6-c55a088d7a75","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.030275Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:c0defb0733084e84e983c567017701b011b83a8101816423f8bbbaf82eb2c38f","observation_id":"80086a8e-fdc5-4f4e-a2bb-53e7a2c60d6c","resolution":{"observed_at":"2026-08-07T10:28:55.460892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:55.210390Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":"8b5fbc54-a9ba-49c7-9742-ec9a603e9f72","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.127663Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:921eb359b76dce571ad29bd28db13877d3b970f79f75de5ff851bda1afeb310b","observation_id":"42ea304d-b4fb-4fa3-a560-e4a5fcde6884","resolution":{"observed_at":"2026-08-07T10:28:55.289586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.988786Z","title":"Blsp-emo: Towards empathetic large speech-language models,","venue":null,"work_id":"315a19dd-6111-40fd-90e6-f56b63bb0ded","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.209530Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:adfcce51c4d40defa2be1f1a03ce460475984ff006f0f2d464983adc62f9920a","observation_id":"7288f801-6165-4eab-aa62-3ccff0ea25e8","resolution":{"observed_at":"2026-08-07T10:28:55.099265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.804136Z","title":"Wavllm: Towards robust and adaptive speech large language model,","venue":null,"work_id":"8ff768e8-edaa-4d85-917d-49a6c07ca4c1","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.279680Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:1ea6b3fbfe6ee564c8e98e56b5b6b255dc5d0e5e88e3de4959621203efb73431","observation_id":"d3296e3e-e49b-46ab-8237-1dc6ffb0ccf7","resolution":{"observed_at":"2026-08-07T10:28:54.892249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.647798Z","title":"Dynamic-SUPERB phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"6d1a9a1d-d763-4596-8638-32bbb11285cf","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.359251Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:780fb41ebed75871ec6d3f9505903619acfbbf3c26260c09f244d4fbdce81a13","observation_id":"d6326ed4-33da-4b47-a841-0c12665efe2a","resolution":{"observed_at":"2026-08-07T10:28:54.718898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.477451Z","title":"AIR-bench: Benchmarking large audio-language models via generative comprehension,","venue":null,"work_id":"6e82cf96-1e99-499f-9200-ff05123af229","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.445257Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:7b5ff3c8191ea0a0dbc12ab4451725746d138285465bfb5d750af5b8f8e6bb68","observation_id":"4e271325-a613-4d92-ab4b-3f8917f15ed5","resolution":{"observed_at":"2026-08-07T10:28:54.568234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.291829Z","title":"MMAU: A massive multi- task audio understanding and reasoning benchmark,","venue":null,"work_id":"e44d761c-533f-45be-9cc4-540dcf7af959","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.534392Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:cca8ee29db145d182d124aaf59e1527f1a7f6c2a6102681ba2a31ac9f467fcaf","observation_id":"261eee84-01c6-4106-9279-3b23d98e4978","resolution":{"observed_at":"2026-08-07T10:28:54.372004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:54.091653Z","title":"SD-eval: A benchmark dataset for spoken dialogue understanding beyond words,","venue":null,"work_id":"fd4a3bdd-ef35-49a8-9caa-3947667d5b25","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.610768Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:7d90bef99943881261538d0660fdbe33958fea0fc282348ae459423d97d929f5","observation_id":"ae3d2463-73c5-43c8-8ffa-27f2a4a310bd","resolution":{"observed_at":"2026-08-07T10:28:54.212745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.881175Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":"720f9508-a318-49e2-ab44-fb0b2643a143","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.679645Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:82ed89cd2c1d95b9102131419863dc27759b976e8be9125c3088c914efb3a71b","observation_id":"3f1de721-b173-43c7-861d-358b2804662d","resolution":{"observed_at":"2026-08-07T10:28:53.957156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.684716Z","title":"Sakura: On the multi- hop reasoning of large audio-language models based on speech and audio information,","venue":null,"work_id":"ac76ea48-f9d4-4bc0-a637-2f9e6939f8fa","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.743369Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:992c34135d219d7df417b5235e7c2eb059cfaa7caa404dcf4657e4fff35c554b","observation_id":"6cf1eb72-eeaf-4b9d-8c4c-2781d612b8b9","resolution":{"observed_at":"2026-08-07T10:28:53.774159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15957","last_updated":"2026-04-26T17:05:53Z","snapshot_observed_at":"2026-08-12T22:36:47.817564Z","submitted_at":"2025-05-21T19:17:29Z","title":"Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15957","snapshot_observed_at":"2026-08-07T10:28:40.806283Z","title":"Towards holistic evaluation of large audio-language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.806283Z"},"links":{"cited_paper":"/paper/2505.15957","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:edab377bdf224a80e2d4dbfa61277212987777d767c5008eaf52f22d1ef0fba6","observation_id":"3c7cc759-9795-4eb5-945d-edce1eeb0748","resolution":{"observed_at":"2026-08-07T10:28:40.806283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09940","last_updated":"2025-02-14T06:34:08Z","snapshot_observed_at":"2026-08-19T20:15:01.240634Z","submitted_at":"2025-02-14T06:34:08Z","title":"A Preliminary Exploration with GPT-4o Voice Mode","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09940","snapshot_observed_at":"2026-08-07T10:28:40.942515Z","title":"A preliminary exploration with gpt-4o voice mode,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:40.942515Z"},"links":{"cited_paper":"/paper/2502.09940","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:3f83ce1ee0f27fe9b6dc3608f7489c5e766746ad95eb25d2f8ca9b2f5cc8b316","observation_id":"63a5ae1d-f3b6-4eb2-8f1b-02d5633e1e7e","resolution":{"observed_at":"2026-08-07T10:28:40.942515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.550421Z","title":"Language-specific neurons: The key to multilingual ca- pabilities in large language models,","venue":null,"work_id":"0fea6b67-a2ba-4a9a-9cf4-bac9db4e30d0","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.060069Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:81abafa78907b3a807cf63300a04c7b380921a3ae8d684e06b405dd1bf143c3c","observation_id":"08f9681f-dccd-4625-9f1f-ae80d6dbca1b","resolution":{"observed_at":"2026-08-07T10:28:53.628004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14928","last_updated":"2023-10-23T13:31:32Z","snapshot_observed_at":"2026-08-17T16:23:28.864094Z","submitted_at":"2023-10-23T13:31:32Z","title":"Unveiling A Core Linguistic Region in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14928","snapshot_observed_at":"2026-08-07T10:28:41.154385Z","title":"Unveiling a core linguistic region in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.154385Z"},"links":{"cited_paper":"/paper/2310.14928","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:163c1571c1b2537726709754f7e81faa7b79fa7b2cb43bb2c57d272b5d2fe430","observation_id":"41ccb67a-b407-4d0d-a330-a5ceba50c27a","resolution":{"observed_at":"2026-08-07T10:28:41.154385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.411420Z","title":"Do large language models latently perform multi-hop reasoning?","venue":null,"work_id":"eb82ef5a-6007-48c5-afeb-b8932fa3f130","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.278719Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:8f9cbf893ddef4dcbe115d35415d10319764468f17fd6d9093c206087aa7d67b","observation_id":"b5a452b7-0514-4390-a217-1cc74004e77b","resolution":{"observed_at":"2026-08-07T10:28:53.495179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.259166Z","title":"Hopping too late: Exploring the limitations of large language models on multi-hop queries,","venue":null,"work_id":"8af92aa8-be0c-4aa2-a35d-c7d5fa12ec10","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.344013Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d46e7b48cf37fbbe93fc97d0554c4985456d8f14d027f8b78da24a733dd42192","observation_id":"80808549-20ef-42be-93a5-7f56642fa035","resolution":{"observed_at":"2026-08-07T10:28:53.328622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10835","last_updated":"2025-02-15T15:36:42Z","snapshot_observed_at":"2026-08-18T06:12:45.497411Z","submitted_at":"2025-02-15T15:36:42Z","title":"Back Attention: Understanding and Enhancing Multi-Hop Reasoning in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10835","snapshot_observed_at":"2026-08-07T10:28:41.444497Z","title":"Back attention: Understanding and enhancing multi-hop reasoning in large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.444497Z"},"links":{"cited_paper":"/paper/2502.10835","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:2102e2430006e01224236b8144cdeade84951d9b0d3df7f69cd68a6d7b5af10e","observation_id":"34373ead-3978-4a9a-a669-ff175d7c1a59","resolution":{"observed_at":"2026-08-07T10:28:41.444497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:53.075158Z","title":"Knowledge neurons in pretrained transformers,","venue":null,"work_id":"ba246c6f-6502-4387-9658-76fc25c01e4f","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.540789Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:5cb7d678c42922043b940fc4e9a8cdef3ecec628bbfa459726120d728b33d9ff","observation_id":"e3ab0f48-158b-4f3a-89ba-1a5ca2385c40","resolution":{"observed_at":"2026-08-07T10:28:53.207526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.857630Z","title":"Neuron-level knowledge attribution in large language models,","venue":null,"work_id":"370b11a2-d5fa-4f4e-8229-83b09baaf7ca","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.604588Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:ea37f8ecf6c105e4f25afa09aae77d4c21ecc0585e5420790c46f61651b8e179","observation_id":"2d6b254a-74ab-48d4-b9b1-92c825e88c96","resolution":{"observed_at":"2026-08-07T10:28:52.986466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.676898Z","title":"Listen and speak fairly: a study on semantic gender bias in speech integrated large language models,","venue":null,"work_id":"b226f6f2-5fe6-472c-bb1a-4fa3e80507bb","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.682261Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:b030b5f0194f56f45438b87cef3a1c2f636fbffb87bd976c384f64923cc3e6a6","observation_id":"0cdcd27e-ab70-4947-b130-04fd06516c98","resolution":{"observed_at":"2026-08-07T10:28:52.768197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12787","last_updated":"2024-10-16T17:59:02Z","snapshot_observed_at":"2026-08-16T13:08:42.338170Z","submitted_at":"2024-10-16T17:59:02Z","title":"The Curse of Multi-Modalities: Evaluating Hallucinations of Large Multimodal Models across Language, Visual, and Audio","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12787","snapshot_observed_at":"2026-08-07T10:28:41.761053Z","title":"The curse of multi-modalities: Evaluating hallucinations of large multimodal models across language, visual, and audio,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.761053Z"},"links":{"cited_paper":"/paper/2410.12787","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:ecb8456706b3aa54ea8200bb744bc882541ff057d44c8034df0e3771ed4a1578","observation_id":"430d8b40-28c3-485f-a683-4845b1a48d5a","resolution":{"observed_at":"2026-08-07T10:28:41.761053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.516225Z","title":"Can large audio-language models truly hear? tackling hallucinations with multi-task assessment and stepwise audio reasoning,","venue":null,"work_id":"eabc5957-eae3-4bd1-935e-11fded988a30","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.850501Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:847f0c76fa4457ddfb5944cf6811ec17f5cc2dd8daafe6b6b26cefe6b58e20bf","observation_id":"fdc3dfa9-8676-4cf3-8fd8-b0ea56244600","resolution":{"observed_at":"2026-08-07T10:28:52.597249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.326341Z","title":"Interpreting GPT: the logit lens,","venue":null,"work_id":"d33dc863-9efb-4e75-a470-8aef444bbf2e","year":2020},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:41.923742Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:be9a34e224e691363da71ccc867dafbc66b1990b6375a622bd3f9fd1aae287b0","observation_id":"71985eb9-f25d-4fb9-973d-c94817a254f4","resolution":{"observed_at":"2026-08-07T10:28:52.405947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:52.133589Z","title":"Transformer feed- forward layers build predictions by promoting concepts in the vocabulary space,","venue":null,"work_id":"5ba8b128-9419-4083-bab0-3a6f26a84486","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.032988Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:42815e277c5ea124788fe9006a55108026b6e39bae57b415066e2e2ea8a4febc","observation_id":"7faaee5b-4393-464f-bafe-97049a2d0928","resolution":{"observed_at":"2026-08-07T10:28:52.248234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.921885Z","title":"Jump to conclusions: Short-cutting transformers with linear transformations,","venue":null,"work_id":"b2dba37b-9d76-454d-9c71-b515d15161f7","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.170174Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:f0c2de72bb76ae29e344f14a2b9e0efaca59d0207015b428afe35016e85ed47a","observation_id":"5f52850f-a96f-4253-b79c-127c79882dc4","resolution":{"observed_at":"2026-08-07T10:28:52.035359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-08-14T11:50:41.917778Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08112","snapshot_observed_at":"2026-08-07T10:28:42.267367Z","title":"Eliciting latent predictions from trans- formers with the tuned lens,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.267367Z"},"links":{"cited_paper":"/paper/2303.08112","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:ddb5839b10d08b3511192697aae7e28daba3e41525bc6c1ac02426146d8d3cd8","observation_id":"11a12ac2-19ca-4bd8-92a9-80ff236f836d","resolution":{"observed_at":"2026-08-07T10:28:42.267367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.697452Z","title":"Superb: Speech processing universal performance benchmark,","venue":null,"work_id":"ef6ed792-9bf1-4960-8152-9d5b0d40d151","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.341114Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d0839eeccecb04584a20320d6e6133d4afc2ba81fe244ed75b11bc135cef8de1","observation_id":"a6d30e0a-e916-4e67-8afb-90d45e4d2926","resolution":{"observed_at":"2026-08-07T10:28:51.805057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.434241Z","title":"Superb-sg: Enhanced speech processing universal performance benchmark for semantic and generative capabilities,","venue":null,"work_id":"8b98821d-0c02-4f75-8734-f6fcda8e669a","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.439650Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:bc29d23860000f2c87dc0256451ae0757ca979bdd4acfd3ea73c45082f269e41","observation_id":"87c54f9d-7cc2-45bc-9464-4467e2c43df8","resolution":{"observed_at":"2026-08-07T10:28:51.562454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.237056Z","title":"Hear: Holistic evaluation of audio representations,","venue":null,"work_id":"359457f5-97ad-47c9-aaa3-9f8dfcaa78b9","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.535596Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:d8dac2a3766334cf0af341bc20e79621b4804bc5fa325730e64d38fff185ad3b","observation_id":"f9d3a312-8c5f-42a5-95bb-23778ae1dfe8","resolution":{"observed_at":"2026-08-07T10:28:51.327559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:51.017826Z","title":"Marble: Music audio representation benchmark for universal evaluation,","venue":null,"work_id":"224e454c-d697-42bd-bdc7-ed6f33ee4a78","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.630486Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:fac447865cb4fa206f5944891b248f32245c3d1eef67f706de7729d71445597c","observation_id":"533e4995-5bb6-4683-ae37-237e9e1525f2","resolution":{"observed_at":"2026-08-07T10:28:51.103447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.813807Z","title":"The zero resource speech benchmark 2021: Metrics and baselines for unsupervised spoken lan- guage modeling,","venue":null,"work_id":"1ccbc578-4a48-4eba-a542-9747a7fa4bd7","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.742459Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:f2c67d72463af287634c110a4977003d9ad6bafef2911a1723990105ad54bdb8","observation_id":"20771945-269a-49d7-b377-95965a6790f5","resolution":{"observed_at":"2026-08-07T10:28:50.920026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.624996Z","title":"Zero re- source code-switched speech benchmark using speech utterance pairs for multiple spoken languages,","venue":null,"work_id":"239e4ffc-6492-4497-a91f-004e8d90199f","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.847809Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:6f8861e89f326449b44d96e9c14abed6c1fc9dffc30427ce75fb82f0999c0e38","observation_id":"c17ec7f1-7408-4b10-a54a-17411905ff03","resolution":{"observed_at":"2026-08-07T10:28:50.713540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.406684Z","title":"Yang, K.-P","venue":null,"work_id":"0a7c7014-e627-494e-ac41-6dd60f8c629f","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:42.973675Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:a295a6b79bd9d84280df9d92346755b2f011259075d1a22c01f872a828cf90ba","observation_id":"88ec8539-a0f7-4678-8022-20978f78219e","resolution":{"observed_at":"2026-08-07T10:28:50.480191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.214732Z","title":"Ml-superb: Multi- lingual speech universal performance benchmark,","venue":null,"work_id":"578931e6-dfc1-4693-abee-c2ff33cd08ae","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.081636Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:14f982c46be9139b5898d03c7c71b4fa3c79b16ce9583d77c8e511005c113818","observation_id":"999177de-285d-4738-92ef-8c66b8a859c5","resolution":{"observed_at":"2026-08-07T10:28:50.304813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.163518Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.163518Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:5197b412f9c8ce8954c93d9bea8adb24858e094ac88d1c7dcd370642eb1cdd44","observation_id":"7a5f1b1c-f4c1-4dce-900b-24c38ee814aa","resolution":{"observed_at":"2026-08-07T10:28:43.163518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:50.014980Z","title":"Distilhubert: Speech represen- tation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"655cc194-2f28-4a20-b0fb-fa6cad68d383","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.282638Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:45516421278f4e271e722941a32eda7c082d7fa1d90ae75fb2e9b4db385b8524","observation_id":"d6b02991-a84d-41ba-ae29-a98470367764","resolution":{"observed_at":"2026-08-07T10:28:50.116539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.739422Z","title":"wav2vec: Unsu- pervised pre-training for speech recognition,","venue":null,"work_id":"a6f32d7a-2486-4858-89c7-ae07acbf06be","year":2019},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.363926Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:3c739251b4bb5ab5ad5a704ce7dc413890027925e87ce37e0b5ccf04068f3f2e","observation_id":"d23963c7-5910-4dbc-a95b-18c54acff6b6","resolution":{"observed_at":"2026-08-07T10:28:49.884518Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.464970Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.464970Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:935166f6df57b014e4f3b0188f122942f1be08a9322f902088506d64007b882d","observation_id":"13472697-22eb-4688-ac30-eb7430aa469b","resolution":{"observed_at":"2026-08-07T10:28:43.464970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.545806Z","title":"Un- supervised cross-lingual representation learning for speech recognition,","venue":null,"work_id":"37c89446-7b63-4f71-8723-1d3f93c8d4ae","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.615965Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:673c1b86d122f8ebe8ad8fa574fa7df699e9f23cdd74acbf63aff31273b463e6","observation_id":"590f5ae6-61a5-47bc-8428-42360c4161cd","resolution":{"observed_at":"2026-08-07T10:28:49.629438Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.713167Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.713167Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:01a2f955901612496985566a0842aa55eadca499053fd6f7f45cf176f303dd2f","observation_id":"2dc9822f-7971-4ae7-bf39-39f123942272","resolution":{"observed_at":"2026-08-07T10:28:43.713167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.323702Z","title":"Comparative layer-wise analysis of self-supervised speech models,","venue":null,"work_id":"54f6a850-8b32-4179-b265-3ce84db1c3e7","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.802905Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:4df8b827229ff365227e91d58a2d9b86769ffb2e21110b149ee1bbef1b95a9cc","observation_id":"358c2750-2aac-4303-a883-fe4b5d4e8a6d","resolution":{"observed_at":"2026-08-07T10:28:49.412394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:43.922682Z","title":"What do self- supervised speech models know about words?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:43.922682Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:270116b0167d0f74a2b79f722cdb364a4b9d06071a8c75b6b889cbf6df12cb85","observation_id":"fd57bbe1-a919-4430-8d50-c1ac6b5de80a","resolution":{"observed_at":"2026-08-07T10:28:43.922682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:49.029089Z","title":"Self-supervised speech representations are more phonetic than semantic,","venue":null,"work_id":"8d812bf5-818d-4458-a6ed-eeec28d6339a","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.021653Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:bff0dc8b267de4b20fd0e18ae33d9af6ddcea7dc5ede574a0435dbbe21e44f27","observation_id":"e4d48e92-c3e0-4404-81d0-f62e8e5d66d7","resolution":{"observed_at":"2026-08-07T10:28:49.151047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.774907Z","title":"Property neurons in self-supervised speech transformers,","venue":null,"work_id":"99e16a44-af8a-495d-9012-c6b1e86ebe0b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.138736Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:f5725d6841b732e87f5830b93b4c6f85e2b062c7226c208888d6c1b0eadb2c69","observation_id":"38d0acc9-7ce4-43ff-a5e1-66cd90910740","resolution":{"observed_at":"2026-08-07T10:28:48.904036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.560702Z","title":"And: Audio network dissection for interpreting deep acoustic models,","venue":null,"work_id":"9a36cbe9-0dc1-4cba-a8c6-68e95628e35b","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.271750Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:025eb51ada02e4b4c0f96e73fd78e3f91dfb14efa1a79aedfefee73754d0076a","observation_id":"2f9ac762-9a08-4a90-a56c-a7fa6e953d72","resolution":{"observed_at":"2026-08-07T10:28:48.686867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.341952Z","title":"Do prompts really prompt? exploring the prompt understanding capability of whisper,","venue":null,"work_id":"30141884-b487-49b4-a732-262a19bafe2a","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.360094Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:95daacc3533be4c3c227bca83bce6ae198107f14bb63869c837f6b3f6fdf458d","observation_id":"11f6f6d0-df7a-49e2-92c0-68c998ce1662","resolution":{"observed_at":"2026-08-07T10:28:48.464754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:48.098793Z","title":"Hey asr system! why aren’t you more inclusive? automatic speech recognition systems’ bias and proposed bias mitigation techniques. a literature review,","venue":null,"work_id":"3b59fbfc-aaa5-4823-8772-797b5c95ad97","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.446769Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:f6d2c96bb518ae0723a5b25709d377f65802272153a63e22569f0cb75b076243","observation_id":"85a15553-dbcb-4263-be7f-fd6d326401ba","resolution":{"observed_at":"2026-08-07T10:28:48.211091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.915526Z","title":"Emo-bias: A large scale evaluation of social bias on speech emotion recognition,","venue":null,"work_id":"5462b187-541a-41a3-ab5f-defaecbe2729","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.544838Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:1d427b97ba5d18346ca25b4f48018acb42de1c312437a115d2fc51b27dbec31f","observation_id":"83b29e76-ecc0-4b82-8780-90d542a34aa2","resolution":{"observed_at":"2026-08-07T10:28:48.035026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.727757Z","title":"Attention is not only a weight: Analyzing transformers with vector norms,","venue":null,"work_id":"378bb5ff-743a-4a02-b7bf-8ff74f0f7ef4","year":2020},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.632292Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:248a38a2bab4f45926b3d29d2c5d9e9eaf6c472bc117fe23621c6ef4af41fd96","observation_id":"bef6882b-a9e1-47a8-8fac-fa1f6f7d6a20","resolution":{"observed_at":"2026-08-07T10:28:47.828288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.481722Z","title":"An investigation of neuron activation as a unified lens to explain chain-of-thought eliciting arithmetic reasoning of llms,","venue":null,"work_id":"31ee2ccf-ea63-42b9-b207-a528d460a0c2","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.708581Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:9bf60f0fda5c04d099d662a17f2b0d35d6fda0ac6c562782cd0fc76715e7ceeb","observation_id":"216ff809-949b-444b-9ec9-f362e8d5e61f","resolution":{"observed_at":"2026-08-07T10:28:47.602048Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.272657Z","title":"Understanding and enhancing safety mechanisms of LLMs via safety-specific neuron,","venue":null,"work_id":"970e4878-5432-43b2-91ef-1acf75d4881c","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.785659Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:be137f6bfcdf75e36ab1aadc0dc5a06d2c2512b34f50188f2c736ae7e3d3d8fe","observation_id":"60238b45-8fe9-4896-9f52-5a5bacfbaac4","resolution":{"observed_at":"2026-08-07T10:28:47.389645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.119574Z","title":"Patchscopes: a unifying framework for inspecting hidden representa- tions of language models,","venue":null,"work_id":"90448d52-1b59-43c9-8f4a-12e396df9002","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.872331Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:4628bea3e61d0ae6fc4efa2ca08a783e811b0339b88c901ec3411b945ec1f96e","observation_id":"a2f09161-2083-467f-8363-d8b0d72f539c","resolution":{"observed_at":"2026-08-07T10:28:47.186010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:47.002371Z","title":"Probing classifiers: Promises, shortcomings, and ad- vances,","venue":null,"work_id":"bec9c855-1743-42e4-b65a-2da09420cf51","year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:44.980870Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:a706f3d7982873fce1999464c47897270930302a0fd5164ef4a9495b0c196655","observation_id":"8cb66489-fe01-4ea8-bfdd-537e2eb355be","resolution":{"observed_at":"2026-08-07T10:28:47.054969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:45.070032Z","title":"Locating and editing factual associations in gpt,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.070032Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:4b54a4cd4f050632aeaaccea741806486ad8c36954ca5d928a3350c99c0d9be5","observation_id":"9d3fb428-92da-47fb-8450-ab53a9eed2e2","resolution":{"observed_at":"2026-08-07T10:28:45.070032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.827332Z","title":"Language models implement simple word2vec-style vector arithmetic,","venue":null,"work_id":"a965e68f-471f-49dc-a4b2-f22620c14f65","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.155817Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:72dfbbaf81abac5b66f1ba8af2af6aa223eca23cd8de2d4adc581abb04d1d1f3","observation_id":"efc027ab-9f73-4900-8149-fb0eda0c8a69","resolution":{"observed_at":"2026-08-07T10:28:46.923791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.602696Z","title":"Dissecting recall of factual associations in auto-regressive language models,","venue":null,"work_id":"6a12ef1a-b7dd-41bc-9e04-483312893b5f","year":2023},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.247861Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:c65ed13092e6f89b8c006792ed34717d7b7994360eec7c082b3f41f08d0f8886","observation_id":"6b0bba89-a4fe-4ea7-92a7-2662a66a5fc1","resolution":{"observed_at":"2026-08-07T10:28:46.707136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11667","last_updated":"2025-02-24T03:37:44Z","snapshot_observed_at":"2026-08-19T05:44:24.955713Z","submitted_at":"2025-02-24T03:37:44Z","title":"LogitLens4LLMs: Extending Logit Lens Analysis to Modern Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11667","snapshot_observed_at":"2026-08-07T10:28:45.356667Z","title":"Logitlens4llms: Extending logit lens analysis to modern large language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.356667Z"},"links":{"cited_paper":"/paper/2503.11667","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:6d8c8f7decb3310254ab22ca247e41333a3775c86f5b5038341d56c75e064e2d","observation_id":"dc29f272-fae9-4ad9-896c-ba6620f2bc85","resolution":{"observed_at":"2026-08-07T10:28:45.356667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.416232Z","title":"Interpreting and editing vision-language representations to mitigate hallucinations,","venue":null,"work_id":"9827dd8d-2ae6-45cb-8945-0c7e1a9c7b9b","year":2025},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.458884Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:e4b9add2b4d4139a62dd4b8222f4b1a9e2dca3b561872fc83504d5e470276f40","observation_id":"3de112a3-c617-426c-9ba7-d876bd1c4740","resolution":{"observed_at":"2026-08-07T10:28:46.518839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-20T02:39:35.450758Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T10:28:45.549978Z","title":"Towards interpreting visual information processing in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.549978Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:942d975343cf1f49e3183b0532c027d1b5f7de62ae275f5403e5d234b51939d9","observation_id":"29447404-6719-40ec-9937-d267fb413939","resolution":{"observed_at":"2026-08-07T10:28:45.549978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.245462Z","title":"Mmneuron: Discovering neuron-level domain-specific interpretation in multimodal large language model,","venue":null,"work_id":"688c7473-8cd4-48a4-a4f4-67fd27725412","year":2024},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.660126Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:4e4d6ec965c9d808d3d2a7ce65073d4eb63e0c24f4f1ef273a6d4991ba6d2190","observation_id":"d82bdc62-f328-427b-984a-1ab6dc9fc555","resolution":{"observed_at":"2026-08-07T10:28:46.335269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:28:46.013893Z","title":"Measuring massive multitask language understanding,","venue":null,"work_id":"5af215c9-ffa3-4208-a03a-b587719993f9","year":2021},"citing_paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T10:28:45.760195Z"},"links":{"citing_paper":"/paper/2506.05140"},"observation_digest":"sha256:abdf23ffd984b98d7fd1bfa432e3bb816a89ae06e4dae4b30d0b47eb804501b8","observation_id":"311eee3a-54e4-4a15-b4ca-19732ab683c8","resolution":{"observed_at":"2026-08-07T10:28:46.132024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.05140","last_updated":"2025-08-24T16:16:18Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T22:29:03.005380Z","submitted_at":"2025-06-05T15:22:47Z","title":"AudioLens: A Closer Look at Auditory Attribute Perception of Large Audio-Language Models"},"reference_resolution":{"displayed":71,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":0,"verified_fuzzy":53},"total_outbound_references":71},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 71 of 71 outbound references and 5 inbound Pith citation observations for arXiv:2506.05140."}