{"as_of":"2026-08-20T15:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:63df1d4d29f6b3577fe4b1deaea2359682165238017e051865bd94fbb0183777","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T19:02:41.528122Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01881/citation-record","integrity":"/paper/2608.01881/integrity","json":"/paper/2608.01881/citation-record.json","paper":"/paper/2608.01881"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2010.00475","last_updated":"2022-04-23T20:12:00Z","snapshot_observed_at":"2026-08-16T19:16:33.203758Z","submitted_at":"2020-10-01T15:07:25Z","title":"FSD50K: An Open Dataset of Human-Labeled Sound Events","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.00475","snapshot_observed_at":"2026-08-04T19:02:40.771164Z","title":"Fu, Y.; Cheng, L.; and Lv, S","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.771164Z"},"links":{"cited_paper":"/paper/2010.00475","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:4e304928366b4fedbc743a63f925dc1a6400dfee97d43faf536f54596718e82d","observation_id":"77fb404d-c569-4f15-a722-967f86973136","resolution":{"observed_at":"2026-08-04T19:02:40.771164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04847","last_updated":"2026-04-06T16:46:52Z","snapshot_observed_at":"2026-08-14T13:07:26.217264Z","submitted_at":"2026-04-06T16:46:52Z","title":"Full-Duplex-Bench-v3: Benchmarking Tool Use for Full-Duplex Voice Agents Under Real-World Disfluency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04847","snapshot_observed_at":"2026-08-04T19:02:40.932166Z","title":"Liu, X.; Wang, X.; and Sahidullah, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.932166Z"},"links":{"cited_paper":"/paper/2604.04847","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:2311393ac806b06b224894220bb0214c452ef74ab92158494d2046973a2c2b6b","observation_id":"7211c381-a8d4-40ec-9e22-b8567e9480d9","resolution":{"observed_at":"2026-08-04T19:02:40.932166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-20T13:35:17.416522Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-04T19:02:41.013510Z","title":"Maben, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.013510Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:a4be8479c213afbb4b4ab4167107e3965ee0b0aca9b46bdfa29a8b01bb3f65f6","observation_id":"2e2a3dbc-9498-453c-a23b-34a3e2ccf11a","resolution":{"observed_at":"2026-08-04T19:02:41.013510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.053261Z","title":"InIEEE Au- tomatic Speech Recognition and Understanding Workshop, ASRU2025,Honolulu,HI,USA,December6-10,2025,1–4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.053261Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:0b90a876e89d2c947f2dd587737a00f64585377ea6c5480aa8c67f6169e4e0d7","observation_id":"6187c0fc-5fe1-4a16-ad07-e5a4d9c68382","resolution":{"observed_at":"2026-08-04T19:02:41.053261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.067683Z","title":"In Lacerda, F., ed.,18th Annual Conference of the Inter- national Speech Communication Association, Interspeech 2017, Stockholm, Sweden, August 20-24, 2017, 2616–2620","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.067683Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:7449e920042e35b2c20a77115f9a6b75d7b8d7ca95bd364729c4c234f2424b99","observation_id":"8b09f8e2-b07b-4cbf-ad50-41d679f06ce7","resolution":{"observed_at":"2026-08-04T19:02:41.067683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22821","last_updated":"2026-04-28T17:29:55Z","snapshot_observed_at":"2026-08-11T13:48:47.306819Z","submitted_at":"2026-04-17T16:41:25Z","title":"Audio2Tool: Speak, Call, Act -- A Dataset for Benchmarking Speech Tool Use","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22821","snapshot_observed_at":"2026-08-04T19:02:41.107158Z","title":"Rong, Y.; Li, C.; and Yu, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.107158Z"},"links":{"cited_paper":"/paper/2604.22821","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:bf95d676997c34d7cd01cbc4f714d734a22bf6daf32fb852c1604577c08b34e5","observation_id":"34f5ce39-792b-48b8-87a2-61e208bc2c30","resolution":{"observed_at":"2026-08-04T19:02:41.107158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.148943Z","title":"Sakshi, S.; Tyagi, U.; and Kumar, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.148943Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:54cfca6d3b398a0b8de19a492dac52b931a1a441d5197058e0cb35914a70030e","observation_id":"1b4f6fc5-f7b4-4187-9e5a-c35004e175f5","resolution":{"observed_at":"2026-08-04T19:02:41.148943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-04T19:02:41.221713Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.221713Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:4f4e4ba470a3da1585fd0fdb25b9442bbdbf6cfe2b075c653dd6c0993ac7dc21","observation_id":"98553ed0-0e79-4d3e-a5ce-dc733f5d1faa","resolution":{"observed_at":"2026-08-04T19:02:41.221713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15804","last_updated":"2026-04-21T03:35:14Z","snapshot_observed_at":"2026-08-14T13:05:43.952056Z","submitted_at":"2026-04-17T08:05:46Z","title":"Qwen3.5-Omni Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15804","snapshot_observed_at":"2026-08-04T19:02:41.256146Z","title":"Tian, F.; Zhang, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.256146Z"},"links":{"cited_paper":"/paper/2604.15804","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:684e3d20f4d14115d7bcf65256439809f35784ddc180ff8dc2549279be75a0cc","observation_id":"bc62cbbc-a02d-4d4d-bb71-bace030c9f48","resolution":{"observed_at":"2026-08-04T19:02:41.256146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.293091Z","title":"Tong, S.; Li, X.; and Wang, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.293091Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:1b5df1d7ca87b620fd4c2c3e83435b9d611ce2c58c724e5d75e0357cc0afce6a","observation_id":"4b09b3f9-95d8-4749-8218-152e34f768e0","resolution":{"observed_at":"2026-08-04T19:02:41.293091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.335720Z","title":"Wang, B.; Zou, X.; and Lin, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.335720Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:87d42ad2cd393d92e8de727e2332aa3bd7417e2a1e1e6f117e361f84fc2c6e19","observation_id":"3f03065c-a706-42ed-8410-2f5b6d2d8c21","resolution":{"observed_at":"2026-08-04T19:02:41.335720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.353060Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.353060Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:d2166a10f37f59ac3ffaac9c94006b2e0e41a2e1365e7cdd9c7794846c5f3a53","observation_id":"6f0e38b8-5a61-44bb-a818-8123a40a4ac6","resolution":{"observed_at":"2026-08-04T19:02:41.353060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.08155","last_updated":"2025-08-11T16:31:32Z","snapshot_observed_at":"2026-08-14T01:39:50.403516Z","submitted_at":"2025-08-11T16:31:32Z","title":"MSU-Bench: Towards Understanding the Conversational Multi-talker Scenarios","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.08155","snapshot_observed_at":"2026-08-04T19:02:41.392890Z","title":"Wang, Y.; Peng, J.; and Li, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.392890Z"},"links":{"cited_paper":"/paper/2508.08155","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:99b456893c19686abe367a814bad4ae64d8c332b55f3d4dfacecbf18e8d8370d","observation_id":"f91bf7a1-04a2-4871-b173-21ed1dd452e9","resolution":{"observed_at":"2026-08-04T19:02:41.392890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.28480","last_updated":"2026-05-27T13:39:14Z","snapshot_observed_at":"2026-08-11T17:16:43.389983Z","submitted_at":"2026-05-27T13:39:14Z","title":"Audio-Mind: An Auditable Agentic Framework for Audio Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.28480","snapshot_observed_at":"2026-08-04T19:02:41.428446Z","title":"Wijngaard,G.;Formisano,E.;andDumontier,M.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.428446Z"},"links":{"cited_paper":"/paper/2605.28480","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:ede23f10247b81898370ab03404bd488824505d0ad521eb64fad77714d03d59d","observation_id":"c834345b-e7e9-450f-a683-d09f2176cb2e","resolution":{"observed_at":"2026-08-04T19:02:41.428446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.470759Z","title":"Xie,Z.;Lin,M.;andLiu,Z.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.470759Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c7ec0561c4861a5b51eee8fd0a97661ba2acb6b6c6d80345c5c4f1b808c72a5f","observation_id":"eb13be1e-37ad-453a-a48e-e22c2db5df73","resolution":{"observed_at":"2026-08-04T19:02:41.470759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:41.491746Z","title":"CoRR, abs/2606.15141","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.491746Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:a597bb85bdfd7a7f2e3d02d0b6a90caf0977f6e41b1cbc0208890bb4bb6ec4a2","observation_id":"9be4a0b8-7f58-41f1-a43b-7f2bb47ef9ac","resolution":{"observed_at":"2026-08-04T19:02:41.491746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.05522","last_updated":"2017-09-16T14:33:27Z","snapshot_observed_at":"2026-08-15T16:26:20.465140Z","submitted_at":"2017-09-16T14:33:27Z","title":"AISHELL-1: An Open-Source Mandarin Speech Corpus and A Speech Recognition Baseline","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.05522","snapshot_observed_at":"2026-08-04T19:02:40.653124Z","title":"Chen, L.; Chen, H.; and Cai, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.653124Z"},"links":{"cited_paper":"/paper/1709.05522","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:f100ee8eb4aef27a58850e5df4e5458bdbbfb856d8dcc560149bb5b7dd6334e5","observation_id":"13256ed0-1e9f-4e28-bbfc-217dd82fbb6a","resolution":{"observed_at":"2026-08-04T19:02:40.653124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00320","last_updated":"2018-04-01T17:12:47Z","snapshot_observed_at":"2026-08-15T07:04:54.401656Z","submitted_at":"2018-04-01T17:12:47Z","title":"Spoken SQuAD: A Study of Mitigating the Impact of Speech Recognition Errors on Listening Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00320","snapshot_observed_at":"2026-08-04T19:02:40.885771Z","title":"Li, L.; Chen, H.; Li, Z.; Hu, Q.; Kang, J.; Li, J.; Xie, L.; and Li,Y.2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.885771Z"},"links":{"cited_paper":"/paper/1804.00320","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:e919e75d53754fa246448a2fe81dfb600e40e679ed4a9a5d79a8ef9b5bbc6270","observation_id":"c8bcbcec-dc56-4ace-9a1a-ea4a8567596b","resolution":{"observed_at":"2026-08-04T19:02:40.885771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.11262","last_updated":"2020-05-22T16:26:54Z","snapshot_observed_at":"2026-08-15T22:07:29.787968Z","submitted_at":"2020-05-22T16:26:54Z","title":"LibriMix: An Open-Source Dataset for Generalizable Speech Separation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.11262","snapshot_observed_at":"2026-08-04T19:02:40.730450Z","title":"arXiv:2005.11262","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.730450Z"},"links":{"cited_paper":"/paper/2005.11262","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:c1552d8b11df08a4276bd05b8ed6359477b694bc3bcb253cbfc55b6391be82d6","observation_id":"d71e7252-bb08-46c4-9f06-f0a42d6c960f","resolution":{"observed_at":"2026-08-04T19:02:40.730450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03603","last_updated":"2021-08-10T09:15:00Z","snapshot_observed_at":"2026-08-20T05:44:50.966082Z","submitted_at":"2021-04-08T08:38:44Z","title":"AISHELL-4: An Open Source Dataset for Speech Enhancement, Separation, Recognition and Speaker Diarization in Conference Scenario","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03603","snapshot_observed_at":"2026-08-04T19:02:40.804727Z","title":"Jain, D.; Shukla, H.; and Rajeev, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.804727Z"},"links":{"cited_paper":"/paper/2104.03603","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:577c5d8052e02642dc331f087af68fed393fe463b0138b7d21d224958ec936fa","observation_id":"724f824a-7e93-4787-920e-4654dc3fc791","resolution":{"observed_at":"2026-08-04T19:02:40.804727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02437","last_updated":"2023-06-22T13:00:56Z","snapshot_observed_at":"2026-08-18T03:35:46.822125Z","submitted_at":"2022-10-05T17:57:29Z","title":"ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02437","snapshot_observed_at":"2026-08-04T19:02:40.969960Z","title":"Ma, Z.; Ma, Y.; and Zhu, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.969960Z"},"links":{"cited_paper":"/paper/2210.02437","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:40720adec47c885d5a76bff77968fb4ce0152c54667b744e66ea89dc923445b6","observation_id":"4dcc0451-20e1-44a7-b907-4a2f4d95a0fc","resolution":{"observed_at":"2026-08-04T19:02:40.969960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10390","last_updated":"2024-04-18T08:13:58Z","snapshot_observed_at":"2026-08-16T15:07:09.479698Z","submitted_at":"2023-08-20T23:47:23Z","title":"LibriSQA: A Novel Dataset and Framework for Spoken Question Answering with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10390","snapshot_observed_at":"2026-08-04T19:02:41.528122Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.528122Z"},"links":{"cited_paper":"/paper/2308.10390","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:0af091c96b0ebf6dbb1eee5118b0f0ef2be085c062b65b397f050da6b3985709","observation_id":"9c752120-f0a1-4d5f-b55f-f14617d2bbb0","resolution":{"observed_at":"2026-08-04T19:02:41.528122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-08-13T20:48:30.133767Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-04T19:02:41.181470Z","title":"Sussman, E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:41.181470Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:412ba379df848d76a4d595631220b400e293838ee98f48fba1f6e8fd9b426b1d","observation_id":"132df9a7-37fb-47bd-a385-bfcccba9b1e1","resolution":{"observed_at":"2026-08-04T19:02:41.181470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:40.849020Z","title":"KimiTeam;Ding,D.;andJu,Z.2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.849020Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:63f72fb4b836deee56668d454f5be945830fbecc266405a9d0bbabb8974e95e3","observation_id":"adbdab8b-0935-4d1e-abf1-c57a5fb4f5e9","resolution":{"observed_at":"2026-08-04T19:02:40.849020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T19:02:40.693596Z","title":"CoRR, abs/2602.10439","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T19:02:40.693596Z"},"links":{"citing_paper":"/paper/2608.01881"},"observation_digest":"sha256:8d0499e765adcabae7f30b2b9a019a04fa7b0e96962304da345abaf0ac81e1b8","observation_id":"a4d5a1be-9bd3-4ea1-8cc1-7032541fc61f","resolution":{"observed_at":"2026-08-04T19:02:40.693596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01881","last_updated":"2026-08-03T08:24:54Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-16T18:27:51.029961Z","submitted_at":"2026-08-03T08:24:54Z","title":"Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2608.01881."}