{"as_of":"2026-08-09T12:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ee6b9a159d3a984060fd9f9905e396a25806f9002da16e8f5657da1d3ecfeee","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":27,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:40:25.950869Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-08T22:40:25.950869Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04476","last_updated":"2025-02-06T20:00:43Z","snapshot_observed_at":"2026-08-09T05:49:55.024161Z","submitted_at":"2025-02-06T20:00:43Z","title":"ADIFF: Explaining audio difference using natural language","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-08T22:40:25.950869Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2502.04476"},"observation_digest":"sha256:74221d4c1bc731529074b269184605f5f010d1bfbc76d9b47518358dabab7787","observation_id":"c0617f60-88eb-4658-89b5-6cd0b76d2cf5","resolution":{"observed_at":"2026-08-08T22:40:25.950869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-08T12:14:20.285144Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07608","last_updated":"2025-04-28T18:35:59Z","snapshot_observed_at":"2026-08-08T12:07:20.049894Z","submitted_at":"2025-02-11T14:58:54Z","title":"Time2Lang: Bridging Time-Series Foundation Models and Large Language Models for Health Sensing Beyond Prompting","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T12:14:20.285144Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2502.07608"},"observation_digest":"sha256:25411229362682e34d6b404c8c813e5ec02cfc275285fd84e33a2f92907e6d0a","observation_id":"ba213a9a-be8e-45cf-893e-b3cbf58b5c4c","resolution":{"observed_at":"2026-08-08T12:14:20.285144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-08T14:46:05.831117Z","title":"https: //arxiv.org/abs/2406.11768","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09645","last_updated":"2025-02-10T16:55:13Z","snapshot_observed_at":"2026-08-08T14:40:41.346707Z","submitted_at":"2025-02-10T16:55:13Z","title":"From No to Know: Taxonomy, Challenges, and Opportunities for Negation Understanding in Multimodal Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T14:46:05.831117Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2502.09645"},"observation_digest":"sha256:39d3dfdd267e6562795a56c6b90919a4526b955b6189b87e5e985895f85afb61","observation_id":"b145106a-5068-410f-925b-b26c182da3e3","resolution":{"observed_at":"2026-08-08T14:46:05.831117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T19:21:26.933349Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2504.18425"},"observation_digest":"sha256:dd70033256e60637d11b2eefe00a250484de3c3e4de92711ad7049a80cc29d40","observation_id":"6988f0d0-69cc-4727-896c-f2bdbc257da9","resolution":{"observed_at":"2026-05-11T19:21:27.293952Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-07T15:29:06.347770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15000","last_updated":"2025-05-21T01:07:00Z","snapshot_observed_at":"2026-08-07T15:23:25.479987Z","submitted_at":"2025-05-21T01:07:00Z","title":"Towards Spoken Mathematical Reasoning: Benchmarking Speech-based Models over Multi-faceted Math Problems","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:29:06.347770Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2505.15000"},"observation_digest":"sha256:bdf3466874fac048050b654818960c8ec0a537437d234c72f1831568e9494e47","observation_id":"be7bd3bd-d8fd-4713-8ca7-15a84fd921ec","resolution":{"observed_at":"2026-08-07T15:29:06.347770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-07T15:23:01.440392Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities // arXiv preprint arXiv:2406.11768","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15406","last_updated":"2025-05-21T11:47:47Z","snapshot_observed_at":"2026-08-07T15:16:06.018745Z","submitted_at":"2025-05-21T11:47:47Z","title":"Audio Jailbreak: An Open Comprehensive Benchmark for Jailbreaking Large Audio-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:23:01.440392Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2505.15406"},"observation_digest":"sha256:6d8adedde7e32be2ba69d3e51d2893b298110abaa3e395997ff80eef7ba2411b","observation_id":"7736233f-1a62-4215-91ab-9ca5f3ef4338","resolution":{"observed_at":"2026-08-07T15:23:01.440392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2505.16933","last_updated":"2025-06-04T05:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-22T17:23:26Z","title":"LLaDA-V: Large Language Diffusion Models with Visual Instruction Tuning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T03:46:06.074416Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2505.16933"},"observation_digest":"sha256:b076d240d0683c468625922c139a05b60e267c1d5013fc46388da9d6cefb9e03","observation_id":"06d1d233-677c-4da6-a2ad-61236a8de789","resolution":{"observed_at":"2026-05-17T03:46:06.395741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-07T12:46:44.029065Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23625","last_updated":"2025-05-29T16:31:45Z","snapshot_observed_at":"2026-08-09T00:06:44.396244Z","submitted_at":"2025-05-29T16:31:45Z","title":"ZeroSep: Separate Anything in Audio with Zero Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:44.029065Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2505.23625"},"observation_digest":"sha256:db2a63594a415217b4947d2e66d60b91dce25310fa1feebefd531dc16748eb8a","observation_id":"c0dd767a-54c1-4b52-bf78-eb6630114878","resolution":{"observed_at":"2026-08-07T12:46:44.029065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-07T04:54:13.519625Z","title":"Gama: A large audio-language model with advanced audio under- standing and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09375","last_updated":"2025-08-23T19:55:31Z","snapshot_observed_at":"2026-08-07T04:47:32.667457Z","submitted_at":"2025-06-11T03:50:16Z","title":"CoLMbo: Speaker Language Model for Descriptive Profiling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:54:13.519625Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2506.09375"},"observation_digest":"sha256:3c3630bd2b5f93a1da9089baa13506928e3e7317bdcc0c7cef4be4d44706fe82","observation_id":"9c967c50-3543-44f4-b64c-13e5197827fb","resolution":{"observed_at":"2026-08-07T04:54:13.519625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-06T19:26:53.686731Z","title":"Gama: A large audio-language model with advanced audio un- derstanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.05609","last_updated":"2025-07-08T02:37:20Z","snapshot_observed_at":"2026-08-06T19:19:37.382327Z","submitted_at":"2025-07-08T02:37:20Z","title":"MMW: Side Talk Rejection Multi-Microphone Whisper on Smart Glasses","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T19:26:53.686731Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2507.05609"},"observation_digest":"sha256:b42a782daef8ac258dc65613110e1a0280c5669380db0a35f3bca4705d543535","observation_id":"d7d42a5d-675f-4ef8-b663-e85edb03d41f","resolution":{"observed_at":"2026-08-06T19:26:53.686731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-06T19:46:11.380266Z","title":"Ghosh, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06256","last_updated":"2025-07-07T07:29:52Z","snapshot_observed_at":"2026-08-09T02:06:38.978195Z","submitted_at":"2025-07-07T07:29:52Z","title":"Attacker's Noise Can Manipulate Your Audio-based LLM in the Real World","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T19:46:11.380266Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2507.06256"},"observation_digest":"sha256:e9e70b85bbb577aa6fdcb6a643ab6e9d921d8bb69fd30471d632658aa610b20a","observation_id":"2e732449-e696-4d5f-ae28-3f39fa1338d7","resolution":{"observed_at":"2026-08-06T19:46:11.380266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-06T17:45:45.070152Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10016","last_updated":"2025-08-20T07:04:41Z","snapshot_observed_at":"2026-08-09T00:30:53.528782Z","submitted_at":"2025-07-14T07:51:56Z","title":"The Man Behind the Sound: Demystifying Audio Private Attribute Profiling via Multimodal Large Language Model Agents","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T17:45:45.070152Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2507.10016"},"observation_digest":"sha256:4400eb2f85869c9bc6b1a0285d4eb53f9ab464f12164334259fbe1fa34e592dc","observation_id":"a4ccc679-865f-47a5-9b35-54313167a882","resolution":{"observed_at":"2026-08-06T17:45:45.070152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-06T14:50:04.254194Z","title":"ArXiv abs/2406.11768 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.17563","last_updated":"2025-07-23T14:53:50Z","snapshot_observed_at":"2026-08-07T18:31:16.203029Z","submitted_at":"2025-07-23T14:53:50Z","title":"BoSS: Beyond-Semantic Speech","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T14:50:04.254194Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2507.17563"},"observation_digest":"sha256:7fb4a5709fe487f6a6f7ad8a629f5035c7d6363569edae28cbb2deaed54f6760","observation_id":"97846861-2b18-4eba-a1bd-0d568262121a","resolution":{"observed_at":"2026-08-06T14:50:04.254194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T18:23:28.522442Z","title":"Sakshi, Oriol Ni- eto, Ramani Duraiswami, and Dinesh Manocha","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.00029","last_updated":"2025-08-20T13:54:53Z","snapshot_observed_at":"2026-08-08T11:08:56.983262Z","submitted_at":"2025-08-20T13:54:53Z","title":"From Sound to Sight: Towards AI-authored Music Videos","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T18:23:28.522442Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2509.00029"},"observation_digest":"sha256:f79668e3ce1b39af49015366d2cf1c593fccbbe714cfdc01f9b03a44b844337c","observation_id":"b03fa92e-d669-4b4c-b3cc-618d47076bdd","resolution":{"observed_at":"2026-08-05T18:23:28.522442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-04T17:54:57.124210Z","title":"Gama: A large audio-language model with ad- vanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10391","last_updated":"2025-09-12T16:31:20Z","snapshot_observed_at":"2026-08-05T08:01:36.767909Z","submitted_at":"2025-09-12T16:31:20Z","title":"Improving Audio Event Recognition with Consistency Regularization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:54:57.124210Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2509.10391"},"observation_digest":"sha256:3b1ecf889141c2dc7ebbbc221355a22cf54dca25854fff0d1a32378bc438c143","observation_id":"aaef49ed-b065-46dc-bb5a-1772b68ba670","resolution":{"observed_at":"2026-08-04T17:54:57.124210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2512.02231","last_updated":"2026-04-10T02:23:14Z","snapshot_observed_at":"2026-07-06T22:37:31.360740Z","submitted_at":"2025-12-01T21:57:26Z","title":"See, Hear, and Understand: Benchmarking Audiovisual Human Speech Understanding in Multimodal Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T02:12:55.170296Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2512.02231"},"observation_digest":"sha256:5b297a066eaf0a5ee363631ddc6bd2bc0135241df6a011b64615d7dddd831b63","observation_id":"9ac6ba19-b231-44c4-a136-9a515157f6f3","resolution":{"observed_at":"2026-05-17T02:13:52.187373Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-03T12:01:59.901861Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-06T01:59:30.134013Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-03T12:01:59.901861Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:c010fc41c84e5ab3f17192d1b1b1596be47680035c0a70aa82d7aef6cc15352e","observation_id":"b8a97e48-dde2-4ad5-8b68-ff191afc5bd4","resolution":{"observed_at":"2026-08-03T12:01:59.901861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-07-13T16:50:28.996341Z","title":"Arushi Goel, Sreyan Ghosh, Jaehyeon Kim, Sonal Ku- mar, Zhifeng Kong, Sang gil Lee, Chao-Han Huck Yang, Ramani Duraiswami, Dinesh Manocha, Rafael Valle, and Bryan Catanzaro","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27667","last_updated":"2026-05-28T11:00:35Z","snapshot_observed_at":"2026-08-02T13:16:24.345827Z","submitted_at":"2026-03-29T12:32:04Z","title":"EvA: An Evidence-First Audio Understanding Paradigm for LALMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T16:50:28.996341Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2603.27667"},"observation_digest":"sha256:56b18d7b769a25f904cfb644c55fe9fae3c000541c17ccb2a8568060ed9958b7","observation_id":"807caf8f-a394-43e0-8e96-8cd188daff0d","resolution":{"observed_at":"2026-07-13T16:50:28.996341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2604.09721","last_updated":"2026-04-08T16:42:50Z","snapshot_observed_at":"2026-07-06T22:58:29.952947Z","submitted_at":"2026-04-08T16:42:50Z","title":"Jamendo-MT-QA: A Benchmark for Multi-Track Comparative Music Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T17:16:59.034480Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2604.09721"},"observation_digest":"sha256:529f2b34648ea0ab06323d3030a3e8db692254b20ba96ade6576596145c700f7","observation_id":"2897d192-ccdc-40cd-ae15-6f9526583675","resolution":{"observed_at":"2026-05-11T07:10:58.086055Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2604.14806","last_updated":"2026-04-16T09:30:13Z","snapshot_observed_at":"2026-08-01T04:51:16.142077Z","submitted_at":"2026-04-16T09:30:13Z","title":"Listen, Pause, and Reason: Toward Perception-Grounded Hybrid Reasoning for Audio Understanding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T09:24:25.616750Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2604.14806"},"observation_digest":"sha256:ece58c603c157c54c65d08fc70e031b8a633d12144919126c58c6668d9ec37d8","observation_id":"e8da2d69-0366-4eef-81b8-3841b3aeff5e","resolution":{"observed_at":"2026-05-10T09:28:38.897129Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2604.15383","last_updated":"2026-04-16T02:30:41Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T02:30:41Z","title":"Temporal Contrastive Decoding: A Training-Free Method for Large Audio-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T10:16:26.526986Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2604.15383"},"observation_digest":"sha256:3af3d3dabc22cba4c2bf8ab9718599128d16d175726843f75998d66ca96785f2","observation_id":"d74d148d-6114-4231-a16b-f7a6508132cf","resolution":{"observed_at":"2026-05-10T10:19:20.685275Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2605.23619","last_updated":"2026-05-22T13:26:47Z","snapshot_observed_at":"2026-07-06T23:33:49.013121Z","submitted_at":"2026-05-22T13:26:47Z","title":"Frame-Aligned Fusion of Canary and WavLM for Non-Intrusive Intelligibility Prediction of Hearing-Aid-Processed Speech","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T02:34:11.297579Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2605.23619"},"observation_digest":"sha256:e45702bd0f5d7c1058a63cfc81a3cf6d3600c9ec74bad10b5f4067c98637c031","observation_id":"34b70cd5-64b5-4786-8ee0-e3be2ff31c97","resolution":{"observed_at":"2026-05-25T02:35:14.575239Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-07-12T19:28:32.792370Z","title":"Gama: A large audio-language model with advanced audio understanding and complex reasoning abilities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.05177","last_updated":"2026-04-17T12:31:17Z","snapshot_observed_at":"2026-08-02T21:40:51.010741Z","submitted_at":"2026-04-17T12:31:17Z","title":"MCBench: A Multicontext Safety Assessment Benchmark for Omni Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-12T19:28:32.792370Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2606.05177"},"observation_digest":"sha256:07a42a9a68bea217267dcd1b547284334b7ac8b3f2974bd75892ab1e6b29032d","observation_id":"6fed932d-bdcb-4364-b48d-b905fc9f6aa3","resolution":{"observed_at":"2026-07-12T19:28:32.792370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2606.08425","last_updated":"2026-06-20T19:16:20Z","snapshot_observed_at":"2026-08-06T01:18:08.801931Z","submitted_at":"2026-06-07T02:50:24Z","title":"TinyGiantALM: A Compact Audio-Language Model for Intent-Aware Reasoning under Resource Constraints","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-27T18:18:41.816342Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2606.08425"},"observation_digest":"sha256:6b8e7dac0e6f53e4cc9ff0a9559fc6d7b8b0dac3a4b96a2195a610ad3ab13a11","observation_id":"b41efbd5-ea20-4409-a767-f73043369a62","resolution":{"observed_at":"2026-07-02T23:17:29.830453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:2cb2023f577f564060ce4c6b297ff7bf7500a3777690e39de87b2da22a545b7b","observation_id":"442e0517-a4c0-4866-b694-c9b6a67c0ec6","resolution":{"observed_at":"2026-06-30T22:15:05.181500Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":"2406.11768","doi":"10.48550/arxiv.2406.11768","metadata_source":"arxiv_reference","pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GAMA: A large audio- language model with advanced audio understanding and complex rea- soning abilities","venue":"arXiv (Cornell University)","work_id":"f407a4af-a90d-4687-b15e-70573cc84a5d","year":2024},"citing_paper":{"arxiv_id":"2606.23243","last_updated":"2026-06-22T12:28:33Z","snapshot_observed_at":"2026-08-03T08:35:01.520677Z","submitted_at":"2026-06-22T12:28:33Z","title":"Unlocking In-Context Learning in Audio-Language Models from Decentralized Medical Audio","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T09:16:25.450336Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2606.23243"},"observation_digest":"sha256:6184f4c3aa426d3cff7cc210bc6b3704e9498d67f7aedf414af215e9e0cc569b","observation_id":"4f5c37bc-1184-4884-bf90-ea0a7a740cfe","resolution":{"observed_at":"2026-07-04T09:59:45.495210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11768","snapshot_observed_at":"2026-07-14T12:48:58.688011Z","title":"arXiv preprint arXiv:2406.11768 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10299","last_updated":"2026-07-11T13:04:24Z","snapshot_observed_at":"2026-08-08T22:46:15.287802Z","submitted_at":"2026-07-11T13:04:24Z","title":"Empowering Long-form Omni-modal Understanding with Robust Audio Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T12:48:58.688011Z"},"links":{"cited_paper":"/paper/2406.11768","citing_paper":"/paper/2607.10299"},"observation_digest":"sha256:57dc01ad62241d4fa1f0c03e8082da3698d4ccdfb355f06eacb88c23612a9773","observation_id":"c8e42549-7300-4a39-b422-21309c1f4c80","resolution":{"observed_at":"2026-07-14T12:48:58.688011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.11768/citation-record","integrity":"/paper/2406.11768/integrity","json":"/paper/2406.11768/citation-record.json","paper":"/paper/2406.11768"},"outbound":[],"paper":{"arxiv_id":"2406.11768","last_updated":"2024-06-17T17:31:01Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-01T20:00:05.737836Z","submitted_at":"2024-06-17T17:31:01Z","title":"GAMA: A Large Audio-Language Model with Advanced Audio Understanding and Complex Reasoning Abilities"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 27 inbound Pith citation observations for arXiv:2406.11768."}