{"as_of":"2026-08-10T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:18ff5e1add0e5c1bbfc31faee6d5803b7485525209768ba58ec8b7b80592a9f9","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:47.312912Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T07:38:23.099479Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T07:39:48.791735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"cited_work":{"arxiv_id":"2505.19294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19294","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards reliable large audio language model","venue":null,"work_id":"8acad1c1-7255-4fa2-b791-5fd608197d4e","year":2025},"citing_paper":{"arxiv_id":"2604.09021","last_updated":"2026-04-10T06:35:46Z","snapshot_observed_at":"2026-08-03T17:17:39.935538Z","submitted_at":"2026-04-10T06:35:46Z","title":"Noise-Aware In-Context Learning for Hallucination Mitigation in ALLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T17:41:59.761237Z"},"links":{"cited_paper":"/paper/2505.19294","citing_paper":"/paper/2604.09021"},"observation_digest":"sha256:69b271a7685f18efbc1430389166e9f63c2310c488e3611f0fbe86c06e972fb9","observation_id":"0f15fab5-e1bc-486a-8b2f-4c2c577242ac","resolution":{"observed_at":"2026-05-11T06:20:55.693565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"cited_work":{"arxiv_id":"2505.19294","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19294","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards reliable large audio language model","venue":null,"work_id":"8acad1c1-7255-4fa2-b791-5fd608197d4e","year":2025},"citing_paper":{"arxiv_id":"2605.20266","last_updated":"2026-05-18T20:21:32Z","snapshot_observed_at":"2026-08-03T05:12:45.221230Z","submitted_at":"2026-05-18T20:21:32Z","title":"A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook","version":1},"reference_index":146,"source":"pdf_text","source_observed_at":"2026-05-21T07:38:23.099479Z"},"links":{"cited_paper":"/paper/2505.19294","citing_paper":"/paper/2605.20266"},"observation_digest":"sha256:ca7bf3d41e734a4476ebc09484f8394612eb29f705a2e7dabfd1c3e950ddead6","observation_id":"ca232af0-64f2-4806-b9e5-f924fb93475d","resolution":{"observed_at":"2026-05-21T07:39:48.793504Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19294/citation-record","integrity":"/paper/2505.19294/integrity","json":"/paper/2505.19294/citation-record.json","paper":"/paper/2505.19294"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-07T14:23:41.696101Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:41.696101Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:8d75634bd5358e03d29f0b0731cc8dab01e9b3213552b33e903fed45da95e2df","observation_id":"5aafaf54-90f5-4997-8f0d-d1a0bfb7a038","resolution":{"observed_at":"2026-08-07T14:23:41.696101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15685","last_updated":"2024-11-24T02:21:28Z","snapshot_observed_at":"2026-08-08T06:41:23.297425Z","submitted_at":"2024-11-24T02:21:28Z","title":"State-Space Large Audio Language Models","version":1},"cited_work":{"arxiv_id":"2411.15685","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.15685","snapshot_observed_at":"2026-08-07T14:23:47.775279Z","title":"State-Space Large Audio Language Models","venue":"eess.AS","work_id":"6575b214-92c5-4e59-9543-c7abc8f881d4","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:41.773642Z"},"links":{"cited_paper":"/paper/2411.15685","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:8129b17cd98f8aee8460150d45c7ecc7007fe92dc7f1a910152785928f10e31b","observation_id":"32074b85-7582-4e86-b335-79e93b4ede4e","resolution":{"observed_at":"2026-08-07T14:23:47.897076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.784085Z","title":null,"venue":null,"work_id":"41b9f7c4-6d30-44da-a6d3-a3d08d1f8c1c","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:41.888791Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:205cad29011060630765f5bd622868489a2e1d7e6c756bffec22cbe923762478","observation_id":"07beb196-4b37-49e8-b578-f69c0584641a","resolution":{"observed_at":"2026-08-07T14:23:54.869593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.598679Z","title":null,"venue":null,"work_id":"bd5606b0-bc12-4732-b1c5-4767d708e58e","year":2025},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:41.999194Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:5116f83b01fb63b5b2592ef3b17014450d4d4594375cc31e4ff5835d383eef67","observation_id":"8bb0725b-f73c-4520-bda2-4712a31b4a79","resolution":{"observed_at":"2026-08-07T14:23:54.674906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.454482Z","title":null,"venue":null,"work_id":"3d6d7b93-adb5-4f3d-a94a-14e6d6b66ae2","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.090802Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:4ff110174368146597b3d1904bd6d6abed44e9d590a61fdda3bb109232432f80","observation_id":"a697a2b3-c9b6-462f-9e2a-0ed4fe1979c3","resolution":{"observed_at":"2026-08-07T14:23:54.529777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.307853Z","title":null,"venue":null,"work_id":"f838f3ba-e1c9-4448-b824-9d723612d9a9","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.183251Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:2603a6e642cea8ac06887d40d8238814c4ba623633a6d0a1d17f1d8030b66867","observation_id":"c4d10200-42e1-476c-921a-906110d0bbe0","resolution":{"observed_at":"2026-08-07T14:23:54.357956Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:42.324445Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.324445Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:c67b1b9ecfbec96e09c1036cdc09d863b9b1ba774a7b1dd0074b01b944b4cf13","observation_id":"152a89ff-8d75-4ce9-851d-4bdffef7a8d5","resolution":{"observed_at":"2026-08-07T14:23:42.324445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T14:23:42.443544Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.443544Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:b2bda12885a5ea9bc6c4eaa1f69737a052f8096118be2b51b49c13c1cd655ae6","observation_id":"ba27b85f-84a7-4695-9804-c9711937db6b","resolution":{"observed_at":"2026-08-07T14:23:42.443544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-07T14:23:42.551302Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.551302Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:591e68802c64bfc8566f0998037c6eec64a29f42cb79eda632cf95bef124dd37","observation_id":"23671ff6-6529-483e-8d27-c904bebeb391","resolution":{"observed_at":"2026-08-07T14:23:42.551302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00522","last_updated":"2024-06-01T18:06:26Z","snapshot_observed_at":"2026-08-09T02:16:48.784576Z","submitted_at":"2024-06-01T18:06:26Z","title":"Wav2Prompt: End-to-End Speech Prompt Generation and Tuning For LLM in Zero and Few-shot Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00522","snapshot_observed_at":"2026-08-07T14:23:42.627686Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.627686Z"},"links":{"cited_paper":"/paper/2406.00522","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:8fb482788308fe8e952465681ddb5b49b896581f480e2c663d2faa03550da732","observation_id":"a27c9206-5075-4015-bc32-a1959596579b","resolution":{"observed_at":"2026-08-07T14:23:42.627686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:54.105471Z","title":null,"venue":null,"work_id":"b24699fe-a40a-457d-b268-5a0c35429cb5","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.749889Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:d1f2eb327c2040f6c7b16dcf653baf169a5868441ba5c1e39f4bec3fed214aab","observation_id":"28389298-6968-4346-a1eb-8c92687b4fb8","resolution":{"observed_at":"2026-08-07T14:23:54.183555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02132","last_updated":"2024-11-05T03:29:41Z","snapshot_observed_at":"2026-08-04T16:47:05.939806Z","submitted_at":"2024-05-03T14:35:58Z","title":"Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets","version":3},"cited_work":{"arxiv_id":"2405.02132","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.02132","snapshot_observed_at":"2026-08-07T14:23:47.596444Z","title":"Unveiling the Potential of LLM-Based ASR on Chinese Open-Source Datasets","venue":"cs.SD","work_id":"1541de7c-a944-4511-a3f4-2535255b89dd","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.852762Z"},"links":{"cited_paper":"/paper/2405.02132","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:d44f8be8b7123f4d017c081c1940b3dc262e9ed3f23be989c07fc6429dfd1e2e","observation_id":"669b60c3-5667-44db-9815-abc77c32bd7c","resolution":{"observed_at":"2026-08-07T14:23:47.651226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.947501Z","title":null,"venue":null,"work_id":"8621d1f6-1467-49d4-b3df-49bfe77149cb","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:42.945563Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:0746e627b7b44844dba10c583656996cbed8319cfbfdf279c5d7619a6982bf65","observation_id":"92965147-5d1f-42a5-a1af-81f0b50908b7","resolution":{"observed_at":"2026-08-07T14:23:54.027258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.790392Z","title":null,"venue":null,"work_id":"8e494162-f160-4072-b2a6-9fe2fc57d285","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.054022Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:50680198fc3f662e3612083fe5b7bb6f0c4907575eacd7b1925cf82dbc5b74cd","observation_id":"f6159c5a-2c46-4a70-9e27-ea8b6653ac8e","resolution":{"observed_at":"2026-08-07T14:23:53.856349Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.640322Z","title":null,"venue":null,"work_id":"cbd7c956-f9cc-400d-902f-830430af2503","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.141664Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:94578d1879c92619927785c4442de777fc1272a08e91fb102f7db81bfd800cdc","observation_id":"4246e882-1f17-4f9c-9374-e6f6f250c01e","resolution":{"observed_at":"2026-08-07T14:23:53.702626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T14:23:43.265518Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.265518Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:a42e88e17560a890d4127d05d2883d85898b2f01e3b8688fdbb708a6dffa5729","observation_id":"b8b3b9fd-0bf7-4674-b149-38aaa3ac50b7","resolution":{"observed_at":"2026-08-07T14:23:43.265518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.499965Z","title":null,"venue":null,"work_id":"a3bfb1d3-2dcb-4958-afee-16c61b29a2ea","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.395754Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:fc7bce82a55370d7bf13dd8da41fcb9308bc944e1c01f830b6b586d182d926da","observation_id":"e6ffea11-83fb-49b5-8d69-6997dfccb9bb","resolution":{"observed_at":"2026-08-07T14:23:53.539490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.321229Z","title":null,"venue":null,"work_id":"ed61f409-4a4b-4dbc-ae31-18364c3d6c2f","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.501630Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:64f783d803fb449fdd31c7440a7dcd34854bcd1721a2610530a2e34fcc525ca2","observation_id":"eb39713d-8e5f-4e94-a8b9-1fc931c5df80","resolution":{"observed_at":"2026-08-07T14:23:53.400489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01162","last_updated":"2025-05-19T22:01:39Z","snapshot_observed_at":"2026-07-06T19:25:38.051475Z","submitted_at":"2024-10-02T01:32:47Z","title":"Frozen Large Language Models Can Perceive Paralinguistic Aspects of Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01162","snapshot_observed_at":"2026-08-07T14:23:43.579497Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.579497Z"},"links":{"cited_paper":"/paper/2410.01162","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:fd18d3778e58572af7bc99bb16eed48059b09a747d140896d6299fec6b6c8d7b","observation_id":"c3bbf526-bda1-4827-9a46-e37b6324b2ce","resolution":{"observed_at":"2026-08-07T14:23:43.579497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.177622Z","title":null,"venue":null,"work_id":"58306a5f-4c06-4508-9c0b-8ea9ba13ddfb","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.656485Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:cdaf7059558394686ccc1db8c95a4a01c6e71c4c00118cb5764a23ae5dbfa09e","observation_id":"6ce27931-41b7-4f9f-9b09-92ea517d640b","resolution":{"observed_at":"2026-08-07T14:23:53.239980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:53.010805Z","title":null,"venue":null,"work_id":"127ffd16-d0e9-42cb-98b4-1f6f41f48d3c","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.761904Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:b0adbc05f2269a91ee8bc417bb9b1f1a62b7d15fd3c5a8848ee673ded1ff6a36","observation_id":"0968a07d-2309-48a1-a45e-0e832fe07658","resolution":{"observed_at":"2026-08-07T14:23:53.063924Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.882641Z","title":null,"venue":null,"work_id":"6a017d1e-e6df-408d-8f55-0ce4005314a7","year":2025},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.845425Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:7dcc11c7197527395b30cecad827469488c423ea19da85be258a8ccfdef788be","observation_id":"5a069501-cfb1-42e9-ac3e-81e0732b0ce6","resolution":{"observed_at":"2026-08-07T14:23:52.933620Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:43.946182Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:43.946182Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:3ee98728d412a817ac7c0241475483826ea2e3484442f98876d17dd214877927","observation_id":"acea3284-9b2b-4e34-8ff0-2e7f01c6ff37","resolution":{"observed_at":"2026-08-07T14:23:43.946182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.717024Z","title":null,"venue":null,"work_id":"3b754e94-835c-4d29-8bcc-2eb02dca756d","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.034384Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:9f45884d7b4582f8401beb299b7fcdcc846b19c10b3d8800d910a838bfc4752a","observation_id":"e3a3b1cf-e05a-484b-a9dc-8c6d349649f4","resolution":{"observed_at":"2026-08-07T14:23:52.804777Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.568922Z","title":null,"venue":null,"work_id":"4ec33f04-b520-44e4-9a9c-11760ff344bc","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.115577Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:c6916bf0980ea547a417b3661b1da5f47e879ff456836d1e4074421e0632a0bf","observation_id":"4cf77582-f3a0-4a2c-8bd7-a7de15a16876","resolution":{"observed_at":"2026-08-07T14:23:52.650614Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.434523Z","title":null,"venue":null,"work_id":"7df90bcd-8c42-4160-be24-5f8ba9fafed5","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.231226Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:dd89f2a6f2ff58945c7a981086a29fab5027690e351d97d25b59a8830c57e836","observation_id":"dc92879e-18c8-4182-aff9-39c4c9f2d771","resolution":{"observed_at":"2026-08-07T14:23:52.517808Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.287183Z","title":null,"venue":null,"work_id":"bb562eb1-a8ba-44e7-b003-bba03d1ce904","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.311670Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:4caf42041ac0791eea5aa6929adac9ef49632083cbd592594f6b1d257f361609","observation_id":"4fa49e9b-ebc2-4c22-8ee1-67a759170f7f","resolution":{"observed_at":"2026-08-07T14:23:52.360952Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:52.116446Z","title":null,"venue":null,"work_id":"1551bd62-12f5-4b38-92b1-509fa57744f9","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.424525Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:41977345a87e07a4ea99cf73d6a000b63f229443b2003fa5e7b7afb9d64d67b1","observation_id":"f343859b-deb7-485b-8fc8-f420a45ad0bc","resolution":{"observed_at":"2026-08-07T14:23:52.193487Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20007","last_updated":"2025-01-27T08:46:09Z","snapshot_observed_at":"2026-08-05T02:18:00.592980Z","submitted_at":"2024-09-30T07:01:21Z","title":"DeSTA2: Developing Instruction-Following Speech Language Model Without Speech Instruction-Tuning Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20007","snapshot_observed_at":"2026-08-07T14:23:44.535221Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.535221Z"},"links":{"cited_paper":"/paper/2409.20007","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:1775b57af0595d1c8dfd6317def4fc51bd967f57129e31906513cc542dc2b066","observation_id":"60fba7c7-1529-45b8-83a6-bd55603d68ff","resolution":{"observed_at":"2026-08-07T14:23:44.535221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.998857Z","title":null,"venue":null,"work_id":"888be805-d748-4df3-8cc6-8cef17115719","year":2022},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.623591Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:88df498e16b8fd7464b2e4f6ace99b87d4184b48bdd80240d1245ac4512fe529","observation_id":"b2585190-9f1d-46f2-8129-243533a4f8a7","resolution":{"observed_at":"2026-08-07T14:23:52.050482Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.860682Z","title":null,"venue":null,"work_id":"8c26d7cb-0733-4da0-854a-38ffcba9e0cf","year":2025},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.747659Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:5ecca65b79afae78e9c57e24e090aeb0086173ec14042faf20f9ed9175d4be64","observation_id":"4c3e3ff1-e505-43da-a863-4a1125f90a8d","resolution":{"observed_at":"2026-08-07T14:23:51.924915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-06T09:11:01.697195Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T14:23:44.823846Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.823846Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:8bb849ddd643b160f95bc86bb1b79c6209dc92b88b10809ed369086efcddbd23","observation_id":"5f441813-8722-4c41-ac64-1c2786b0fdc7","resolution":{"observed_at":"2026-08-07T14:23:44.823846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.713898Z","title":null,"venue":null,"work_id":"258b2dcd-8e64-48c8-92a0-234e54182fac","year":2025},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.901959Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:d095af639ae427a2443990536ad5eb5bad99f27b73462cba508b38c3450e2728","observation_id":"fd39856e-0f37-4514-b7f4-76b0f47ac538","resolution":{"observed_at":"2026-08-07T14:23:51.791428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.08596","last_updated":"2025-04-02T16:16:33Z","snapshot_observed_at":"2026-08-08T17:41:36.283228Z","submitted_at":"2024-09-13T07:28:28Z","title":"Large Language Model Can Transcribe Speech in Multi-Talker Scenarios with Versatile Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.08596","snapshot_observed_at":"2026-08-07T14:23:44.996293Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:44.996293Z"},"links":{"cited_paper":"/paper/2409.08596","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:6756b0322c43506d96f0648dc1e58f7747915796142052fbd0d1a4949d853ed7","observation_id":"ce4091db-37f5-47a8-8b03-6593e8675e13","resolution":{"observed_at":"2026-08-07T14:23:44.996293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06393","last_updated":"2024-11-05T15:40:25Z","snapshot_observed_at":"2026-07-06T17:57:48.153936Z","submitted_at":"2024-04-09T15:35:52Z","title":"MuPT: A Generative Symbolic Music Pretrained Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06393","snapshot_observed_at":"2026-08-07T14:23:45.091507Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.091507Z"},"links":{"cited_paper":"/paper/2404.06393","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:bfe469be58e83a036d02046d65f3f712c5f9b2ad42ac2c47df66a49a0a44dee5","observation_id":"c9a6b40e-1708-41bd-aea1-cbe352a56835","resolution":{"observed_at":"2026-08-07T14:23:45.091507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.576795Z","title":null,"venue":null,"work_id":"8a36dfc5-e38a-4ce7-aabe-fbdc2ae402db","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.202643Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:73fc034164adb9d326d8856d313df2069829b17c86696742d6afd313db32ae2f","observation_id":"e0de4e31-516d-44aa-b9c6-37ccb2421fc1","resolution":{"observed_at":"2026-08-07T14:23:51.637280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-07-06T19:39:23.839070Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-07T14:23:45.319318Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.319318Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:3a218830b012dea7af05a0e95e630cfeae63983f37ff5059cfe0e9f61079f49c","observation_id":"bf0be10f-3052-487b-8bab-fe8e5bdd43d6","resolution":{"observed_at":"2026-08-07T14:23:45.319318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.453653Z","title":null,"venue":null,"work_id":"e282ff44-8523-4114-aad7-a3cda82c8d20","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.400446Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:8c4c19512cdc3f85127db7527eee3725593449545520e5e0e799891d65de8b6e","observation_id":"3198994d-d594-417c-910c-3d5230fb569a","resolution":{"observed_at":"2026-08-07T14:23:51.519986Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.323526Z","title":null,"venue":null,"work_id":"667f6568-09d8-41b4-89a4-163cf0f1b346","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.469192Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:516502a692524f7049f02db86f0b49fcad0c516a2c81b947564a257a45e43b9b","observation_id":"114002b3-4f14-4aa0-8daf-e0f94ce206ea","resolution":{"observed_at":"2026-08-07T14:23:51.397375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00916","last_updated":"2024-05-28T14:26:28Z","snapshot_observed_at":"2026-07-06T16:13:34.788427Z","submitted_at":"2023-09-02T11:46:05Z","title":"BLSP: Bootstrapping Language-Speech Pre-training via Behavior Alignment of Continuation Writing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00916","snapshot_observed_at":"2026-08-07T14:23:45.561089Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.561089Z"},"links":{"cited_paper":"/paper/2309.00916","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:d4c462649fd3d9f5ad5bee29b7064b83895e36bddb1dd3737fb4182dbc1af8f5","observation_id":"a1560d01-4f81-4119-825a-81f305426c83","resolution":{"observed_at":"2026-08-07T14:23:45.561089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04673","last_updated":"2024-07-03T02:38:03Z","snapshot_observed_at":"2026-08-02T08:46:39.076208Z","submitted_at":"2023-10-07T03:17:59Z","title":"LauraGPT: Listen, Attend, Understand, and Regenerate Audio with GPT","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04673","snapshot_observed_at":"2026-08-07T14:23:45.671049Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.671049Z"},"links":{"cited_paper":"/paper/2310.04673","citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:9f8a28a13d95415eca1ea0631e11575c0bab28dbece7b6099dad8ac2c4fe7cf0","observation_id":"6afe8582-3ffc-4312-992a-edafba17ca50","resolution":{"observed_at":"2026-08-07T14:23:45.671049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:51.140829Z","title":null,"venue":null,"work_id":"584057e4-f353-4d88-9d5e-b3b0a87d36a7","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.765257Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:e831f7c780c941edffcdb485b39d07711e3943ce50786eed049cfaedb30eb1ef","observation_id":"ca92976d-b760-4935-85ca-2e5832432f40","resolution":{"observed_at":"2026-08-07T14:23:51.242513Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.978402Z","title":null,"venue":null,"work_id":"b16ac837-f4df-4ab6-abff-53b658c54c91","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:45.874209Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:493c99af19f85baae893fa210588d98ccda9e3352f5b06af815b5a49179e5f0d","observation_id":"189dba99-6d35-43bf-9ba7-2bbca8efa454","resolution":{"observed_at":"2026-08-07T14:23:51.102060Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.750148Z","title":null,"venue":null,"work_id":"fa4aa809-2137-44ce-8677-2b80448f7d14","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.007822Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:ffebe6bda377325498cabba2b6a7b21d537ae8c2721a43522b20ef57d5515021","observation_id":"42a8c338-c79b-469a-bbb1-39f45d9814de","resolution":{"observed_at":"2026-08-07T14:23:50.865197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.484984Z","title":null,"venue":null,"work_id":"c76df5bf-05fc-46bc-9717-ed153f0d1b3b","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.092746Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:9455094194ffe5b13d5dd299b5aa90678bf625fc2692554c240d34641010879d","observation_id":"b9c041e4-4ebc-4268-a3c5-5d46586afed5","resolution":{"observed_at":"2026-08-07T14:23:50.581139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:50.263767Z","title":null,"venue":null,"work_id":"61d42065-0878-4686-8f71-772008493484","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.189849Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:8c15983b98c85f66b53d7ce4e2d09edf68c22bf84d6d665925c1dc016ebb1351","observation_id":"87763e48-43af-42aa-9289-6ea099414686","resolution":{"observed_at":"2026-08-07T14:23:50.390551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:49.995908Z","title":null,"venue":null,"work_id":"c566a015-bb83-4b48-9fd5-b7d370b5bed6","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.292830Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:92d8134045a7c726dbd3e6b41cb2a620bedf8de87a915be816472a1532b291d2","observation_id":"a23e5d54-b221-4af4-9a34-39aa14699973","resolution":{"observed_at":"2026-08-07T14:23:50.144000Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:49.773648Z","title":null,"venue":null,"work_id":"0d5afd87-7f5d-4c8a-93aa-e69cb8f80a84","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.379534Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:bd68ec960cd02faa10b374c47daa59459a6390b7da2ac3bca62d14be63762218","observation_id":"e9d1a6bf-ce65-47ce-8ef9-4fa38587a0b0","resolution":{"observed_at":"2026-08-07T14:23:49.888085Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:49.527321Z","title":null,"venue":null,"work_id":"ec90be5b-2b07-4c29-af93-9c5455c1d3a7","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.468819Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:a9376e66a4b19418e368312a4566993ebe75c35b9acac062cccd2647fb3b2e78","observation_id":"171edd3d-953f-48be-bf78-8774a2ce6eb3","resolution":{"observed_at":"2026-08-07T14:23:49.658405Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:49.261956Z","title":null,"venue":null,"work_id":"f5b6d07c-16e5-4b56-99ef-bfafb72f9b5e","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.587717Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:67a5e47ebb670c7466c5e3a1c9d799f87502500a7de15fe9e048ccaae8fd8a57","observation_id":"560b1eb6-c9bb-44b8-9da0-70dfa3e5eab2","resolution":{"observed_at":"2026-08-07T14:23:49.409977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:49.076228Z","title":null,"venue":null,"work_id":"cfd8a8e1-1a63-494f-b565-c82e77b70212","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.714461Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:56adcde70808e83428609cf2fcfae750b66589be9dc663f12c15f25493193eaa","observation_id":"e538db27-339d-49ee-b4ef-aa101b735898","resolution":{"observed_at":"2026-08-07T14:23:49.148473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:48.784675Z","title":null,"venue":null,"work_id":"f0ca0873-a342-4746-9dbc-78f004acb503","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.806607Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:ad6cb343573f0d68bab01a704d57327877bcb031a0d09cd5361053d03e0a2427","observation_id":"c9be9ff9-e795-4674-8ba1-50261a14f5ff","resolution":{"observed_at":"2026-08-07T14:23:48.897723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:48.486978Z","title":null,"venue":null,"work_id":"2a742a09-602f-46b9-85fa-0b9595dbaff6","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.912860Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:90f4979b1e04428ab4e7f415e511af720ed9d0ce47ddc34e94fbcfa64458ba93","observation_id":"cb50c5fd-cfcb-4ca1-abc8-2e433f722018","resolution":{"observed_at":"2026-08-07T14:23:48.599039Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:48.255420Z","title":null,"venue":null,"work_id":"980e4f1e-4d8e-40b8-acd4-4660eabf5d47","year":2024},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:46.999307Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:a654818c152b56e5b12d9e8079223730071ae3940f1373bd1e7b7295cdff4d76","observation_id":"a3793bff-73e8-47ca-a2e2-adaa09564255","resolution":{"observed_at":"2026-08-07T14:23:48.386897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:48.026025Z","title":null,"venue":null,"work_id":"2b187c11-c7e5-4135-b4b6-d37e2c8ddd4d","year":2023},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:47.106394Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:ba8c858d387e97e3610bdd9935bc8e3d4af71de8829254c16c47119af3bd51e8","observation_id":"23b3a5ae-1e49-4eb6-8a39-d2e1ba3549f7","resolution":{"observed_at":"2026-08-07T14:23:48.096314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:47.202040Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:47.202040Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:8446951e12eb34790c624ec0fc691c0bec075828e09bdafa1b6aa6e5dee1353e","observation_id":"e2c87a0e-18ab-494c-b56a-39693b004ff4","resolution":{"observed_at":"2026-08-07T14:23:47.202040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:47.312912Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T14:23:47.312912Z"},"links":{"citing_paper":"/paper/2505.19294"},"observation_digest":"sha256:96d4db49355142dd3c1b5d0dac2b01d8a0ae4b774b038f463c7a7b0e7d2292d9","observation_id":"13c9f52c-7862-41f0-b375-231a158b59a3","resolution":{"observed_at":"2026-08-07T14:23:47.312912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19294","last_updated":"2025-05-25T20:00:31Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T14:15:05.149434Z","submitted_at":"2025-05-25T20:00:31Z","title":"Towards Reliable Large Audio Language Model"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2505.19294."}