{"as_of":"2026-08-10T03:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9d538f587b5516c726ed2da33a97d4215ea794b150d47e9bdb98d642eeee0564","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:44:10.480282Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T04:34:51.502690Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T11:59:50.290848Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2604.10065","last_updated":"2026-04-11T07:07:08Z","snapshot_observed_at":"2026-07-06T22:58:47.599383Z","submitted_at":"2026-04-11T07:07:08Z","title":"ASPIRin: Action Space Projection for Interactivity-Optimized Reinforcement Learning in Full-Duplex Speech Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T17:05:45.214298Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2604.10065"},"observation_digest":"sha256:faedebb5fe9146a66b46575cdf7294b897cd710b3adfb7bd1c77ef10857e3eab","observation_id":"8237213e-27e0-40c7-ae58-b44b0174135d","resolution":{"observed_at":"2026-05-11T07:35:58.767529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2605.01766","last_updated":"2026-05-03T07:58:02Z","snapshot_observed_at":"2026-07-31T08:00:39.590873Z","submitted_at":"2026-05-03T07:58:02Z","title":"Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T15:27:23.591345Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2605.01766"},"observation_digest":"sha256:0fa1f354e105a785536ee16ac6a551d05f7fa1284f55051c45c38219962d4fdc","observation_id":"8aa52196-d75d-46e4-9250-f63e15d51196","resolution":{"observed_at":"2026-05-11T10:31:01.691407Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2606.13441","last_updated":"2026-06-11T15:03:48Z","snapshot_observed_at":"2026-08-07T13:54:11.075633Z","submitted_at":"2026-06-11T15:03:48Z","title":"Why Sampling Is Not Choosing: Intentionality, Agency, and Moral Responsibility in Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T07:06:09.694757Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2606.13441"},"observation_digest":"sha256:eca47518fa8e9abe5f5fa8ef684d26f2ffa7c109de466458112850f0860d3202","observation_id":"a2fc1a32-6337-4012-a4a2-3f9d151564ee","resolution":{"observed_at":"2026-07-03T14:18:23.018846Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2606.23052","last_updated":"2026-06-22T09:03:45Z","snapshot_observed_at":"2026-08-08T02:27:12.014256Z","submitted_at":"2026-06-22T09:03:45Z","title":"CAAD: Contrastive Audio-Aware Distillation for Efficient Speech Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T07:28:54.731659Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2606.23052"},"observation_digest":"sha256:e6170552baeac11fe24558eea13dad4e466f138758dc136baf1b4d615c68ee84","observation_id":"983188d8-d3a3-4f27-a65d-bbddca97c210","resolution":{"observed_at":"2026-07-04T11:59:50.295932Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":"2506.07233","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-07-04T11:59:50.290848Z","title":"Reducing object hallucination in large audio-language models via audio-aware decoding","venue":null,"work_id":"ec0048b6-de8c-4003-aea1-2115a7f349bf","year":2025},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-02T16:59:50.615875Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:1f1e2018d07fe593f63311bd3626dcaeba4daaa2eb1fae767e026517aa9fc204","observation_id":"ed5100fd-7b10-490a-887b-713eabcd402a","resolution":{"observed_at":"2026-07-02T17:07:12.164987Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07233","snapshot_observed_at":"2026-08-04T04:34:51.502690Z","title":"Available: https://arxiv.org/abs/2506.07233","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.00247","last_updated":"2026-08-02T10:40:21Z","snapshot_observed_at":"2026-08-06T23:24:46.404599Z","submitted_at":"2026-06-30T22:55:22Z","title":"Adaptive Perturbation Selection for Contrastive Audio Decoding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T04:34:51.502690Z"},"links":{"cited_paper":"/paper/2506.07233","citing_paper":"/paper/2607.00247"},"observation_digest":"sha256:a37c92f467ec1b3468e4565bc9dbb13847efa0603baa19bbfcd6383d500ddaa1","observation_id":"0bf97c73-03b4-4a5b-b749-61af2cdd2805","resolution":{"observed_at":"2026-08-04T04:34:51.502690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.07233/citation-record","integrity":"/paper/2506.07233/integrity","json":"/paper/2506.07233/citation-record.json","paper":"/paper/2506.07233"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T05:44:04.142125Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.142125Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:98b2b0f4e35350a51c6307ce311213bde19ddf03117630bea728f119379f7524","observation_id":"c8c6e7f9-d75f-4df7-b1fa-cdae18da419c","resolution":{"observed_at":"2026-08-07T05:44:04.142125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-07T05:44:04.240396Z","title":"Instruction tuning with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.240396Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:49d25d732b00b1359f17a78a3c3e144125c79938a15180812ed303d168275ee9","observation_id":"e08edad2-7c11-4f0f-9dec-6f9f3b287697","resolution":{"observed_at":"2026-08-07T05:44:04.240396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:44:04.396173Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.396173Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:3bae979a66475b03aa9b2773fc9227ec22a479cb7109df2d3d22e41a2b6569ba","observation_id":"184adbf7-613d-4dc4-bec7-810e569f549c","resolution":{"observed_at":"2026-08-07T05:44:04.396173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:44:04.530317Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.530317Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:c58fa213ae39eab6e5ef5b78f21a2657a99cd778e7ff195f4ffcf2edf4d6834b","observation_id":"ac81100f-3189-4368-a34d-4d775c209d89","resolution":{"observed_at":"2026-08-07T05:44:04.530317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T05:44:04.678145Z","title":"Gemini: A family of highly capable multimodal models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.678145Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:18ec3dc08ac1680889f8a9450116737cf1a5eba2731a09a218722f77adbe6dfd","observation_id":"0a48ea81-f1b3-4869-ad69-65d02e2956a7","resolution":{"observed_at":"2026-08-07T05:44:04.678145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:04.819666Z","title":"A survey on multimodal large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.819666Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:eea196d72ecc8f1fc75f04a561387e64df0c6bfe9d6e79e4fd9c227e799ddeda","observation_id":"0b6baaa9-bbf9-4aac-9490-ef1253d8dab1","resolution":{"observed_at":"2026-08-07T05:44:04.819666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.952445Z","title":"The revolution of multimodal large language models: A survey,","venue":null,"work_id":"ea93dfbb-54be-442e-b6f6-2c593f010d8b","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:04.979142Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:ef697b713fb90994cd8c1ddad6d5a507ffd5845ab9b282b44891751a25ed8015","observation_id":"d0efa4cd-ef80-48c2-b7e1-331e26453892","resolution":{"observed_at":"2026-08-07T05:44:17.069091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.678635Z","title":"MM-LLMs: Recent advances in MultiModal large language models,","venue":null,"work_id":"002de0f8-3081-49ce-9d99-57c5be6d711a","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.121093Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:17d5dcbc8d5d7a9819bfb95fecc807daf6cb0cf85b4f2f1c17443d894c21b9de","observation_id":"aec49515-d614-4fbc-962b-f675cc95d08c","resolution":{"observed_at":"2026-08-07T05:44:16.797828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.395036Z","title":"Audiopalm: A large language model that can speak and listen,","venue":null,"work_id":"5a5d5cb7-fb82-462b-8f41-fac57554eea7","year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.242153Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:d87ed650f83f7044c156a1ad6dc1f59e73a5185946be70cea8e16364fc4acc99","observation_id":"7254b5ee-ff5d-4faf-aff2-834ce2265a28","resolution":{"observed_at":"2026-08-07T05:44:16.553431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:16.113665Z","title":"Joint audio and speech understanding,","venue":null,"work_id":"e7b0ea9a-ccb9-4daa-a577-607a8b0d6c9a","year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.393012Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:550d285ebfda5a8273ff6f24a60c241c6ca0a812f421014f44424f2cb50874b4","observation_id":"1f2d2bf2-d587-4c56-93ad-6385531df8ce","resolution":{"observed_at":"2026-08-07T05:44:16.254955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:15.821027Z","title":"Desta: Enhancing speech language models through descriptive speech-text alignment,","venue":null,"work_id":"cdfa5103-46a0-40a4-8dca-dc28ce40d121","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.493382Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:c6e55c3e7a8a9bd39a355f45fdfdca2bd4922d2af0c31c5c00bbf0411371fe8a","observation_id":"b171b459-d399-4978-a7c5-70aa1432a23b","resolution":{"observed_at":"2026-08-07T05:44:15.985147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:15.508698Z","title":"Developing instruction-following speech language model without speech instruction-tuning data,","venue":null,"work_id":"3722bdbf-0c21-4368-ba0f-982237bab31a","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.645453Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:14aeeb3a3dbcbd6715a309a5391795bba70664b2abecad54581409f5bb56a124","observation_id":"db89d6af-be38-4804-96b6-5c05a4d4f929","resolution":{"observed_at":"2026-08-07T05:44:15.624731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:15.242697Z","title":"Audio flamingo 2: An audio-language model with long-audio understanding and expert reasoning abilities,","venue":null,"work_id":"27cb0815-d566-465d-84a6-90d188dc221f","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:05.893989Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:40ada82eec8a398093eb59bd26b61e7d8679a7f96af05b2acf12c0277795f34c","observation_id":"6d199855-642a-4599-9749-1137bc1b1cd0","resolution":{"observed_at":"2026-08-07T05:44:15.365846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08528","snapshot_observed_at":"2026-08-07T05:44:06.217467Z","title":"On the landscape of spoken language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.217467Z"},"links":{"cited_paper":"/paper/2504.08528","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:a7086e0d0b2789e5079e34a6f8806ada545be2989617fa61bc9564645bfc3851","observation_id":"823d1c69-6970-4ba7-b0a1-5ed8a329b4bc","resolution":{"observed_at":"2026-08-07T05:44:06.217467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:14.900109Z","title":"Dynamic-superb: Towards a dynamic, collaborative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":"7cf44e96-4478-4c4b-9c59-f50483428c81","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.317775Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:84dc8f34ba2d13687b061f261c73496f7057f42c9b2a4fcb191c3f7764fc33d5","observation_id":"b1802c34-c9ff-409e-867a-8add9b25d91a","resolution":{"observed_at":"2026-08-07T05:44:15.056184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:14.566443Z","title":"Dynamic-superb phase-2: A collabo- ratively expanding benchmark for measuring the capabilities of spoken language models with 180 tasks,","venue":null,"work_id":"e850511f-54b5-46de-ad62-6c76b91e2692","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.522350Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:928f494566a59cabcf102b8f9dd67e9e30d0b9b204ce4155c57ef5ea1710b151","observation_id":"e7566184-2b90-4bde-a94e-8662c15552ec","resolution":{"observed_at":"2026-08-07T05:44:14.750706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:14.278717Z","title":"MMAU: A massive multi- task audio understanding and reasoning benchmark,","venue":null,"work_id":"216e4a5f-6650-480b-b060-5e770d36c96f","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.721828Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:ee923d6ce9633fa3c064b67bb31aa2b7a0de4aa66d26984cc52a8f88b6f120a3","observation_id":"f5d8ecca-a513-461f-9792-b84d89d54f4a","resolution":{"observed_at":"2026-08-07T05:44:14.472031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13237","last_updated":"2025-08-24T16:09:17Z","snapshot_observed_at":"2026-08-07T15:43:08.088135Z","submitted_at":"2025-05-19T15:20:32Z","title":"SAKURA: On the Multi-hop Reasoning of Large Audio-Language Models Based on Speech and Audio Information","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13237","snapshot_observed_at":"2026-08-07T05:44:06.889837Z","title":"Sakura: On the multi-hop reasoning of large audio-language models based on speech and audio information,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.889837Z"},"links":{"cited_paper":"/paper/2505.13237","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:3fa416a45e512465e036b4f7cd8e6dbd14e6aeb47fee3ccd540d3c29a95417ca","observation_id":"3d7972e2-000d-4c3b-9f50-2eb310168e9e","resolution":{"observed_at":"2026-08-07T05:44:06.889837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.979089Z","title":"Audiobench: A universal benchmark for audio large language models,","venue":null,"work_id":"9aa15c41-af59-4c4b-9fe9-c25c9148f371","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.031629Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:00f0e2f48202d190e91003c4c1bbfb12d60b05c293099a974f1cb0090912058b","observation_id":"1ad376c4-3a8e-4981-8ca3-f65ffccfa198","resolution":{"observed_at":"2026-08-07T05:44:14.120800Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-07T05:44:07.174236Z","title":"V oicebench: Benchmarking llm-based voice assistants,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.174236Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:2086664bf7b856c9c644a5e7b28c87370b41ba98c8c56743189e3cdfe046f3ca","observation_id":"1a60aa09-09cb-4f01-bf86-b41c558d1563","resolution":{"observed_at":"2026-08-07T05:44:07.174236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15957","last_updated":"2026-04-26T17:05:53Z","snapshot_observed_at":"2026-07-06T21:28:06.120576Z","submitted_at":"2025-05-21T19:17:29Z","title":"Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15957","snapshot_observed_at":"2026-08-07T05:44:07.316429Z","title":"Towards holistic evaluation of large audio-language models: A comprehensive survey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.316429Z"},"links":{"cited_paper":"/paper/2505.15957","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:c678cddc760190ec71aa3ed242958b698b54dbb9a3ecc0b35eabc9788a0b5d28","observation_id":"52077cfc-9568-4d9a-bf7a-25679a339079","resolution":{"observed_at":"2026-08-07T05:44:07.316429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.668068Z","title":"Understanding sounds, missing the questions: The challenge of object hallucination in large audio-language models,","venue":null,"work_id":"c1e41f9b-821c-4ce6-997e-160d2130245c","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.497114Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:a62603a3e79ed20d7faf041f6ddb9448308a1afc2675fa698b3d7efb4bc27855","observation_id":"0a48afa0-23b6-4359-9da7-08509f48dce4","resolution":{"observed_at":"2026-08-07T05:44:13.802778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.410015Z","title":"Can large audio-language models truly hear? tackling hallucinations with multi-task assessment and stepwise audio reasoning,","venue":null,"work_id":"8f3ada1e-c6f6-4611-9a40-3ef83681b259","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.618388Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:54a9acf00a959c535efa253f643239dcacb902aa15e5aff374c1c8a74772ea48","observation_id":"6b2894a5-19ad-4c90-9e73-2d80437de48a","resolution":{"observed_at":"2026-08-07T05:44:13.555784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:07.752500Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.752500Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:852927cbf800575533255e0f23398fc0e7011de5d5a305dde4cf51af4dab2375","observation_id":"3bd44b3a-78b3-43ed-a2ae-99b561c35359","resolution":{"observed_at":"2026-08-07T05:44:07.752500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-07T05:44:07.897650Z","title":"Siren’s song in the ai ocean: A survey on hallucination in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.897650Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:74355e860a3cd726b150e515b97a8a9765da84efc04ac06f2e71a5f5c46dc97c","observation_id":"17bf85ea-edd6-4bdb-a121-c74c51228da2","resolution":{"observed_at":"2026-08-07T05:44:07.897650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05922","last_updated":"2023-09-12T02:34:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-12T02:34:06Z","title":"A Survey of Hallucination in Large Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05922","snapshot_observed_at":"2026-08-07T05:44:07.998750Z","title":"A survey of hallucination in large foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:07.998750Z"},"links":{"cited_paper":"/paper/2309.05922","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:011366c3941c93ef2bcf85e48fb27630fffb8600b65023190d4c38ef9a992445","observation_id":"bbb01081-e6b5-4ceb-833a-0f4870c5e6ea","resolution":{"observed_at":"2026-08-07T05:44:07.998750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:13.082232Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions,","venue":null,"work_id":"45ea2dd4-cfae-4cca-8051-5157515c811f","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.165867Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:c475cbc25e1df034cd7e86e56f4b087618317beaa75e2898bc563f261f4acb80","observation_id":"0752f688-02e4-4722-b11c-67835028a411","resolution":{"observed_at":"2026-08-07T05:44:13.256680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19037","last_updated":"2025-05-25T08:37:55Z","snapshot_observed_at":"2026-08-09T04:17:47.713194Z","submitted_at":"2025-05-25T08:37:55Z","title":"Speech-IFEval: Evaluating Instruction-Following and Quantifying Catastrophic Forgetting in Speech-Aware Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19037","snapshot_observed_at":"2026-08-07T05:44:08.447266Z","title":"Speech-ifeval: Evaluating instruction-following and quantifying catastrophic forgetting in speech- aware language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.447266Z"},"links":{"cited_paper":"/paper/2505.19037","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:6d420a9aa5c53f753a80e82a8f98d70a853cfd120aa46ca0795fb682e1455cf0","observation_id":"b1951685-0dca-4ca2-a233-c7ecd738c91f","resolution":{"observed_at":"2026-08-07T05:44:08.447266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:08.330522Z","title":"Available: http://dx.doi.org/10.1145/3703155","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.330522Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:80ec056bb66e4a103d13276754f5cb67e3f62a824483eea9bc612d2b9d79026e","observation_id":"d743b7d7-4b1a-47e7-ae83-a56c69dca409","resolution":{"observed_at":"2026-08-07T05:44:08.330522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:08.748512Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.748512Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:411649d079db1c910d980b6ebbdecf655ba8b2fe5c2bb575718d21d67e934a93","observation_id":"134ae7fa-c790-4b67-994a-2ca2ccc3e0b0","resolution":{"observed_at":"2026-08-07T05:44:08.748512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:12.799244Z","title":"Trusting your evidence: Hallucinate less with context-aware decoding,","venue":null,"work_id":"1c8c97ed-0dcb-4a13-a55c-83d05bf7a172","year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.615390Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:3fe20a433fd1eca1e6362298dcba24ca06e3134963154f7a96f515aa498593d4","observation_id":"14eb1a3e-e660-4a27-9f9c-e61542d76ad9","resolution":{"observed_at":"2026-08-07T05:44:12.935278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:12.530433Z","title":"Contrastive decoding: Open-ended text generation as optimization,","venue":null,"work_id":"3136a483-2083-4f1d-bb44-f687824044c4","year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.068216Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:b1d65235ac94efe5e078d071354bf65adf76648e7f906192c00f1335f06e0120","observation_id":"54904445-7f21-4cbd-a2b6-0783433a9b68","resolution":{"observed_at":"2026-08-07T05:44:12.664636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:08.923088Z","title":"Retrieval-augmented generation for large language models: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:08.923088Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:7503ed979ea3ae83578969c641bf2ff793479d3675f6557191699bf2309b4784","observation_id":"262bf6ce-c372-422f-81dc-dcea2c5d9779","resolution":{"observed_at":"2026-08-07T05:44:08.923088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.963668Z","title":"Qwen2-audio technical report,","venue":null,"work_id":"0e457ae2-bf3c-4891-a115-0390a27979f2","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.342799Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:3c04bcc12e8d6c8e68a705f85b0f13f4c2a206ea3721dd295dddc1b95d4b9b03","observation_id":"7632c80a-be19-4bd3-a261-7e522a73c7b7","resolution":{"observed_at":"2026-08-07T05:44:12.083649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:12.195339Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":"34a68554-2288-47c0-8492-95e836ed4910","year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.199554Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:5b9c117b8abf589e34f6db60cdef8f0deef200d909ed84ce415436f1896043d8","observation_id":"ee45edca-8577-4179-b1b0-ba3931e83d89","resolution":{"observed_at":"2026-08-07T05:44:12.386040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05825","last_updated":"2025-02-09T09:16:42Z","snapshot_observed_at":"2026-08-08T17:46:35.286702Z","submitted_at":"2025-02-09T09:16:42Z","title":"Delta -- Contrastive Decoding Mitigates Text Hallucinations in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.05825","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.05825","snapshot_observed_at":"2026-08-07T05:44:10.706300Z","title":"Delta -- Contrastive Decoding Mitigates Text Hallucinations in Large Language Models","venue":"cs.CL","work_id":"3ada83eb-31a3-413b-9678-8de2c67db7f9","year":2025},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.718208Z"},"links":{"cited_paper":"/paper/2502.05825","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:9639d8953b27fec6fced8dd51332ad9af4e79b562f590ebcd7db30e8d8ed584e","observation_id":"991af41e-6448-4256-ac9f-4dcd6a0e199b","resolution":{"observed_at":"2026-08-07T05:44:10.787886Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.15097","last_updated":"2023-07-10T06:08:55Z","snapshot_observed_at":"2026-07-06T14:10:59.567758Z","submitted_at":"2022-10-27T00:58:21Z","title":"Contrastive Decoding: Open-ended Text Generation as Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.15097","snapshot_observed_at":"2026-08-07T05:44:09.865978Z","title":"Contrastive decoding: Open- ended text generation as optimization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.865978Z"},"links":{"cited_paper":"/paper/2210.15097","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:b7a5f4ee3117ce3083c7fa3b9559c830febc3bb2966488f2b5becd3d9e69b589","observation_id":"bb6b8b00-07c7-46d2-bbbb-941342f9d5c1","resolution":{"observed_at":"2026-08-07T05:44:09.865978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.629329Z","title":"Clotho-aqa: A crowdsourced dataset for audio question answering,","venue":null,"work_id":"938dd55f-65d9-457e-9b81-90525accba6d","year":2022},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.615352Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:479b316799dfc2630e41578e5d2d1dfacd55dc9f73e7130450286baa36895b43","observation_id":"629d1fe7-226f-46c4-8825-3020383852ab","resolution":{"observed_at":"2026-08-07T05:44:11.772062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.071160Z","title":"AudioCaps: Generating captions for audios in the wild","venue":null,"work_id":"76090682-c410-4793-8dc0-56bb4c0814ef","year":2019},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:10.173732Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:1e96e2faa2eed859a9713a9dd236626cbfb519f737ab18dc633cd6820b14177f","observation_id":"fe184b44-dd6c-4ace-8173-1840c999fcaa","resolution":{"observed_at":"2026-08-07T05:44:11.206873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09634","last_updated":"2022-06-17T07:35:08Z","snapshot_observed_at":"2026-07-06T13:02:09.425556Z","submitted_at":"2022-04-20T17:28:53Z","title":"Clotho-AQA: A Crowdsourced Dataset for Audio Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09634","snapshot_observed_at":"2026-08-07T05:44:10.346543Z","title":"Clotho-aqa: A crowdsourced dataset for audio question answering,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:10.346543Z"},"links":{"cited_paper":"/paper/2204.09634","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:3cffbba61c33b2d954f85cbe15faaf13b08af4b9abd5edf223216dbb8a6bcf90","observation_id":"1e7ea3ef-2c95-4110-9f67-0acd3a1aa40b","resolution":{"observed_at":"2026-08-07T05:44:10.346543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:44:11.311667Z","title":"Finetuned language models are zero-shot learners,","venue":null,"work_id":"7842c9ca-5131-4871-8852-8212728fa902","year":2022},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.965594Z"},"links":{"citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:e2930c97eb36dc9bfa0ecc96ff45c61db70d36b263b245302965d9450648d227","observation_id":"16a51123-4f39-4942-8da8-be53c942bfc7","resolution":{"observed_at":"2026-08-07T05:44:11.497941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09774","last_updated":"2024-01-18T07:50:07Z","snapshot_observed_at":"2026-08-08T14:40:01.471920Z","submitted_at":"2024-01-18T07:50:07Z","title":"On the Audio Hallucinations in Large Audio-Video Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09774","snapshot_observed_at":"2026-08-07T05:44:10.480282Z","title":"On the audio hallucinations in large audio-video language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:10.480282Z"},"links":{"cited_paper":"/paper/2401.09774","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:ccd9239238308a6cc530831369dc8ee99bb3a320c2bc376c69d0379c75790137","observation_id":"35dd95bc-b865-4e6f-820e-d04d7078e991","resolution":{"observed_at":"2026-08-07T05:44:10.480282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T05:44:09.465678Z","title":"Available: https://arxiv.org/abs/2407.10759","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:09.465678Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:b693f9fbe55f6494b2fcd1cb1832bc17b524f926ddfc7accfa7204a33eab7547","observation_id":"75023eb3-f5b6-4b5b-82a1-df13a24d6c4a","resolution":{"observed_at":"2026-08-07T05:44:09.465678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03983","last_updated":"2025-03-06T00:10:26Z","snapshot_observed_at":"2026-08-07T17:26:13.091608Z","submitted_at":"2025-03-06T00:10:26Z","title":"Audio Flamingo 2: An Audio-Language Model with Long-Audio Understanding and Expert Reasoning Abilities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03983","snapshot_observed_at":"2026-08-07T05:44:06.028974Z","title":"Available: https://arxiv.org/abs/2503.03983","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:44:06.028974Z"},"links":{"cited_paper":"/paper/2503.03983","citing_paper":"/paper/2506.07233"},"observation_digest":"sha256:88c84a633e298b64c9d210c834c8e41c0e377ed659f6a1b8ea8f6328478bf9ee","observation_id":"faaf1430-0060-4ed1-99b9-2e4d8b354f35","resolution":{"observed_at":"2026-08-07T05:44:06.028974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07233","last_updated":"2025-09-12T18:49:28Z","latest_version":2,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-09T04:18:03.319488Z","submitted_at":"2025-06-08T17:36:50Z","title":"Reducing Object Hallucination in Large Audio-Language Models via Audio-Aware Decoding"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 6 inbound Pith citation observations for arXiv:2506.07233."}