{"as_of":"2026-08-14T17:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc66725b0d0ee2764436887275e4ffc13f9f1f873939c36b2ea0399338238ce2","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T14:37:34.810212Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.18718/citation-record","integrity":"/paper/2607.18718/integrity","json":"/paper/2607.18718/citation-record.json","paper":"/paper/2607.18718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:31.308928Z","title":"Measuring audio’s impact on correctness: Audio-contribution-aware post-training of large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.308928Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:364d2f32177816d3d8611653590621611b4c4c715413b61edfb3eac02536c205","observation_id":"d55b62ab-d7c1-4e1b-87ff-e529d1becfb3","resolution":{"observed_at":"2026-08-01T14:37:31.308928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19168","last_updated":"2024-10-24T21:20:10Z","snapshot_observed_at":"2026-08-13T20:48:30.133767Z","submitted_at":"2024-10-24T21:20:10Z","title":"MMAU: A Massive Multi-Task Audio Understanding and Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19168","snapshot_observed_at":"2026-08-01T14:37:31.395557Z","title":"MMAU: A massive multi-task audio understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.395557Z"},"links":{"cited_paper":"/paper/2410.19168","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:be65a608967eb0418e1ee990be8d8d091a5b3eae777151c175f433ab4ed4ea1e","observation_id":"6c9b0560-ae65-4a4f-ad63-c1468dd70705","resolution":{"observed_at":"2026-08-01T14:37:31.395557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13032","last_updated":"2025-05-19T12:18:42Z","snapshot_observed_at":"2026-08-07T15:43:15.821319Z","submitted_at":"2025-05-19T12:18:42Z","title":"MMAR: A Challenging Benchmark for Deep Reasoning in Speech, Audio, Music, and Their Mix","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13032","snapshot_observed_at":"2026-08-01T14:37:31.517268Z","title":"MMAR: A challenging benchmark for deep reasoning in speech, audio, music, and their mix,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.517268Z"},"links":{"cited_paper":"/paper/2505.13032","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:b050001df269b3b1af4ca25cd6af8b75e3058da02861fa371a2bcb0a17534b15","observation_id":"ee5013f1-6efc-402a-b10f-21f3f7de974c","resolution":{"observed_at":"2026-08-01T14:37:31.517268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04779","last_updated":"2026-03-16T09:24:19Z","snapshot_observed_at":"2026-08-14T00:08:21.077963Z","submitted_at":"2025-06-05T09:09:36Z","title":"MMSU: A Massive Multi-task Spoken Language Understanding and Reasoning Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04779","snapshot_observed_at":"2026-08-01T14:37:31.631868Z","title":"MMSU: A massive multi-task spoken language understanding and reasoning benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.631868Z"},"links":{"cited_paper":"/paper/2506.04779","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:b310e782271bf8574eb11a2d867ec39dcc23632d5fb937a9ecd7b56d348bfff5","observation_id":"86420a57-bfde-4078-acf6-b7c2317dfaba","resolution":{"observed_at":"2026-08-01T14:37:31.631868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:31.734364Z","title":"Audio-grounded hard-example training with acoustic tagging for audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.734364Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:62383beaead45ec4130081cac50ec8173053ad4c420c83a4e7cd96797ffbaa4b","observation_id":"caa43371-926f-4fe6-86bb-6c9795b76a28","resolution":{"observed_at":"2026-08-01T14:37:31.734364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-08-11T00:14:34.061687Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-01T14:37:31.859074Z","title":"Qwen3-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.859074Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:f2e5c6bfb8da8504d8bbbd674d6ae0471c687f43049115ffc9cb3c0c3fc6cd81","observation_id":"9fc619b0-91fc-4d2f-885e-b2ad75ed3cc0","resolution":{"observed_at":"2026-08-01T14:37:31.859074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:31.950287Z","title":"Fun-Audio-Chat technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:31.950287Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:6f6b7c24fab2cbf56c8cc7f1f9bcbc48cc6b7058714a4b51061b2a1eee88e272","observation_id":"475ea974-9a83-4ba5-91a9-a73f8cc0cf54","resolution":{"observed_at":"2026-08-01T14:37:31.950287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-01T14:37:32.043740Z","title":"Kimi-Audio technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.043740Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:c1c2dc06149761e032dced9a7e8c8d5fe6f020d2952ee65ffef77074411f0f3e","observation_id":"6d8ae40b-9d0f-4b74-b336-ea04cf2fab11","resolution":{"observed_at":"2026-08-01T14:37:32.043740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:32.130711Z","title":"MiMo-Audio: Audio language models are few-shot learners,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.130711Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:15fa9dd3d677d64858949fc850c0cc81d6383764026aa9fdd58ccae901d519a9","observation_id":"21fa3fce-26cc-4de3-9cf1-592ee6860ae4","resolution":{"observed_at":"2026-08-01T14:37:32.130711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-08-13T23:38:52.637908Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-01T14:37:32.240577Z","title":"Step-Audio 2 technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.240577Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:825b53c37884170163f261aeba444c2357e4ffcfacd4797851af0b0fa58c5efc","observation_id":"5442d012-9c64-49a4-a4cb-4496a9f5d386","resolution":{"observed_at":"2026-08-01T14:37:32.240577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01802","last_updated":"2026-06-05T13:33:35Z","snapshot_observed_at":"2026-08-06T23:00:35.099926Z","submitted_at":"2026-06-01T07:19:22Z","title":"MOSS-Audio Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01802","snapshot_observed_at":"2026-08-01T14:37:32.397890Z","title":"MOSS-Audio technical report,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.397890Z"},"links":{"cited_paper":"/paper/2606.01802","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:8b2e3e4c49ea208a21e5ee10b6ec195e9954bea678befa87db0bfadcb4d0850a","observation_id":"40ce1bda-0752-4599-90f8-53709420fa9e","resolution":{"observed_at":"2026-08-01T14:37:32.397890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.05242","snapshot_observed_at":"2026-08-01T14:37:32.540554Z","title":"GDPO: Group reward-decoupled normalization policy optimization for multi-reward RL optimization,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.540554Z"},"links":{"cited_paper":"/paper/2601.05242","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:d56cf70c48d4922a39a9d3340254bad50b4b23eab80f2d5e0d925acfa75edb51","observation_id":"b8049c65-21f1-4c5a-878c-252c59991c2f","resolution":{"observed_at":"2026-08-01T14:37:32.540554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-01T14:37:32.670256Z","title":"LoRA: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.670256Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:2b1290a16a8508d0de04cddff44f73d222128ed9e515b75e67612e8b4beea78c","observation_id":"28fd93b0-c23d-4690-8c25-beb0dfe3ec2b","resolution":{"observed_at":"2026-08-01T14:37:32.670256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:32.758302Z","title":"Learning from audio-dependency errors: Data curation strategies based on model confusion patterns in audio question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.758302Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:f5c11520b4210e27725732f6298113818c3e395f773429dc481fe3f0bdf465d4","observation_id":"73ec54cb-45a7-48be-9f3c-55397158d751","resolution":{"observed_at":"2026-08-01T14:37:32.758302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-01T14:37:32.880875Z","title":"QLoRA: Efficient finetuning of quantized LLMs,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.880875Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:9cb685ddda9da42a947bf25eced520a8a4c534fdb3fede7095a256eacb7a4323","observation_id":"f9977f6a-b611-4b2d-9d33-8fccd3de1de3","resolution":{"observed_at":"2026-08-01T14:37:32.880875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:32.936859Z","title":"Audio-dependent question answering at the DCASE 2026 challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:32.936859Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:6990eea2a9d3bd2022862b406ee06d654edb238c25b3a9cbe54f8e4a2528bc51","observation_id":"6695a8bf-fbd2-4001-89c7-a69607266ae9","resolution":{"observed_at":"2026-08-01T14:37:32.936859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.041146Z","title":"Training-free inference- time exploration for audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.041146Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:75da0e6537f09731aeb27980a9b36e7d612482713f4b4a176e17e88a995ee734","observation_id":"e2088954-41f8-434d-9c93-eac1a9e8b4a0","resolution":{"observed_at":"2026-08-01T14:37:33.041146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.166227Z","title":"Selective multi-modal RAG for DCASE 2026 task 5: Audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.166227Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:ed790e39da5544ddc491260274d1c4e2658e3e7fc3c987d082a278662805ff4e","observation_id":"4413bec2-677c-496d-aa36-42b47f242e36","resolution":{"observed_at":"2026-08-01T14:37:33.166227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.278290Z","title":"Structured audio reasoning and robust multi- sample inference for DCASE 2026 audio-dependent question answering challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.278290Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:9d186fff5296f585471db37ca48535d7f5b99a6e46cc2d5580307372612de873","observation_id":"5e911534-9e50-45ef-b28a-6d6f38b5d204","resolution":{"observed_at":"2026-08-01T14:37:33.278290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.382819Z","title":"DCASE 2026 audio-dependent question answering task,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.382819Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:1478f0857e44220c1a8783e52fb2c8eb2a1f86a3776c96a5be022fb01f30accd","observation_id":"eabcf770-9df5-4772-9cdb-df6340fdbc84","resolution":{"observed_at":"2026-08-01T14:37:33.382819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.485131Z","title":"Curriculum learning for audio-dependent question answering: Technical report for DCASE 2026 task 5,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.485131Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:c2efe5d8a0f9a6fe2d509407e2f97d011924e9b61493d74887304d922372008e","observation_id":"1b251d6d-8871-47f2-b7f0-47bd67dc40dd","resolution":{"observed_at":"2026-08-01T14:37:33.485131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.598342Z","title":"Task-leaf routed MiMo-Audio for DCASE 2026 task 5,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.598342Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:96443bccc74c456a983906a53812a1251467387aa2dabbd3289e1223bd0e2a33","observation_id":"e6ad336a-8f52-4c0c-8cb3-d9e11e8d5664","resolution":{"observed_at":"2026-08-01T14:37:33.598342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.710894Z","title":"Qwen2.5-Omni with all-audio audio-TAH for audio-dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.710894Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:f05e749c0a6ff775785b654235f6c050d7d2818ca76dad61749bbf29b16f1028","observation_id":"cdfde793-6402-41e3-9697-a48b5c90664f","resolution":{"observed_at":"2026-08-01T14:37:33.710894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.824043Z","title":"Fun-Audio-Chat-8B with LoRA fine-tuning for audio- dependent question answering,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.824043Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:65de66aa8b3c26b115e7cf3d5dab51bd1b8cd38d3e27a76aa5c3513ad0fdc96f","observation_id":"23caed7c-11b2-4595-92c8-6a6f246be5c3","resolution":{"observed_at":"2026-08-01T14:37:33.824043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:33.941781Z","title":"GISP@HEU’s submission for DCASE 2026 task 5: A LoRA-SFT fine-tuned audio-dependent question answering system,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:33.941781Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:aaa29ce6246ebb5692a0367b99ece1c1c8f73ade7c7a338a51e61a2fa69f2444","observation_id":"9f6be7a9-8dda-4ea3-9f47-a6c6b5e7f25b","resolution":{"observed_at":"2026-08-01T14:37:33.941781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.065392Z","title":"Audio-dependent question answering with attention-anchored reinforcement learning on MiMo-Audio,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.065392Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:ea9897d104cbf4cdf4d9edca6c8c91da162b412a85e064572d917e8b01d76050","observation_id":"0ca9fe6c-54f5-4acb-baff-f4fd7aeba8ad","resolution":{"observed_at":"2026-08-01T14:37:34.065392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.159486Z","title":"Audio question answering at the DCASE 2026 challenge,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.159486Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:dc62aa2292ff5b7871b14bd3d44478e0fd7816f0d38e9acc1661315d98e6727e","observation_id":"66acb3a8-4839-473a-9eb4-eeb71579fce5","resolution":{"observed_at":"2026-08-01T14:37:34.159486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-01T14:37:34.287866Z","title":"Qwen2.5-Omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.287866Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:b8ecf02f54811082ab4a3d8ed70b7fcf0f51e2a7a80b18a2e6c93cd06c4741ef","observation_id":"21031767-ae98-4ceb-8845-d881f7ac07c0","resolution":{"observed_at":"2026-08-01T14:37:34.287866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T14:37:34.321811Z","title":"DeepSeekMath: Pushing the limits of mathematical reasoning in open language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.321811Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:a65701c42cc9098addeee808aa59a8f102f0e7d0e3ec50bc85aa6b39b45979bf","observation_id":"7a95ceab-2e4b-49a8-9b75-8d0f1f252c81","resolution":{"observed_at":"2026-08-01T14:37:34.321811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-07-06T14:28:21.844826Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-01T14:37:34.402584Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.402584Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:c431f30850daf53748782c7e7dcfc04cb8cafd3099194d1a5e568a36a2897e86","observation_id":"2f2c02dd-1ce8-475e-a60d-6b00c2d470a6","resolution":{"observed_at":"2026-08-01T14:37:34.402584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.501710Z","title":"pyannote.audio 2.1 speaker diarization pipeline: principle, benchmark, and recipe,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.501710Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:e9bf4c090eece4190a47cade6b5d35b35304232d161f9d90450869fe44577175","observation_id":"035a6d33-64f0-4fec-9fe2-35560b7f139b","resolution":{"observed_at":"2026-08-01T14:37:34.501710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07143","last_updated":"2020-08-10T13:50:24Z","snapshot_observed_at":"2026-08-13T13:28:56.694752Z","submitted_at":"2020-05-14T17:02:15Z","title":"ECAPA-TDNN: Emphasized Channel Attention, Propagation and Aggregation in TDNN Based Speaker Verification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07143","snapshot_observed_at":"2026-08-01T14:37:34.578209Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.578209Z"},"links":{"cited_paper":"/paper/2005.07143","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:b38282f97c5dc4c70ab18fffc47201dd553a94c539e4d749a1c1165c9b5775d3","observation_id":"f0492771-8af9-4cb4-816a-8263055a89cb","resolution":{"observed_at":"2026-08-01T14:37:34.578209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06687","last_updated":"2024-03-21T21:35:04Z","snapshot_observed_at":"2026-08-14T14:24:24.366797Z","submitted_at":"2022-11-12T15:25:20Z","title":"Large-scale Contrastive Language-Audio Pretraining with Feature Fusion and Keyword-to-Caption Augmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06687","snapshot_observed_at":"2026-08-01T14:37:34.645956Z","title":"Large-scale Contrastive Language-Audio Pretraining with feature fusion and keyword-to-caption augmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.645956Z"},"links":{"cited_paper":"/paper/2211.06687","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:b96097a7adb999f04b1e1e4593313e65596724d66d5e243dbae39b06cc62a345","observation_id":"90cf1a08-98f3-41dc-aeaa-252ff6b00606","resolution":{"observed_at":"2026-08-01T14:37:34.645956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T14:37:34.727468Z","title":"librosa: Audio and music signal analysis in Python,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.727468Z"},"links":{"citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:bca61002ff39e8699fbee5158f2b5ec180762b5923b3a1a0ce18a02f66943123","observation_id":"8069a673-dd83-4408-9153-a9f70123ca8a","resolution":{"observed_at":"2026-08-01T14:37:34.727468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-13T05:47:51.554813Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-01T14:37:34.810212Z","title":"Prometheus 2: An open source language model specialized in evaluating other language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T14:37:34.810212Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2607.18718"},"observation_digest":"sha256:dc464ad34973613987719c7fddeb9462f7bd0c6ed575f439eaf0ba138a411f22","observation_id":"21b9f970-9a5d-43b6-932e-bd504a854b9a","resolution":{"observed_at":"2026-08-01T14:37:34.810212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.18718","last_updated":"2026-07-21T05:17:31Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-12T17:53:50.587503Z","submitted_at":"2026-07-21T05:17:31Z","title":"Summary of DCASE 2026 Task 5: Audio-Dependent Question Answering"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":35,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2607.18718."}