{"as_of":"2026-08-09T05:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:754dfcc951ac60d780d9ba2ee6d58875e161927443e32e12af0bc83996b346ac","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T05:08:08.044744Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13477/citation-record","integrity":"/paper/2607.13477/integrity","json":"/paper/2607.13477/citation-record.json","paper":"/paper/2607.13477"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-02T05:08:03.178486Z","title":"Qwen2-audio technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.178486Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:f033b00e312c897945e4e0211e15dcab548c39cdbb6e6dd1ea598be6aead6dac","observation_id":"66b1f27c-9864-45e7-85c5-0934150ceb2e","resolution":{"observed_at":"2026-08-02T05:08:03.178486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-02T05:08:03.283757Z","title":"Qwen2.5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.283757Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:60b7e4ab5871f7f7cfd9e326f062a94527a601b8593b30b3724203d96e6535e1","observation_id":"73b93a94-6749-491b-bc4d-abcf614fe0c5","resolution":{"observed_at":"2026-08-02T05:08:03.283757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-02T05:08:03.339448Z","title":"Qwen3-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.339448Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:b0803a6e0a05886623d68d36f551800fc6d33c09da22b6e7609a9fe79d6fdde0","observation_id":"b4faa0e3-9973-462e-b624-5587a85b5e29","resolution":{"observed_at":"2026-08-02T05:08:03.339448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:03.541744Z","title":"Audio flamingo 3: Advancing audio intelligence with fully open large audio language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.541744Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:8dfaaa228a369224bec0322f30129a71640d709f0bcbe9fa52af96fb285f8538","observation_id":"57fb78aa-6083-4f9f-a8f1-8e0407d37986","resolution":{"observed_at":"2026-08-02T05:08:03.541744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-08T09:14:25.899359Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-02T05:08:03.719567Z","title":"V oxtral,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.719567Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:899294ae37c6b7f8e6c4a0d0ba096b7514057ab0c143221756d7e8a8a3fd4a14","observation_id":"eee421ae-6f81-4633-954c-6d145337df2e","resolution":{"observed_at":"2026-08-02T05:08:03.719567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:03.830382Z","title":"Judging LLM-as-a-judge with MT-Bench and chatbot arena,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.830382Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:fcf3efc2b991d86d332ead4b4056d02b01f5f3fb138a5a7c0c31cb99583ecf5b","observation_id":"cabaf573-e2dc-41ab-8756-f24375fb29bb","resolution":{"observed_at":"2026-08-02T05:08:03.830382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:03.951106Z","title":"CLAIR: Evaluating image captions with large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:03.951106Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:d7c89e8ec7ac5577326b70d8560e2effeed390c722082876cd335dffb9516730","observation_id":"a9d79a93-61f5-4eb5-a683-c196d5e33bf2","resolution":{"observed_at":"2026-08-02T05:08:03.951106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:04.141943Z","title":"CLAIR-A: Lever- aging large language models to judge audio captions,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:04.141943Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:43955029980b36318990e01dbdb3386a7b26e64c0d0a5f0bcfaf5914b05bd49b","observation_id":"99821d0c-df41-4936-9659-0ecf328c43e4","resolution":{"observed_at":"2026-08-02T05:08:04.141943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:04.274586Z","title":"Audio large language models can be descriptive speech quality evaluators,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:04.274586Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:55579012e1ddde5466212b42531ed04f8f17e4d1e9ba12a8125ba97d22ea99d6","observation_id":"db7e028b-a52e-4c8f-8d17-676d3054059c","resolution":{"observed_at":"2026-08-02T05:08:04.274586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:04.385402Z","title":"EmergentTTS- Eval: Evaluating TTS models on complex prosodic, expressiveness, and linguistic challenges using model-as-a-judge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:04.385402Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:42f950ba0b555df6a1ee54836e7642d2733b8127064a526323656a8f99ecb7a1","observation_id":"5568fe46-e569-4d0e-a5be-fa2833a76138","resolution":{"observed_at":"2026-08-02T05:08:04.385402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16381","last_updated":"2025-06-19T15:08:01Z","snapshot_observed_at":"2026-08-06T23:41:05.433184Z","submitted_at":"2025-06-19T15:08:01Z","title":"InstructTTSEval: Benchmarking Complex Natural-Language Instruction Following in Text-to-Speech Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.16381","snapshot_observed_at":"2026-08-02T05:08:04.544761Z","title":"InstructTTSEval: Benchmarking complex natural-language instruction following in text-to-speech systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:04.544761Z"},"links":{"cited_paper":"/paper/2506.16381","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:72e03b32d2a30a5e037976377fb15f4c4e7b4a14bb67d04c0ab168bbca1cfeeb","observation_id":"ce6e5120-c663-4fa3-805a-fd0067f1c597","resolution":{"observed_at":"2026-08-02T05:08:04.544761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:04.704822Z","title":"SpeechLLM-as-judges: Towards general and inter- pretable speech quality evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:04.704822Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:731b4abbaba0217e763c7eb6a77da1dad69e14393e2e57b260e8cde1108e5f46","observation_id":"0fe25140-e892-4b65-bf95-0830f5199c99","resolution":{"observed_at":"2026-08-02T05:08:04.704822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-06T16:38:35.067803Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12705","snapshot_observed_at":"2026-08-02T05:08:04.890814Z","title":"AudioJudge: Understanding what works in large audio model based speech evaluation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:04.890814Z"},"links":{"cited_paper":"/paper/2507.12705","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:35524085a024280fafaf71283c8b4b8ba774832da8b3542a7ff01d394a54d50d","observation_id":"abfb1ffd-54bd-40e1-a1f8-80b90e0f420f","resolution":{"observed_at":"2026-08-02T05:08:04.890814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:05.039877Z","title":"Hearing between the lines: Unlocking the reasoning power of LLMs for speech evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:05.039877Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:5dad8c4f100b3c2acf25edf45e4726457726c0a24280d5f6d0e6409f142c008a","observation_id":"9bfb8815-c8b4-47e9-829c-5b24c269b73d","resolution":{"observed_at":"2026-08-02T05:08:05.039877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.24401","last_updated":"2026-04-27T12:25:18Z","snapshot_observed_at":"2026-07-06T23:10:24.992210Z","submitted_at":"2026-04-27T12:25:18Z","title":"All That Glitters Is Not Audio: Rethinking Text Priors and Audio Reliance in Audio-Language Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.24401","snapshot_observed_at":"2026-08-02T05:08:05.235383Z","title":"All that glitters is not audio: Rethinking text priors and audio reliance in audio- language evaluation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:05.235383Z"},"links":{"cited_paper":"/paper/2604.24401","citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:6d2c93928dddfe288a6edaed853f78ab65943cf7a47ccf198bf949cf867031db","observation_id":"1430c498-e0b0-49b9-9ab1-9ef3d9a7ae11","resolution":{"observed_at":"2026-08-02T05:08:05.235383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:05.422904Z","title":"Do audio LLMs really LISTEN, or just transcribe? measuring lexical vs. acoustic emotion cues reliance,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:05.422904Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:8d25a66b6b697a6bdff3a26a076129565933f40e7433537acbb597af942ce22e","observation_id":"b37c2199-a75a-46c7-92f6-9a89ef8297ea","resolution":{"observed_at":"2026-08-02T05:08:05.422904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:05.582882Z","title":"When audio-LLMs don’t listen: A cross-linguistic study of modality arbitration,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:05.582882Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:6582581518bc4e896752b918561d0d477f8a62931e40dabb088cb7f5bda7dcdf","observation_id":"552c5de6-83c0-4459-9a0e-9efe7e31b24d","resolution":{"observed_at":"2026-08-02T05:08:05.582882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:05.702454Z","title":"Do audio LLMs listen or read? analyzing and mitigating paralinguistic failures with V oxParadox,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:05.702454Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:a43288efaf47bd072073a6acbacca6c995100f8f366c5fda975694a28a5df042","observation_id":"cb618e57-5fce-451e-b284-8b18b0649791","resolution":{"observed_at":"2026-08-02T05:08:05.702454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:05.880445Z","title":"LALM-as-a-Judge: Benchmarking large audio-language models for safety evaluation in multi-turn spoken di- alogues,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:05.880445Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:a37c0badca62b3e7434d0ec0ae7ecbba34c7ec7ed69ad734eb124f3d8a112f78","observation_id":"99656150-51ed-41df-a093-a938cf9b832c","resolution":{"observed_at":"2026-08-02T05:08:05.880445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:06.052440Z","title":"Large language models are not fair evaluators,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:06.052440Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:db1d5a8fa9b7591d5e56537caebbe05d33fa3597f2c64a76c2e82414af0299af","observation_id":"52e711d1-46c8-4589-ad52-a8cf90dae114","resolution":{"observed_at":"2026-08-02T05:08:06.052440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:06.177892Z","title":"Justice or prejudice? quantifying biases in LLM-as-a-judge,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:06.177892Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:506b044abb69e8a6c05da98c5929a002537dfe13bb78a2453f178c5072a8c424","observation_id":"eb1b5ce6-eeb0-4903-9310-a72dba581d3a","resolution":{"observed_at":"2026-08-02T05:08:06.177892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:06.323955Z","title":"Towards understanding sycophancy in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:06.323955Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:a6943d75797db8de935570e197406910dab09795eb281e31fadeb86097c1a64d","observation_id":"b9421d3c-a333-428d-94c2-c6c9cb8f68da","resolution":{"observed_at":"2026-08-02T05:08:06.323955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:06.446080Z","title":"SycEval: Evaluating LLM sycophancy,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:06.446080Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:d8fa1338c548e1551fdebf523621245b115a8cf7e919078f1b89d310f795cf4c","observation_id":"d96c7da1-a475-4ce9-9f1f-12e87f54d0e4","resolution":{"observed_at":"2026-08-02T05:08:06.446080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:06.546354Z","title":"Shortcut learning in deep neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:06.546354Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:9df809c5c7c977be3d21347cf4f2a663f1a56274428af084bad65bcc844c90f6","observation_id":"8c741d28-874c-4861-80b2-950acba9fa9f","resolution":{"observed_at":"2026-08-02T05:08:06.546354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:06.676234Z","title":"The pitfalls of simplicity bias in neural networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:06.676234Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:cd4af3a8c37060a6f6197c8824bb2719420b7cd3e81644a2cd41c532519e9724","observation_id":"467f0370-3211-4d19-91c2-3864eaf79c16","resolution":{"observed_at":"2026-08-02T05:08:06.676234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:06.804051Z","title":"Large language models can be lazy learners: Analyze shortcuts in in-context learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:06.804051Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:d46a36f6be9949a233ff933a9c6bd24bd965e385f3a4bfed9dde69db38b761d4","observation_id":"7149e545-69d2-41c0-8536-f05c89b5fb22","resolution":{"observed_at":"2026-08-02T05:08:06.804051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:07.041096Z","title":"The Geneva minimalistic acoustic parameter set (GeMAPS) for voice research and affective computing,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:07.041096Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:08552c56e4857b1a0a6de21974a9472c29da5fcc415880d4898d30e4121ec48b","observation_id":"75ece925-619b-4109-b033-21b4acfbb9fc","resolution":{"observed_at":"2026-08-02T05:08:07.041096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:07.218577Z","title":"The Ryerson Audio-Visual Database of Emotional Speech and Song (RA VDESS): A dynamic, multimodal set of facial and vocal expressions in North American English,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:07.218577Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:4f4eac924343efa2cc9daffc882084a86c61169131011b2f32abc6cd6b4e09cf","observation_id":"edca2696-62a2-4645-82f3-660795770a74","resolution":{"observed_at":"2026-08-02T05:08:07.218577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:07.381205Z","title":"The V oiceMOS Challenge 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:07.381205Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:ca144971e22462e6e7647f4529de550afa0023612375e9378a6123c039dc3237","observation_id":"42618ece-aca4-4a7a-aa5d-ef143bae8e17","resolution":{"observed_at":"2026-08-02T05:08:07.381205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:07.501372Z","title":"V oxCeleb: A large-scale speaker identification dataset,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:07.501372Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:2c38e8c744bb388c6a2f515088eb2754d6ce5521728b7d0c7e6ac0531f4a123d","observation_id":"2b7cfe02-09c9-4039-9a83-10a6ce90bbed","resolution":{"observed_at":"2026-08-02T05:08:07.501372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:07.610514Z","title":"emotion2vec: Self-supervised pre-training for speech emotion rep- resentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:07.610514Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:db946319a11269805e505ff034a5c6b941f6be340127b4b0b192e2cde256a8e4","observation_id":"6ef20922-36e1-42a5-996f-95f93a549e0c","resolution":{"observed_at":"2026-08-02T05:08:07.610514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:07.753369Z","title":"Robust speech recognition via large-scale weak super- vision,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:07.753369Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:78c755743007b003e650e62e8d0b4254551becd74e35744245c2142937602313","observation_id":"943f673c-b636-4277-9aae-4564bb91cb29","resolution":{"observed_at":"2026-08-02T05:08:07.753369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:08.044744Z","title":"ECAPA-TDNN: Emphasized channel attention, propagation and aggregation in TDNN based speaker verification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:08.044744Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:5657518ef5cc3a8f0561bfc89528a21e58b56733f7e9b817be8f551df38f42f7","observation_id":"e21f231a-651a-42ae-b072-7f838562f484","resolution":{"observed_at":"2026-08-02T05:08:08.044744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T05:08:07.869223Z","title":"28 492–28 518","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation","version":1},"reference_index":202,"source":"pdf_text","source_observed_at":"2026-08-02T05:08:07.869223Z"},"links":{"citing_paper":"/paper/2607.13477"},"observation_digest":"sha256:83edda929f88d855e81ff67d7b048fa365c53bc64ea0f16ac2777db06e35d785","observation_id":"65858456-936b-4c05-b5f7-9ee5ad7be467","resolution":{"observed_at":"2026-08-02T05:08:07.869223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13477","last_updated":"2026-07-15T06:10:53Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-07T21:23:22.501426Z","submitted_at":"2026-07-15T06:10:53Z","title":"Auditing Protocol-Level Shortcuts in Large Audio Language Model Judges for Speech Evaluation"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.13477."}