{"as_of":"2026-08-19T02:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74b7fe4e2379d18070f36e2f3e34fa9ae768bb0af913e9f49dece7bec17ced16","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:43:45.136873Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06718/citation-record","integrity":"/paper/2608.06718/integrity","json":"/paper/2608.06718/citation-record.json","paper":"/paper/2608.06718"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.876357Z","title":"Journal of Artificial Intelligence Research , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.876357Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:71703750670934d37ee58c1811dcc70c389aaf525baecab88accd0576f9a678e","observation_id":"47cf122c-5fa2-4a8c-9958-a5c3f77a610e","resolution":{"observed_at":"2026-08-14T04:43:44.876357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.883841Z","title":"We Need to Consider Disagreement in Evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.883841Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:4efee45c50bdcda800229b82e7418626adf781501b1ac944f8420fb1ef190789","observation_id":"bff05200-68bc-4092-a63f-054e6240c88a","resolution":{"observed_at":"2026-08-14T04:43:44.883841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.888997Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.888997Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:78e806c5209edd443d0d7b4a2b270b8328b449b2ba2557df8a7780d3b3b93da6","observation_id":"d1a49339-3131-4a5f-988e-f2e5f60363a1","resolution":{"observed_at":"2026-08-14T04:43:44.888997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.894126Z","title":"2021 , eprint=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.894126Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:2584323cf4f47bfdb0390a1a1feea605209881406d576e97585fb95fbb7f503f","observation_id":"8fd30236-f74d-40ff-9e59-08dfa2ab17ca","resolution":{"observed_at":"2026-08-14T04:43:44.894126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.899198Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.899198Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:ce02297b2fe4922833f3e0ace53bd794ba5b95206c6b339f84a144db64a74d42","observation_id":"ffd7d181-7f47-4719-8e31-1c74981340de","resolution":{"observed_at":"2026-08-14T04:43:44.899198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.904071Z","title":"SIMMC 2.0: A Task-oriented Dialog Dataset for Immersive Multimodal Conversations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.904071Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:8730dfefccded84b38ed015e9165bbb71f562f0117fd87f69a97bd6d7d9eb06d","observation_id":"c6e49a7d-4b5a-43ad-bec2-edcd41dae48f","resolution":{"observed_at":"2026-08-14T04:43:44.904071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.909331Z","title":"What do others think?","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.909331Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:fe434076a8945db33b2b39a6e67f720694d6ca8cde2b0d789137b5b6d8294492","observation_id":"8931778c-7f86-4561-b101-86e273b5ee0c","resolution":{"observed_at":"2026-08-14T04:43:44.909331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.914099Z","title":"2020 , eprint=","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.914099Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:ebf5f09f68db19605f8612da90cec798a82dbe831523d05ca26c0aa986459197","observation_id":"f34a9b77-ab88-4310-87d4-a4e3198e1a6a","resolution":{"observed_at":"2026-08-14T04:43:44.914099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.919332Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.919332Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:563ce92f4411383a1cc2fe5efdf8ce1873eded57b3f78f366b1d0a256274e604","observation_id":"a49e2e52-3037-49bd-8769-8cb1e38ba1d5","resolution":{"observed_at":"2026-08-14T04:43:44.919332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.924097Z","title":"N orm B ank: A Knowledge Bank of Situational Social Norms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.924097Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:db8b44488b4bb7d5e23ecfe18ae31018706d06a1fd9dab07283c482106cc8a7c","observation_id":"95e4b5ac-76ec-471f-b48f-1f74734e85f4","resolution":{"observed_at":"2026-08-14T04:43:44.924097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.928878Z","title":"The Body as a Medium of Expression , editor =","venue":null,"work_id":null,"year":1975},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.928878Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:12ce2d2ca7c41c5bd62ae7d9284a633bb82ded70a28fe2ac8ee4db06c2e7833c","observation_id":"621312d5-5aaf-4267-bd95-6456b3966377","resolution":{"observed_at":"2026-08-14T04:43:44.928878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.933336Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.933336Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:c4eef7234c729e3431b552c37b47232f0562844a259651d8a4108052391fccd1","observation_id":"2610613c-57f3-4f3a-8084-2513b701b6f2","resolution":{"observed_at":"2026-08-14T04:43:44.933336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.938388Z","title":"2025 , url =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.938388Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:fe38a95b37cf4e17f88f207ceb6f8e07260401ca497e452fde13a6126aeb7deb","observation_id":"2b883357-b5e2-4476-9daf-ff59d631eab0","resolution":{"observed_at":"2026-08-14T04:43:44.938388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.943153Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.943153Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:81bf3f62e2b4fea1d9762a1e3ad1d646f1c25d4406e2ba3c2b06a35998c76b99","observation_id":"88256a7c-77e4-44b5-8d5f-be1fd26db94e","resolution":{"observed_at":"2026-08-14T04:43:44.943153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.947547Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.947547Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:b982354c0cc462814acba4e93a67f27eb78ebab0dbef3b1e395241cda2ac57fe","observation_id":"1e60cff7-ca82-4f1f-8da9-bdc765abd5ea","resolution":{"observed_at":"2026-08-14T04:43:44.947547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.951808Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.951808Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:41e9123bbcc707812924a1d1cd38ac2289992268980fac6285b3fd8c25c99729","observation_id":"585b0aec-9408-4417-9a8e-5d234a1ea425","resolution":{"observed_at":"2026-08-14T04:43:44.951808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.956403Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.956403Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:e5f150ccc8dc87dad93018f62ec04a827e4cab898625e16f11e69a7062311b09","observation_id":"76533e01-dc80-4086-ac43-a97111ceee60","resolution":{"observed_at":"2026-08-14T04:43:44.956403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.960753Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.960753Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:02bae2d1014189de8496e8a86eb5eef22362edc9c78ccf5afe0a05a589a0139c","observation_id":"defcd3d9-1ce7-4a5d-9bf8-e697847bdae2","resolution":{"observed_at":"2026-08-14T04:43:44.960753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.965326Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.965326Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:a7d7b9ed6694ec5c83638d07b9a4e0dd6030d36e30d1ef89e9e4325e9c102f2b","observation_id":"f7c3388f-207a-4a5b-8d3f-c1b65d7446be","resolution":{"observed_at":"2026-08-14T04:43:44.965326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.970448Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.970448Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:30c2c1d47ac4b81655a62293b5b19ea344bc02ef6c838061b30ae6de9c4d6d01","observation_id":"6fd09cb0-d146-42f3-80f8-6cc2521acc71","resolution":{"observed_at":"2026-08-14T04:43:44.970448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.974990Z","title":"2026 , eprint=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.974990Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:226fa867b3abd032e326576b5521133fb1c978d2da5b201779b56d5d578f53e9","observation_id":"6914f919-5c25-44cc-97b7-5adcf7a972ac","resolution":{"observed_at":"2026-08-14T04:43:44.974990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.979683Z","title":"Do Audio LLM s Really LISTEN , or Just Transcribe? Measuring Lexical vs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.979683Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:b745dafd168b4cc106f679e48063f00ec2736cf73a66e3977fe276e7c23f48f1","observation_id":"8edfd0c9-7b04-4c10-853f-943cf7d4f70e","resolution":{"observed_at":"2026-08-14T04:43:44.979683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.984788Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.984788Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:bdc653e20ce28dd292c387d79c30af51e63ea53cdbac5bb7e6b511d7bae1a736","observation_id":"7c18bb57-b240-42e4-8b53-245173dea30b","resolution":{"observed_at":"2026-08-14T04:43:44.984788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:44.989595Z","title":"2023 , note=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.989595Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:7efc075c70e43036c505a39b1468128cea68df412293c5fc7f2e2d0c75c06872","observation_id":"7e66f52e-f9e5-4e53-97f4-2009ac8f7ac9","resolution":{"observed_at":"2026-08-14T04:43:44.989595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-14T04:43:44.994306Z","title":"Length-Controlled","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:44.994306Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:da1fa6334fa43c9c130a976d3020fe7ae0420191c99707f393adf0414fb44e2f","observation_id":"54d5c626-3aa6-4c23-a321-bcea1cf73643","resolution":{"observed_at":"2026-08-14T04:43:44.994306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.000191Z","title":"2025 , eprint=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.000191Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:affc03940f70cfafee8d2389ba047db42a3b0b4cc78154d087e0782cf1e4d858","observation_id":"ebaebbe9-4a23-45ca-b961-db0432b75a8a","resolution":{"observed_at":"2026-08-14T04:43:45.000191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.005233Z","title":"Proceedings of the 42nd International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.005233Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:3e07b254de583016d1c42b1594b1ae589eb7ff840c5d51e9aea29efa2739529d","observation_id":"d9657f71-f19b-4445-a449-3763736eee38","resolution":{"observed_at":"2026-08-14T04:43:45.005233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05085","last_updated":"2026-05-07T14:20:28Z","snapshot_observed_at":"2026-08-18T08:24:48.107564Z","submitted_at":"2025-03-07T02:07:00Z","title":"S2S-Arena: Evaluating Paralinguistic Instruction Following in Speech-to-Speech Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05085","snapshot_observed_at":"2026-08-14T04:43:45.011201Z","title":"arXiv preprint arXiv:2503.05085 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.011201Z"},"links":{"cited_paper":"/paper/2503.05085","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:6f10a9035b320e56efc8fdc6a0f49fd88b94693e242d96b2620690f4fe8f4e92","observation_id":"6c883d0a-8567-4bf0-8c0a-71a8101e19da","resolution":{"observed_at":"2026-08-14T04:43:45.011201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.017367Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.017367Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:14c1a7812960c6311d4b96a91c03131101cf4a6ad970aef4a49a44dceaeae270","observation_id":"20581ef8-625b-411e-9479-23324c45ca44","resolution":{"observed_at":"2026-08-14T04:43:45.017367Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08352","last_updated":"2021-07-14T07:32:49Z","snapshot_observed_at":"2026-08-14T16:44:55.414938Z","submitted_at":"2019-04-17T16:38:31Z","title":"MOSNet: Deep Learning based Objective Assessment for Voice Conversion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08352","snapshot_observed_at":"2026-08-14T04:43:45.022396Z","title":"arXiv preprint arXiv:1904.08352 , year=","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.022396Z"},"links":{"cited_paper":"/paper/1904.08352","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:80564b49db6ce17c6238b5d7ffd424d64e3b1eb53147a3121f90f578bc6b20a9","observation_id":"778db9d8-3f12-4828-bdcb-562d76064021","resolution":{"observed_at":"2026-08-14T04:43:45.022396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.027941Z","title":null,"venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.027941Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:5ad58c0a217bbb98759dca3e1858633e77a25212da45dd5fbac6b24ff58e7db1","observation_id":"e7b134cb-444e-45f4-ac64-98a0595e5538","resolution":{"observed_at":"2026-08-14T04:43:45.027941Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.032601Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.032601Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:b874b010052ec4c6f7eaa715706e2260892257c58e35c96761f0b78581903e81","observation_id":"f3fb4a6c-bafe-42c8-b1f8-0611fec2fbda","resolution":{"observed_at":"2026-08-14T04:43:45.032601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.037583Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.037583Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:4d14a8f519a060903c967bf840d9bcf1f411cdac8784a6d6d50f25a394a1532c","observation_id":"b5db910f-ecb1-4137-8e1f-8e8f2d818835","resolution":{"observed_at":"2026-08-14T04:43:45.037583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03606","last_updated":"2024-04-04T17:25:31Z","snapshot_observed_at":"2026-08-16T14:03:33.543725Z","submitted_at":"2024-04-04T17:25:31Z","title":"Analyzing Musical Characteristics of National Anthems in Relation to Global Indices","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03606","snapshot_observed_at":"2026-08-14T04:43:45.042944Z","title":"arXiv preprint arXiv:2404.03606 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.042944Z"},"links":{"cited_paper":"/paper/2404.03606","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:cdcad621655b4d8337bca8523ae40eba571cd461af44efc0564114a1443dee8a","observation_id":"ea5f66fd-5df0-4e9f-9366-77c2b15dd2fa","resolution":{"observed_at":"2026-08-14T04:43:45.042944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04174","last_updated":"2023-02-08T16:25:20Z","snapshot_observed_at":"2026-08-16T15:56:46.622846Z","submitted_at":"2023-02-08T16:25:20Z","title":"The Hardware Impact of Quantization and Pruning for Weights in Spiking Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04174","snapshot_observed_at":"2026-08-14T04:43:45.048130Z","title":"arXiv preprint arXiv:2302.04174 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.048130Z"},"links":{"cited_paper":"/paper/2302.04174","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:5af27d8a65304b14930e0b5ff451d7d9d23a87da40ce9c696d5dcb6c57ba4d53","observation_id":"43933f4b-a325-495e-8a9f-054fb8840124","resolution":{"observed_at":"2026-08-14T04:43:45.048130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.053023Z","title":"2025 , address=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.053023Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:35b7668d29d36b60e599035e3679845c0ccc1c4b22bfd8d69eb04919ad0cc01f","observation_id":"fbb70ad4-5afb-4211-8189-0df16c9c15e0","resolution":{"observed_at":"2026-08-14T04:43:45.053023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.057684Z","title":"2025 , address=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.057684Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:94f36ceda75e24675316243abe220b0abdd10a39cfdfa9bbba5c8f2e3f4df4b3","observation_id":"70aea57c-2ea9-45c2-b34f-5ef0c877c40c","resolution":{"observed_at":"2026-08-14T04:43:45.057684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.12705","last_updated":"2025-07-17T00:39:18Z","snapshot_observed_at":"2026-08-13T13:24:03.399635Z","submitted_at":"2025-07-17T00:39:18Z","title":"AudioJudge: Understanding What Works in Large Audio Model Based Speech Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.12705","snapshot_observed_at":"2026-08-14T04:43:45.062463Z","title":"arXiv preprint arXiv:2507.12705 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.062463Z"},"links":{"cited_paper":"/paper/2507.12705","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:1fede46027ec88826626eed65bc225bae2e75209b49a793b5649d096fb28b117","observation_id":"d38cd87b-2865-41a7-88cf-2cb2657ca200","resolution":{"observed_at":"2026-08-14T04:43:45.062463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-16T14:39:49.722647Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05984","snapshot_observed_at":"2026-08-14T04:43:45.067587Z","title":"arXiv preprint arXiv:2506.05984 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.067587Z"},"links":{"cited_paper":"/paper/2506.05984","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:4529022cd66c0e0e8ec7f7f9c8a60e259b0e2e56551f77da6fa5ef52ee163bef","observation_id":"fb5e74af-db89-40ea-9acd-822b6f268f8e","resolution":{"observed_at":"2026-08-14T04:43:45.067587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.072602Z","title":"arXiv preprint arXiv:2505.09558 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.072602Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:f6c87d59d6af312204d2cdea37dff25ea328c9c03419c82001aafbb9c4a7455c","observation_id":"fee49e91-450e-48ee-9954-2aaa20fe2d44","resolution":{"observed_at":"2026-08-14T04:43:45.072602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.078507Z","title":"ICASSP 2024-2024 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP) , year=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.078507Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:9c48a5dd1e93fd4596fe299b057c55ec9f965d268113ac6834b7857fb9f02296","observation_id":"aec3b046-70a3-4f7d-a807-52614a88daf3","resolution":{"observed_at":"2026-08-14T04:43:45.078507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.084109Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.084109Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:93317266cb6a606bc0ccc9e42f91312cf1e7c70e06eb7818bc34b6570ec2cef3","observation_id":"41a6fc0e-84b2-40bf-8b48-2cbbfa91bd1c","resolution":{"observed_at":"2026-08-14T04:43:45.084109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.088737Z","title":"Key-Value Retrieval Networks for Task-Oriented Dialogue","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.088737Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:e3a25949a94f4c16842e2ab935b5239bbb1153ada462413cf7c39faed686d46f","observation_id":"19c47ce9-6523-49ca-a748-ec2092a8ac29","resolution":{"observed_at":"2026-08-14T04:43:45.088737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.093465Z","title":"M ulti WOZ - A Large-Scale Multi-Domain W izard-of- O z Dataset for Task-Oriented Dialogue Modelling","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.093465Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:735427a83faa74f922d0bb8b29c155dfdf968dcde559781aadd1c7046f7ec613","observation_id":"48fa56a4-8109-4e93-b0ba-525680caa300","resolution":{"observed_at":"2026-08-14T04:43:45.093465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.098090Z","title":"and Lastras, Luis and Lasecki, Walter S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.098090Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:08f31173543363439488c0f6b65185e21f58316baf421d6552b9591962c6d214","observation_id":"43ddfd4a-d755-416d-88d4-5122a37e3b89","resolution":{"observed_at":"2026-08-14T04:43:45.098090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.102909Z","title":"IEEE Transactions on Affective Computing , volume =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.102909Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:eaf26cbc8541162abf6532bdc73799821f313dcd9a3f061b2bba91742184a8e5","observation_id":"187dc25f-65d3-46d9-ae95-146969daf56d","resolution":{"observed_at":"2026-08-14T04:43:45.102909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.107453Z","title":"PLOS ONE , volume =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.107453Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:64542f826158e26905441fce29a59112f330798668fd2410151c24c5a0ecb194","observation_id":"23ae8da3-9e83-43f4-a907-752e29e03b67","resolution":{"observed_at":"2026-08-14T04:43:45.107453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.112123Z","title":"Hearing Between the Lines: Unlocking the Reasoning Power of LLM s for Speech Evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.112123Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:01e98c53abc0f81f97111acd114d0ce47363e4d8f943151c21a069385736dc8b","observation_id":"d84979bd-82b6-4e17-ab00-4874bf60488b","resolution":{"observed_at":"2026-08-14T04:43:45.112123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.116934Z","title":"2014 , publisher =","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.116934Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:0e1eaf956be9bfb517c9127ef85bcaf679117dbae103971f594e5d3e568d2712","observation_id":"db480f7c-c0f1-42c2-b895-284035c6ed43","resolution":{"observed_at":"2026-08-14T04:43:45.116934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.121992Z","title":"Psychological Review , volume =","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.121992Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:e12763f4d4eb573c0695e79ca384ae98758d26ab00b940435a3257c90ef845ac","observation_id":"9acf39f2-6540-413e-ab80-bbf3cbd0990a","resolution":{"observed_at":"2026-08-14T04:43:45.121992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.126921Z","title":"Proceedings of the 2021 ACM Conference on Fairness, Accountability, and Transparency , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.126921Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:7dc4bf4a8b737e1198e10ab22513b2c063e4ce834f00a213a84cfa57306898bd","observation_id":"7b52f06f-8e79-41e0-87f7-03fd06d2838b","resolution":{"observed_at":"2026-08-14T04:43:45.126921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.132199Z","title":"Speech Communication , volume =","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.132199Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:6abf5391af51e61a898298833a60a129e99d6fd9e55e5a1facb08f4e90f00b0c","observation_id":"e1f90003-c7a7-482b-b5fe-f5363086f062","resolution":{"observed_at":"2026-08-14T04:43:45.132199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-14T04:43:45.136873Z","title":"2019 , publisher =","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-14T04:43:45.136873Z"},"links":{"citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:304065bb7a0839917e9a0fda58411530648085262675a7b0c2fe443478b2e561","observation_id":"3273062e-c8c6-4d93-b0c1-916c7e055d5b","resolution":{"observed_at":"2026-08-14T04:43:45.136873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-12T18:57:42Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T23:09:55.785376Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":2,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2608.06718."}