{"as_of":"2026-08-11T17:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8d463f6fc083e7653c78ec740947dcbe4222a0eb6425da2705f74c4e75f51891","coverage":[{"denominator":19,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:19:00.810072Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T21:57:54.768654Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"cited_work":{"arxiv_id":"2506.05984","doi":"10.48550/arxiv.2506.05984","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05984","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-aware large language models as judges for speaking styles","venue":"ArXiv.org","work_id":"8c842325-baa3-4788-bf79-a6755d9f83fb","year":2025},"citing_paper":{"arxiv_id":"2509.26388","last_updated":"2026-05-01T17:28:37Z","snapshot_observed_at":"2026-07-06T22:31:15.349221Z","submitted_at":"2025-09-30T15:23:39Z","title":"Game-Time: Evaluating Temporal Dynamics in Spoken Language Models","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-18T11:51:43.561210Z"},"links":{"cited_paper":"/paper/2506.05984","citing_paper":"/paper/2509.26388"},"observation_digest":"sha256:37a113b1278ad284c9c4ae44b60c9841e5fd24943112f66f664ab71008d40ef0","observation_id":"e329342d-cbbb-428f-8d72-7cb0cac8f484","resolution":{"observed_at":"2026-05-18T11:52:35.677607Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"cited_work":{"arxiv_id":"2506.05984","doi":"10.48550/arxiv.2506.05984","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05984","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-aware large language models as judges for speaking styles","venue":"ArXiv.org","work_id":"8c842325-baa3-4788-bf79-a6755d9f83fb","year":2025},"citing_paper":{"arxiv_id":"2604.16211","last_updated":"2026-04-21T13:32:36Z","snapshot_observed_at":"2026-08-01T22:51:55.583851Z","submitted_at":"2026-04-17T16:20:55Z","title":"NVBench: A Benchmark for Speech Synthesis with Non-Verbal Vocalizations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T07:37:44.393592Z"},"links":{"cited_paper":"/paper/2506.05984","citing_paper":"/paper/2604.16211"},"observation_digest":"sha256:785b04a7e2e50125bff6fa8395388e0e348ce169f4f1b08ddbf7db04a7cd025f","observation_id":"28fd3e27-1afb-49b1-aa3a-c8274b0c770e","resolution":{"observed_at":"2026-05-10T07:47:12.959163Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"cited_work":{"arxiv_id":"2506.05984","doi":"10.48550/arxiv.2506.05984","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.05984","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Audio-aware large language models as judges for speaking styles","venue":"ArXiv.org","work_id":"8c842325-baa3-4788-bf79-a6755d9f83fb","year":2025},"citing_paper":{"arxiv_id":"2606.11219","last_updated":"2026-05-11T20:27:40Z","snapshot_observed_at":"2026-08-05T20:46:41.277498Z","submitted_at":"2026-05-11T20:27:40Z","title":"Afrispeech Semantics: Evaluating Audio Semantic Reasoning in Spoken Language Models Across Domains and Accents","version":1},"reference_index":218,"source":"arxiv_source","source_observed_at":"2026-06-30T22:11:44.891731Z"},"links":{"cited_paper":"/paper/2506.05984","citing_paper":"/paper/2606.11219"},"observation_digest":"sha256:7307e544f1f96b682edcc87aa65c1c4c4d598f967af41684f3b31f6406738b41","observation_id":"5ef85fb7-9c1b-4e1c-a98a-de4754aa107d","resolution":{"observed_at":"2026-06-30T22:15:05.705501Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05984","snapshot_observed_at":"2026-08-10T21:57:54.768654Z","title":"arXiv preprint arXiv:2506.05984 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06718","last_updated":"2026-08-07T02:24:12Z","snapshot_observed_at":"2026-08-11T17:10:30.205193Z","submitted_at":"2026-08-07T02:24:12Z","title":"Do Audio Language Models Use Paralinguistic Evidence? Counterfactual Audits for Response Evaluation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T21:57:54.768654Z"},"links":{"cited_paper":"/paper/2506.05984","citing_paper":"/paper/2608.06718"},"observation_digest":"sha256:fd7de1870b427da05084aeb49468bb8ceee53371ac876d347d35fc217e0e0ca5","observation_id":"d48e02a3-15e0-428b-8dde-e03c7c5153ca","resolution":{"observed_at":"2026-08-10T21:57:54.768654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.05984/citation-record","integrity":"/paper/2506.05984/integrity","json":"/paper/2506.05984/citation-record.json","paper":"/paper/2506.05984"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:06.156171Z","title":null,"venue":null,"work_id":"3a4e90f8-cc4d-49eb-8da7-066d1fa7284e","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.377307Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:42a82068ea1d27165a763415a7adb4fc5ddd3df23a8ec975dfbf358faf191676","observation_id":"b72ff62d-f801-4c13-82ac-941bc798fa04","resolution":{"observed_at":"2026-08-07T10:19:06.258429Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:05.950844Z","title":"### Scoring Rubric - **1**: The speech **does not follow** the required text, regardless of style","venue":null,"work_id":"e130d751-043f-42c6-9072-05f1850ef8fe","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.523659Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:2bc00f8bfa74c3f4a5744252d57e55139ed3fcf3322e39d32b39cd7ad915a300","observation_id":"d61463be-9a8e-484e-b65e-0ae07283fe98","resolution":{"observed_at":"2026-08-07T10:19:06.055508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:05.054241Z","title":"Provide a brief analysis of how the speech does or does not meet each requirement","venue":null,"work_id":"63afd320-6057-4402-89d0-d166df4bee58","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.982187Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:71477d21825e1770525f54571cef6d57e722ee8b81e349e6162e18e066e27d0a","observation_id":"f5304c9c-175f-46b5-b7e4-580a6b182199","resolution":{"observed_at":"2026-08-07T10:19:05.236033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:04.795349Z","title":"Follow the scoring rubric strictly","venue":null,"work_id":"43ecfb9d-59bc-4b08-a251-11c72e4e0d0b","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.091819Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:f43e2372ed1348b45e9079a659a25d628e6c6143dc5fd0e1868230ee33bc7667","observation_id":"e874c124-2bb7-48d6-af13-a48197826fe3","resolution":{"observed_at":"2026-08-07T10:19:04.950118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:05.627246Z","title":null,"venue":null,"work_id":"24e6411a-682c-4261-a38f-953ac3e8cb62","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.644612Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:261dbfa069f2c8a91a9d0f8ef5d4ce15cc44571b9f9f23f2bb48c5157fb23f10","observation_id":"ccd62385-da1d-4c17-9c46-57a6f32ba194","resolution":{"observed_at":"2026-08-07T10:19:05.798607Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:05.361595Z","title":"- If it does **not** match, assign a score of **1** and skip the style evaluation","venue":null,"work_id":"e9ed7245-0ca4-4671-9369-496b5e4a33d4","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.788473Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:abd22aff2c4e6533cbb3510146b223d65e8f6b41253384d67af1f62482139c10","observation_id":"f7c7cfa2-d568-4f38-b20c-a020bce6cf45","resolution":{"observed_at":"2026-08-07T10:19:05.476683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:04.511935Z","title":"Replace score with an integer in {1, 2, 3, 4, 5}","venue":null,"work_id":"f2f20bda-43ed-46a9-84af-e74593288316","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.200648Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:05f5ccaaeb1b014d00abd4fe0b55b0cae8d7f5c9182ef2cd459f571d4fe44f7d","observation_id":"355cea73-2bb8-4fe9-ae57-49e55ae65f12","resolution":{"observed_at":"2026-08-07T10:19:04.638300Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:04.185084Z","title":null,"venue":null,"work_id":"7e3575f8-dfe0-4733-87d5-ad9b38c8809a","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.275330Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:ad03862abb21f63c458219316ce33cf75b46566b7d9c7ea72dcad4f7eaf471f3","observation_id":"315a90a5-f12b-4a4f-bfec-e1e15276e2b1","resolution":{"observed_at":"2026-08-07T10:19:04.368926Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.860258Z","title":null,"venue":null,"work_id":"bf6ab07f-39a3-4b01-b50c-23043e60530c","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.503410Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:76dd3a42058b3f4b7d21207c6c9efdb3d8590d3388a4781fc7a1450ac64527c0","observation_id":"3a7038ea-6e87-4e53-a8dc-8f6d1ef2b457","resolution":{"observed_at":"2026-08-07T10:19:04.029103Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.486166Z","title":null,"venue":null,"work_id":"653d78de-8b35-4991-9407-1827ea9a5c63","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.734982Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:2188cbe2c9a4ffbff6dd8eb14c714369bb30a2439055d4a0f9d595918f01ab66","observation_id":"66f924a0-2e5f-40c7-b147-8ddb6aeeb3bc","resolution":{"observed_at":"2026-08-07T10:19:03.643636Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:03.149330Z","title":null,"venue":null,"work_id":"7b3c911e-2e7b-4805-a418-cd60ae27f729","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:59.931355Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:249f4af42cfb6c4f18ffbb357919f31c0f7342c29e13d1d8f0f73eb5ab77f7ad","observation_id":"53ee33b3-88bc-4ec2-910a-99f3fcc027a8","resolution":{"observed_at":"2026-08-07T10:19:03.310702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.798896Z","title":"Reference specific turns or moments in the dialogue to support and justify your evaluation","venue":null,"work_id":"23899f38-d79c-4efe-9970-2fdf80e5e729","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:00.097191Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:65dad1aa5570a5bbca81716afc7f49f384eaf11ee3842872acc1fee01c167868","observation_id":"763fd7d4-6997-4b96-a147-137634dc5c93","resolution":{"observed_at":"2026-08-07T10:19:03.003405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.394205Z","title":"Keep the double brackets as shown","venue":null,"work_id":"986559bd-c218-402d-b882-5035aca41695","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:00.243777Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:f7bbe4a437bd138478592fa8644fb0364884c3b0e70968bdd1a4ba7ba1355fe8","observation_id":"fd0b0904-3b59-446b-a340-3f2b22d09560","resolution":{"observed_at":"2026-08-07T10:19:02.577412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:02.004764Z","title":null,"venue":null,"work_id":"bd5aa6e2-20ab-4963-800e-d143ac24ffd7","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:00.429821Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:cf2a944d241a2139436a23b4a3d1f5e95855c3f8eb5edb15baf9d052ce95ef02","observation_id":"ec32e972-9c14-4504-a726-3647c47f6b1b","resolution":{"observed_at":"2026-08-07T10:19:02.167402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.730368Z","title":null,"venue":null,"work_id":"d003fbb4-9f28-481e-8174-33d800ca2b1a","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:00.562246Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:236de21c410e6797e6840b1f2f21c8d3925d431162985a79c512e655c96e3fb8","observation_id":"32f6549a-e9d9-43ca-ac39-87d8ce190406","resolution":{"observed_at":"2026-08-07T10:19:01.861760Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:01.307487Z","title":null,"venue":null,"work_id":"46227f02-fb72-47ed-b095-ce506e047564","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:00.726044Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:cfb93e74230a6e4bf38bda52bb23164a21b5f853c0a2686eea2e32e14fdbefa7","observation_id":"e5a00dc6-7515-4a41-bc40-fe3e054deaa0","resolution":{"observed_at":"2026-08-07T10:19:01.487419Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:19:00.983646Z","title":"Oh”, emphasize “exactly","venue":null,"work_id":"41391621-49b9-4d80-81b2-843abbd95bdc","year":null},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:19:00.810072Z"},"links":{"citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:08ac79ae212ad38005570e67ea2e2948df23b13875a4e0cedfc9ab24a19fea67","observation_id":"28d23887-600c-43ba-85d7-f9d69009412b","resolution":{"observed_at":"2026-08-07T10:19:01.082152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T10:18:58.080329Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.080329Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:95ba698aa64bcba85d174fb366ab3c8f3bdf235cf2677c121034d54532859b42","observation_id":"532319ba-f6a3-49bf-b156-26c52dc1fe53","resolution":{"observed_at":"2026-08-07T10:18:58.080329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04962","last_updated":"2025-05-27T16:14:30Z","snapshot_observed_at":"2026-08-11T15:34:43.632483Z","submitted_at":"2025-01-09T04:30:12Z","title":"VoxEval: Benchmarking the Knowledge Understanding Capabilities of End-to-End Spoken Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04962","snapshot_observed_at":"2026-08-07T10:18:58.186300Z","title":"SLM 1\" and the same SLM that plays the other role","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:18:58.186300Z"},"links":{"cited_paper":"/paper/2501.04962","citing_paper":"/paper/2506.05984"},"observation_digest":"sha256:4bb0121219d825eda3f0043c68e098205384b2defce377cad6350b6f469424e2","observation_id":"4352680a-1322-4fa0-b674-cc5878118272","resolution":{"observed_at":"2026-08-07T10:18:58.186300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.05984","last_updated":"2025-06-06T11:05:48Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T15:34:57.421830Z","submitted_at":"2025-06-06T11:05:48Z","title":"Audio-Aware Large Language Models as Judges for Speaking Styles"},"reference_resolution":{"displayed":19,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":8},"total_outbound_references":19},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 19 of 19 outbound references and 4 inbound Pith citation observations for arXiv:2506.05984."}