{"as_of":"2026-08-10T07:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1d060b2ede35ea1181306d674f5025480172c86080fcfe307e77f041e31bd0a","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-25T02:52:22.610397Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:13:04.179577Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-03T17:18:44.075741Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":"2605.23463","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-07-03T17:18:44.075741Z","title":"StepAudio 2.5 Technical Report","venue":"eess.AS","work_id":"9eca0e26-c3a4-45a5-b480-515455f200b2","year":2026},"citing_paper":{"arxiv_id":"2606.19381","last_updated":"2026-06-14T07:56:36Z","snapshot_observed_at":"2026-08-08T05:57:56.901057Z","submitted_at":"2026-06-14T07:56:36Z","title":"Improving Code-Switching ASR with Code-Mixing Guided Synthetic Speech","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-27T04:19:13.689689Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2606.19381"},"observation_digest":"sha256:8a2c4cda7782d331d942b3855d0dd9058b88481dc116c491c613234d550930f2","observation_id":"789faeb4-f885-46e4-a64f-704563c7b88e","resolution":{"observed_at":"2026-07-03T17:18:44.077038Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-08-03T10:13:56.110991Z","title":"arXiv preprint arXiv:2605.23463 (2026)","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.29279","last_updated":"2026-07-31T10:50:14Z","snapshot_observed_at":"2026-08-06T04:02:53.771607Z","submitted_at":"2026-07-31T10:50:14Z","title":"ParaASR: Multi-Token Prediction for Fast and Long-Context LLM-Based Speech Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T10:13:56.110991Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2607.29279"},"observation_digest":"sha256:682b0cb92719fb5720372acea7a819f95609509892dfcde34c9b523904716350","observation_id":"a05dba3a-3f4d-45fe-ad13-fa4c033e29f2","resolution":{"observed_at":"2026-08-03T10:13:56.110991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-08-06T21:28:33.190018Z","title":"arXiv preprint arXiv:2605.23463 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T23:10:09.598043Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:28:33.190018Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:8644ee2f167812c0d5388d714767d50838b4eb82fd7495fc8f63c482ad426e75","observation_id":"e4b4e415-38b6-40d6-9aca-411f1eb58d31","resolution":{"observed_at":"2026-08-06T21:28:33.190018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.23463","snapshot_observed_at":"2026-08-08T18:13:04.179577Z","title":"arXiv preprint arXiv:2605.23463 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04586","last_updated":"2026-08-06T02:26:23Z","snapshot_observed_at":"2026-08-09T23:10:09.598043Z","submitted_at":"2026-08-05T08:49:48Z","title":"Breaking the Curse of Multilinguality in Many-to-Many Speech-to-Text Translation via a Resource-Aware Mixture of Speech Encoders","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-08T18:13:04.179577Z"},"links":{"cited_paper":"/paper/2605.23463","citing_paper":"/paper/2608.04586"},"observation_digest":"sha256:c2e21a06841712bc5160ba2211dbba45756bcb551b1c61916b234d9c2596b255","observation_id":"090e4f5b-a5f6-48b6-8b13-4f2c233b7f3c","resolution":{"observed_at":"2026-08-08T18:13:04.179577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2605.23463/citation-record","integrity":"/paper/2605.23463/integrity","json":"/paper/2605.23463/citation-record.json","paper":"/paper/2605.23463"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Connectionist temporal classification","venue":null,"work_id":"65a0e422-e447-49f4-8c67-22aa1c4faf3d","year":2012},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:3e2be80d80b4d7dc973901b8f7179353dafef5f6decb083bfe9700e773c6f7a7","observation_id":"086e75aa-a6ef-417f-b944-038c36ad785f","resolution":{"observed_at":"2026-05-25T02:56:35.361557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-07-06T02:59:58.238741Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":"1211.3711","doi":"10.48550/arxiv.1211.3711","metadata_source":"pith","pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sequence Transduction with Recurrent Neural Networks","venue":"cs.NE","work_id":"4553c1f9-9627-48f1-bcb4-69ce67d2ad80","year":2012},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:e4858aa27f94669ba1cad734b10290798545ecf2d140a21f11b39e4c6472e5e5","observation_id":"14ae607c-95e5-44d1-bdf8-4b5aacb3f70c","resolution":{"observed_at":"2026-05-25T02:55:16.521251Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1508.01211","last_updated":"2015-08-20T00:38:43Z","snapshot_observed_at":"2026-08-08T05:51:42.766537Z","submitted_at":"2015-08-05T20:17:58Z","title":"Listen, Attend and Spell","version":2},"cited_work":{"arxiv_id":"1508.01211","doi":null,"metadata_source":"pith","pith_arxiv_id":"1508.01211","snapshot_observed_at":"2026-07-04T13:29:51.152577Z","title":"Listen, Attend and Spell","venue":"cs.CL","work_id":"bb2589f9-8410-4374-a31f-7e5031750959","year":2015},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1508.01211","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:04ce50b2863b7c5a98a554bec75efae231615df2d8996674fdc9aca6a211f57f","observation_id":"6eab5b32-aab8-4e2a-a3fe-7d9fdbfc6b2a","resolution":{"observed_at":"2026-05-25T02:55:16.509973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robust speech recognition via large-scale weak supervision","venue":null,"work_id":"611d6878-298f-4cf4-b841-932131b8bfaa","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:145f0beec0998459e797214929f11e84bf44cf2b8f1b0910589cbf851ab66947","observation_id":"5eeac4c3-be4e-46d5-b52c-f412f6d551a2","resolution":{"observed_at":"2026-05-25T02:56:35.353701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18184","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T14:53:55.819917Z","title":"VIBEVOICE-ASR technical report","venue":null,"work_id":"8c3744fb-dfff-4f53-8445-4806dbf5929a","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:0ffcc7fb45ef7f3ec39b3fa0a31fd1dce4a5afaa5875e2679f9e348140926505","observation_id":"df029add-8e4b-4238-ab59-6d9334d01e84","resolution":{"observed_at":"2026-05-25T02:55:16.526933Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.12508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T13:21:06.298615Z","title":"Fun-ASR technical report","venue":null,"work_id":"0d0144d6-599f-4fc5-a3ac-d35c144cdd41","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:c4d64f54e2c9a3ac7b0955718254c521224f9585347d7d5cc342f0a6c3375688","observation_id":"5e20d531-5ce5-478e-afeb-3a15edf3fa37","resolution":{"observed_at":"2026-05-25T02:55:16.532217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-07-06T18:42:05.670928Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":"2407.04675","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-07-05T13:21:06.342183Z","title":"Seed-asr: Understanding diverse speech and contexts with llm-based speech recognition","venue":"eess.AS","work_id":"c5c60033-9068-454d-8df1-52efb011f98b","year":2024},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:d813a32a467919f87a6e5f28d86cff37ebfd11b5274120ab286e4ff7a1222e07","observation_id":"91001d88-a7f2-4930-8541-dc76486a95f5","resolution":{"observed_at":"2026-05-25T02:55:16.515698Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21337","last_updated":"2026-01-30T02:58:48Z","snapshot_observed_at":"2026-07-06T22:43:26.250071Z","submitted_at":"2026-01-29T06:58:13Z","title":"Qwen3-ASR Technical Report","version":2},"cited_work":{"arxiv_id":"2601.21337","doi":"10.48550/arxiv.2601.21337","metadata_source":"pith","pith_arxiv_id":"2601.21337","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-ASR Technical Report","venue":"cs.CL","work_id":"db50e258-4a3d-4141-ba30-f76f8f953880","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2601.21337","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:0d05df0314dbadeae6aa025d9da90318ce0fd831e0f1067faebf6963641b36c4","observation_id":"9fd13268-45a3-43f5-a739-bfc06b0f025e","resolution":{"observed_at":"2026-05-25T02:55:16.483222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"cited_work":{"arxiv_id":"2507.16632","doi":"10.48550/arxiv.2507.16632","metadata_source":"pith","pith_arxiv_id":"2507.16632","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-Audio 2 Technical Report","venue":"cs.CL","work_id":"2317bc9f-2d58-4e53-b7ea-804337e9fdef","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2507.16632","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:ab02e927e079864b0ec9509b6a69d880e4196c7e7ff046bcc7dd37e1ec04c22a","observation_id":"ae35f11f-b45b-4570-a385-d37c6d821ce6","resolution":{"observed_at":"2026-05-25T02:55:16.487852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:45.403831+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:08276fad9c62a1b51271b5f14b6b7d90985666df08332bf1793b3e146514fd83","observation_id":"713f12d6-bd4a-407b-8965-ba391750f8e0","resolution":{"observed_at":"2026-05-25T02:55:16.441821Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12034","last_updated":"2026-05-13T20:38:46Z","snapshot_observed_at":"2026-07-31T22:09:03.342383Z","submitted_at":"2026-05-12T12:16:11Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","version":2},"cited_work":{"arxiv_id":"2605.12034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12034","snapshot_observed_at":"2026-06-30T17:34:57.376694Z","title":"Boosting Omni-Modal Language Models: Staged Post-Training with Visually Debiased Evaluation","venue":"cs.MM","work_id":"3d44bbf2-61a6-4226-b3f4-c18dfb8f1aac","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2605.12034","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:6d4888d769212f97bf46ac98025e25da832cc4dc1d9c19f1784dd14e589998c4","observation_id":"0953c54f-6449-4679-b7a8-a5382add346c","resolution":{"observed_at":"2026-05-25T02:55:16.477459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":"02a9e694-304e-4f45-beff-168099a50fa3","year":2024},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:7e34fee9063a13c04d3cbd0f90b0fca33f6989e202afbdf9f65654fa996afab3","observation_id":"fc8064bb-97ff-403c-9dfd-eedabf2c2453","resolution":{"observed_at":"2026-05-25T02:56:35.371149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audiolm: a language modeling approach to audio generation.IEEE/ACM transactions on audio, speech, and language processing, 31:2523–2533","venue":null,"work_id":"ec7df9ed-3b74-45ef-8d96-020ad7bda143","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:75105535673ee0ca0d14d3d09ba38a7942e64eaf9433414945f496bef3a28dac","observation_id":"57515c3d-9c92-4e8e-9189-36d3eb900b8a","resolution":{"observed_at":"2026-05-25T02:56:35.374738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recent advances in speech language models: A survey","venue":null,"work_id":"a7638ff3-4055-45dd-96ca-1357b68b9cef","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:f60e3139b0129727c1c80e745d5b7ec514776016cf2d7ee1bec264a7c2b57ec4","observation_id":"350987e5-fa75-45d3-8571-0bcdb7a12996","resolution":{"observed_at":"2026-05-25T02:56:35.379842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paralinguistics-aware speech-empowered large language models for natural conversation.Advances in Neural Information Processing Systems, 37:131072–131103","venue":null,"work_id":"ee075700-933d-478d-965f-26d7ec01c2d4","year":2024},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:1e413acec2088b05f8df57bed0af4a456016769db6e17ea51d1745ed5a5b0beb","observation_id":"c59d0276-31d1-4f4f-b648-9517b90875b5","resolution":{"observed_at":"2026-05-25T02:56:35.383483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen LLM","venue":null,"work_id":"34c9b982-aa2c-4ea9-9354-b699e38252b7","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:922713a72cec95a86653d52d7e974210a53d076c8a77f2db64f412fe1fcb788e","observation_id":"0caf796e-e190-4ba0-b488-fdd8162c462c","resolution":{"observed_at":"2026-05-25T02:56:35.389815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.00303","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Depflow: Disentangled speech generation to mitigate semantic bias in depression detection","venue":null,"work_id":"0c5b8fd4-85b1-4907-9e8e-fac38388e59e","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:e8a6850b7ee66829b0b599e842aafcfb1080ae2c327b84ce3094986a2e9f233f","observation_id":"2c452943-18a0-4a86-b196-e4b4c9f47119","resolution":{"observed_at":"2026-05-25T02:55:16.431713Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A new approach to extract fetal electrocardiogram using affine combination of adaptive filters","venue":null,"work_id":"9f125258-8226-454f-88ff-a1ca6e0235c9","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:9e34619a011189a4f6699a598d1cb15ad0f2c730e9722e0ce123d86cf80d2b63","observation_id":"9b34497f-a2a0-43e7-a002-f32ab6dbe7ee","resolution":{"observed_at":"2026-05-25T02:56:35.367549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.00850","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T17:34:57.362731Z","title":"Multi-bench: A multi-turn interactive benchmark for assessing emotional intelligence ability of spoken dialogue models","venue":null,"work_id":"67e3348d-1a9b-4869-bcf0-a69f0d6c72e1","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:6fba10818b69fe5436e78f8bb018f2cac9fd0f44659f0c87cb1a150d66a3f284","observation_id":"e2be10c6-91b2-40e5-abf2-c6973cc89d8b","resolution":{"observed_at":"2026-05-25T02:55:16.436892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:4dacdd1145bd4b3c70351a2d19ab1d0fdc2b70b8cb535243c061f2a878b7a53f","observation_id":"be94f0cd-1a89-49c5-9cc2-8a8b361e35e7","resolution":{"observed_at":"2026-05-25T02:55:16.463143Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.09592","last_updated":"2026-05-10T15:21:35Z","snapshot_observed_at":"2026-07-06T22:32:22.953630Z","submitted_at":"2025-10-10T17:50:59Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","version":2},"cited_work":{"arxiv_id":"2510.09592","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.09592","snapshot_observed_at":"2026-07-03T17:18:44.087054Z","title":"Mind-Paced Speaking: A Dual-Brain Approach to Real-Time Reasoning in Spoken Language Models","venue":"cs.CL","work_id":"15e53184-58e7-4867-8d1f-5e833acbd01e","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2510.09592","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:fb7a638b468b405cafdaf06069830d9f3cd37830330acf50837135f67ee5ad8c","observation_id":"a0b65575-9b51-44bd-9706-5a1487dd1153","resolution":{"observed_at":"2026-05-25T02:55:16.472393Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.05150","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T15:37:06.838629Z","title":"Chronological thinking in full-duplex spoken dialogue language models","venue":null,"work_id":"4c63fc14-bec8-4822-b330-9def61feaae9","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:53cb3d1fd9c10fa433aa56201078ad1ba900b2c344dcdab7c2f429b4bad56566","observation_id":"3f84023c-a4ee-4d5f-bc42-95785eff768a","resolution":{"observed_at":"2026-05-25T02:55:16.505381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Duplexsla: A full-duplex spoken language model with synchronized speech, language, and action","venue":null,"work_id":"acf01bd3-e3be-4833-a895-855bafaf507f","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:c4c080d1e2edb8e5de537d9f9105113e3f6db008780472efbfb667d3a2e3bb92","observation_id":"63082297-3c5c-4db9-aca2-327d8a2db705","resolution":{"observed_at":"2026-05-25T02:56:35.386641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.616170Z","title":"Mamba in speech: Towards an alternative to self-attention.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"e27c8320-3484-4724-b0c5-beb133f6abae","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:43cb70197fec3e29e2a712a2a2549f31dd28601b25a29a5c49c4a3a3aafff241","observation_id":"20c44ea9-682f-4e47-ab7b-0581c94a5b9b","resolution":{"observed_at":"2026-05-25T02:56:35.392860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T08:54:49.621937Z","title":"Code-switching speech recognition under the lens: Model-and data-centric perspectives.IEEE Transactions on Audio, Speech and Language Processing","venue":null,"work_id":"fa7055d6-3e6d-41b7-b87a-09fbf01825de","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:8d731ddab4b42f633eab0ae29fcb0c02d76da8645e725a973773dfdee5bde247","observation_id":"df5d89ca-d3a6-4fe0-b631-566a1f8999a9","resolution":{"observed_at":"2026-05-25T02:56:35.396848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.15848","doi":"10.48550/arxiv.2511.15848","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Step-audio-r1 technical report","venue":"arXiv (Cornell University)","work_id":"80b24600-9960-4df9-97b2-66714cfd73f5","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:d636f99255d6e5e94b7d29bdb497914275cbe04c6a8039fa539a99cd1ce51425","observation_id":"413f7c81-0419-41ee-9e47-258ff55a93e6","resolution":{"observed_at":"2026-05-25T02:55:16.500260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.25719","last_updated":"2026-05-31T23:35:54Z","snapshot_observed_at":"2026-08-03T00:45:36.849248Z","submitted_at":"2026-04-28T14:44:30Z","title":"Step-Audio-R1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2604.25719","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.25719","snapshot_observed_at":"2026-06-30T17:34:57.320451Z","title":"Step-Audio-R1.5 Technical Report","venue":"eess.AS","work_id":"74d860ea-f21d-4baf-8642-60fa524014ca","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2604.25719","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:eeaa59c6e7cecce54ddd6066afdc41af889e879afd41b6dbe7cc122dbe6b8610","observation_id":"61a5a62a-d7e4-43fe-b7da-eb8aaabcd02b","resolution":{"observed_at":"2026-05-25T02:55:16.494617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Park, William Chan, Yu Zhang, et al","venue":null,"work_id":"e695952e-8217-4783-a337-7810935aa5e1","year":2019},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:99fbe2b036dafb4b69f57eae316246a4f5b7d5ec6a1162ea467bdcbcd7e5924c","observation_id":"6bef68ea-45ae-41f8-adba-1faf1a74e168","resolution":{"observed_at":"2026-05-25T02:56:35.402758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dfc0fcca-5e22-4fa1-a2be-e1a8ed96dd12","year":1997},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:28ba4625e89bea5c6d8262049d7b100ff84619ccbcaa515c7593d959c6477323","observation_id":"1a6e80ea-7904-4bf1-ba00-a51938a47ef3","resolution":{"observed_at":"2026-05-25T02:56:35.406529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AIShell-1: An open-source mandarin speech corpus and a speech recognition baseline","venue":null,"work_id":"1f6b4972-6369-46b6-859e-a79a943d7a83","year":2017},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:1e3af321a2ec3f96b8b0901d53ffea51f4a0fe10515b6c9df0f6b3ee2d41b74a","observation_id":"697f37fc-63c2-408f-8eb4-c9cef2fdab7e","resolution":{"observed_at":"2026-05-25T02:56:35.409728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10583","last_updated":"2018-09-13T02:45:27Z","snapshot_observed_at":"2026-08-10T01:59:34.520388Z","submitted_at":"2018-08-31T03:11:08Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","version":2},"cited_work":{"arxiv_id":"1808.10583","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.10583","snapshot_observed_at":"2026-07-05T13:21:06.309631Z","title":"AISHELL-2: Transforming Mandarin ASR Research Into Industrial Scale","venue":"cs.CL","work_id":"123cad45-dfd0-4b02-a99a-47d962dc2ab4","year":2018},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1808.10583","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:294986ad5cd2ddae254b0c1323ea2b3440e0d24d493fce6934d35b1d6620c147","observation_id":"01cf541e-269d-45f9-9451-c73612401bd9","resolution":{"observed_at":"2026-05-25T02:55:16.451910Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"WenetSpeech: A 10000+ hours multi-domain mandarin corpus for speech recognition","venue":null,"work_id":"f731d104-6a5a-44f0-9e08-f4229aaf9e9e","year":2022},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:f7681bfce790b4360239bf27599f006b7107748db39863737a0e48762f504cd2","observation_id":"8d2d211f-feb6-4434-83a8-468b733a68fc","resolution":{"observed_at":"2026-05-25T02:56:35.422611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12446","last_updated":"2022-05-25T02:29:03Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:29:03Z","title":"FLEURS: Few-shot Learning Evaluation of Universal Representations of Speech","version":1},"cited_work":{"arxiv_id":"2205.12446","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.12446","snapshot_observed_at":"2026-07-10T20:37:34.442695Z","title":"FLEURS: Few-shot learning evaluation of universal representations of speech","venue":"cs.CL","work_id":"591017b1-e3a5-4f06-9d81-998d68d87365","year":2022},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/2205.12446","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:eaf13bb8cc947e2c40054e64ea45f360a36810bc762ff26a9ff05c1ce21f7b05","observation_id":"49a49c25-9c27-466e-ae3e-3b83d2481bb9","resolution":{"observed_at":"2026-05-25T02:55:16.447086Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"LibriSpeech: An ASR corpus based on public domain audio books","venue":null,"work_id":"b6dde076-ba15-4626-aaa7-eba8df0299e8","year":2015},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:697ce164e81937b96aac256e64cb05848313572c2a3ff640b8a447944307755a","observation_id":"01041449-4711-47c4-8cb1-e0f0585030bc","resolution":{"observed_at":"2026-05-25T02:56:35.425885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Common voice: A massively-multilingual speech corpus","venue":null,"work_id":"1fb36e07-8d87-4f1a-8284-9622f0851297","year":2020},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:e6345fd523d5b5b3ce77510315fcde1832577a9daa7d8a4f97536aec50ab8c5a","observation_id":"8f1435fe-f4a1-4c63-b748-925370e9a75e","resolution":{"observed_at":"2026-05-25T02:56:35.419215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"V oxpopuli-cleaned-aa: Cleaned ground truth transcripts for voxpopuli english test set","venue":null,"work_id":"5c7e9315-2086-4a80-89ae-6e2e3397d393","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:d1f5f833f935036453d2142c17c6ed0e80d88aa191e845e92dbf7f0b9952af7d","observation_id":"6c171711-18e3-4de3-9885-1f7b8eac9738","resolution":{"observed_at":"2026-05-25T02:56:35.415860Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Earnings22-cleaned-aa: Cleaned ground truth transcripts for earnings22 english test set","venue":null,"work_id":"0fb17f00-410b-4fe0-90a8-5f1992d647f7","year":2026},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:fedf94506911944853ea28b151f22a3ea69068717a2e23cb7a877bbc47008c19","observation_id":"9d1bfb95-8e08-47a5-b14c-f7e005da005c","resolution":{"observed_at":"2026-05-25T02:56:35.412796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.03601","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T07:39:38.491718Z","title":"Step-audio-editx technical report","venue":null,"work_id":"72708f56-8cbe-49d9-a132-7fb2895ef10e","year":2025},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:2a2f1f69f0e216af0f6396ce6314cfc6279b53b3697c07e3df3e1849c996c6a9","observation_id":"4534e43b-4358-4eec-be62-10f5a597de92","resolution":{"observed_at":"2026-05-25T02:55:16.458036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-25T02:52:22.610397Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2605.23463"},"observation_digest":"sha256:947af4a4cbb905453983edeb04fa093d464097744eb4e356746d18daa2de78bc","observation_id":"ae24bc43-fe61-4d31-a7a5-2443a782c1a9","resolution":{"observed_at":"2026-05-25T02:55:16.467568Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.23463","last_updated":"2026-05-22T10:24:50Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-02T21:50:12.344912Z","submitted_at":"2026-05-22T10:24:50Z","title":"StepAudio 2.5 Technical Report"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":20,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 4 inbound Pith citation observations for arXiv:2605.23463."}