{"as_of":"2026-08-11T07:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1fe0a90399813fbdc1231f21d7576cae09689cbfeccc5a1a2063d2c0b5007bdf","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:03:16.518476Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T05:59:50.900436Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-16T05:59:51.133845Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"cited_work":{"arxiv_id":"2506.08967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08967","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","venue":null,"work_id":"b04318ec-cbf5-4971-b93c-9ef783d6fec7","year":2025},"citing_paper":{"arxiv_id":"2507.16632","last_updated":"2025-08-27T16:42:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-22T14:23:55Z","title":"Step-Audio 2 Technical Report","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T05:59:50.900436Z"},"links":{"cited_paper":"/paper/2506.08967","citing_paper":"/paper/2507.16632"},"observation_digest":"sha256:734af9dddbfb8bbc6f8a238374f55d98c629a8b01cbafb2b16c6ae003bd0c0b8","observation_id":"77ab2a72-895c-410e-9eb3-653860b0be7d","resolution":{"observed_at":"2026-05-16T05:59:51.136199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"cited_work":{"arxiv_id":"2506.08967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08967","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","venue":null,"work_id":"b04318ec-cbf5-4971-b93c-9ef783d6fec7","year":2025},"citing_paper":{"arxiv_id":"2604.14932","last_updated":"2026-04-16T12:20:27Z","snapshot_observed_at":"2026-07-06T23:02:36.062162Z","submitted_at":"2026-04-16T12:20:27Z","title":"WavAlign: Enhancing Intelligence and Expressiveness in Spoken Dialogue Models via Adaptive Hybrid Post-Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T11:06:07.355633Z"},"links":{"cited_paper":"/paper/2506.08967","citing_paper":"/paper/2604.14932"},"observation_digest":"sha256:79a401a8ed1bb77e56a48ef02c54c9c8498be9ebe295b6d58bfb056966603ba9","observation_id":"ac1ddd35-444d-4687-88c5-1ac7ceb4cc4e","resolution":{"observed_at":"2026-05-10T11:10:09.183579Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"cited_work":{"arxiv_id":"2506.08967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08967","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","venue":null,"work_id":"b04318ec-cbf5-4971-b93c-9ef783d6fec7","year":2025},"citing_paper":{"arxiv_id":"2604.18489","last_updated":"2026-04-20T16:40:45Z","snapshot_observed_at":"2026-08-11T00:51:45.214067Z","submitted_at":"2026-04-20T16:40:45Z","title":"Aligning Language Models for Lyric-to-Melody Generation with Rule-Based Musical Constraints","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T03:09:41.001660Z"},"links":{"cited_paper":"/paper/2506.08967","citing_paper":"/paper/2604.18489"},"observation_digest":"sha256:7631e5cee6795c157f2009420b2669d719976a70d642df50d11f2b3580ea30b3","observation_id":"86c944ae-9249-46eb-8c34-1251a9201072","resolution":{"observed_at":"2026-05-11T12:41:05.205344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"cited_work":{"arxiv_id":"2506.08967","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08967","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","venue":null,"work_id":"b04318ec-cbf5-4971-b93c-9ef783d6fec7","year":2025},"citing_paper":{"arxiv_id":"2605.06765","last_updated":"2026-05-07T17:59:56Z","snapshot_observed_at":"2026-08-08T18:16:48.532228Z","submitted_at":"2026-05-07T17:59:56Z","title":"VITA-QinYu: Expressive Spoken Language Model for Role-Playing and Singing","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-11T01:03:09.942984Z"},"links":{"cited_paper":"/paper/2506.08967","citing_paper":"/paper/2605.06765"},"observation_digest":"sha256:801437a55a2131e99b4e5c120f982a66b592987f697d314d38ec5891eecd7a7e","observation_id":"ab9d91c2-f249-4a97-9649-5b3a42591fff","resolution":{"observed_at":"2026-05-11T04:50:56.014102Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08967/citation-record","integrity":"/paper/2506.08967/integrity","json":"/paper/2506.08967/citation-record.json","paper":"/paper/2506.08967"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.218384Z","title":"Claude 3.5 sonnet","venue":null,"work_id":"2ba3b85e-9a58-4b5e-9efd-9ad44a6a24ea","year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.339879Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:59dfc7207b97ee75fe42665e1f7ae02a23dc15e11ff6d60dbb6a9130aaabadab","observation_id":"10cb4c00-fb42-4a17-8643-93c8cb711898","resolution":{"observed_at":"2026-08-07T05:03:20.303920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.10328","last_updated":"2022-02-03T03:05:33Z","snapshot_observed_at":"2026-08-09T19:13:04.580156Z","submitted_at":"2022-01-25T14:03:57Z","title":"ML4CO-KIDA: Knowledge Inheritance in Dataset Aggregation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.10328","snapshot_observed_at":"2026-08-07T05:03:11.413339Z","title":"Ml4co-kida: Knowledge inheritance in dataset aggregation.arXiv preprint arXiv:2201.10328, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.413339Z"},"links":{"cited_paper":"/paper/2201.10328","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:ad7125483c6bf83dd39a4b7e834ad812a3f25306c4075a1d9f61ad73c5cf5708","observation_id":"abd46843-edbf-447c-9d90-54b740e55788","resolution":{"observed_at":"2026-08-07T05:03:11.413339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T05:03:11.529192Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers.arXiv preprint arXiv:2406.05370, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.529192Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:6762bd25579dd089182a91389c08241bf9f53e0d3251343a0c01499c697c915e","observation_id":"c04f6727-a3cd-412a-8844-60e880dc20d2","resolution":{"observed_at":"2026-08-07T05:03:11.529192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-07T05:03:11.622724Z","title":"Videollama 2: Advancing spatial-temporal modeling and audio understanding in video-llms.arXiv preprint arXiv:2406.07476, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.622724Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:75f8486bed889e1739e703edf3a6577145abfc7a4c60498f63b773a28928c616","observation_id":"d0a5322d-cb5c-40cb-a5c9-1180a7413fd3","resolution":{"observed_at":"2026-08-07T05:03:11.622724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T05:03:11.715744Z","title":"Qwen2-audio technical report.arXiv preprint arXiv:2407.10759, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.715744Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:606c7ef4eca958b9101757bd8d5fc2c0ac35c23dcdab3c0edfc1a61edcb69ac0","observation_id":"a22e50bd-1de3-49eb-aca5-215897c7b636","resolution":{"observed_at":"2026-08-07T05:03:11.715744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:20.069464Z","title":"Simple and controllable music generation","venue":null,"work_id":"29ac72ba-2f11-4b12-8ba2-a8a299c2e49e","year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.799823Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:f85a8dcad0478ccf43c1dddfa91275ae0963f3fe67e60b297bbb5d1ea509d7b5","observation_id":"6c0ef7c8-88f3-49f6-a9a9-767451b04f45","resolution":{"observed_at":"2026-08-07T05:03:20.146037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03751","last_updated":"2025-08-07T13:29:43Z","snapshot_observed_at":"2026-08-08T14:59:40.686276Z","submitted_at":"2024-10-01T21:48:12Z","title":"Recent Advances in Speech Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03751","snapshot_observed_at":"2026-08-07T05:03:11.869766Z","title":"Recent advances in speech language models: A survey.arXiv preprint arXiv:2410.03751, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.869766Z"},"links":{"cited_paper":"/paper/2410.03751","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:2407919a83d8b1a3278da203ab09db33d014d51c6682d10d9d216c3d149707ba","observation_id":"41695169-4cb5-48d0-8092-c55a769324ee","resolution":{"observed_at":"2026-08-07T05:03:11.869766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.848191Z","title":"Pengi: An audio language model for audio tasks.Advances in Neural Information Processing Systems, 36:18090–18108, 2023","venue":null,"work_id":"50481763-26ab-43be-98ff-8a0503286097","year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:11.955150Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:3082140d839463fbee4540a1d84916eb0c802f913ed2161b95d48067355274bf","observation_id":"98a60a68-68ec-4beb-b36f-3992a44c7334","resolution":{"observed_at":"2026-08-07T05:03:19.991060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.18425","last_updated":"2025-04-25T15:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-25T15:31:46Z","title":"Kimi-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.18425","snapshot_observed_at":"2026-08-07T05:03:12.052740Z","title":"Kimi-audio technical report.arXiv preprint arXiv:2504.18425, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.052740Z"},"links":{"cited_paper":"/paper/2504.18425","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:1ba00654b481003ebfaed9570ca633b1134ca01189a002bd37e182f94362ef23","observation_id":"04ae4ddb-c8ae-4042-b533-bbee52d4e131","resolution":{"observed_at":"2026-08-07T05:03:12.052740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05407","last_updated":"2024-07-09T07:42:51Z","snapshot_observed_at":"2026-08-10T17:49:50.848957Z","submitted_at":"2024-07-07T15:16:19Z","title":"CosyVoice: A Scalable Multilingual Zero-shot Text-to-speech Synthesizer based on Supervised Semantic Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05407","snapshot_observed_at":"2026-08-07T05:03:12.174526Z","title":"Cosyvoice: A scalable multilingual zero-shot text-to-speech synthesizer based on supervised semantic tokens.arXiv preprint arXiv:2407.05407, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.174526Z"},"links":{"cited_paper":"/paper/2407.05407","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:859d516bb06b87cad7df1223f116026b2d6a6bf3e9330e70d56e19055bc0dae0","observation_id":"054ed7e2-d761-4403-9623-b840e7a9ba1e","resolution":{"observed_at":"2026-08-07T05:03:12.174526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.736016Z","title":"Emo-dpo: Controllable emo- tional speech synthesis through direct preference optimization","venue":null,"work_id":"62783270-861e-47f2-be38-f5c6d18f3897","year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.244985Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:526d709726d96af7f49d7a8eea715767891b9bf45239d04bdba842dc9751b51f","observation_id":"1daf89f6-b755-43eb-ba41-ef48f608a2c6","resolution":{"observed_at":"2026-08-07T05:03:19.785059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08317","last_updated":"2023-03-30T07:00:38Z","snapshot_observed_at":"2026-08-01T16:05:21.888603Z","submitted_at":"2022-06-16T17:24:14Z","title":"Paraformer: Fast and Accurate Parallel Transformer for Non-autoregressive End-to-End Speech Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.08317","snapshot_observed_at":"2026-08-07T05:03:12.369009Z","title":"Paraformer: Fast and accurate parallel transformer for non-autoregressive end-to-end speech recognition.arXiv preprint arXiv:2206.08317, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.369009Z"},"links":{"cited_paper":"/paper/2206.08317","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:da0a69f10ce302a5bd4348ab436951b91427b9c6a2b9bc3b8bd6ab3a5f58e9a0","observation_id":"debb1561-7cd4-450d-94b9-44605811f8d0","resolution":{"observed_at":"2026-08-07T05:03:12.369009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.604967Z","title":"Joint audio and speech understanding","venue":null,"work_id":"7d813e55-67e6-49d9-b39c-4e54c1205af3","year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.467905Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:07f575d5121771f00f034300c7efee1305e21bfbb0c5cbb415e5ae6c400eba50","observation_id":"a942c027-9629-45eb-a593-242adb83c897","resolution":{"observed_at":"2026-08-07T05:03:19.651919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.496899Z","title":"Gemini 2.0 pro","venue":null,"work_id":"4cca10d9-251d-4795-be19-58bb8b4f7b1c","year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.579313Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:11f22478ae7f5df5312079001ed8e8ad7203b9dd3c10e92c23307a6571b5b535","observation_id":"b205fbe5-d36f-4836-bd3b-f5605229ace5","resolution":{"observed_at":"2026-08-07T05:03:19.537131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T05:03:12.674168Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.674168Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:11c8c15125f6cb79d27501ec017e05116145409e5df9a4f7f0651e79dee80bc4","observation_id":"f127b7f0-c905-4dec-8d96-fee8ce8bed7d","resolution":{"observed_at":"2026-08-07T05:03:12.674168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07855","last_updated":"2024-06-12T04:09:44Z","snapshot_observed_at":"2026-08-10T13:40:02.857214Z","submitted_at":"2024-06-12T04:09:44Z","title":"VALL-E R: Robust and Efficient Zero-Shot Text-to-Speech Synthesis via Monotonic Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07855","snapshot_observed_at":"2026-08-07T05:03:12.752879Z","title":"Vall-e r: Robust and efficient zero-shot text-to-speech synthesis via monotonic alignment.arXiv preprint arXiv:2406.07855, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.752879Z"},"links":{"cited_paper":"/paper/2406.07855","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:a09066187342fe3732dd7eb18f8a96b629aa19e2d2b4773886f00136412599da","observation_id":"6d71bed5-e07f-464b-8b25-890a7a7847c6","resolution":{"observed_at":"2026-08-07T05:03:12.752879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.371306Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"6138c17b-5b9b-4bde-93e6-84b9dcc3a7e5","year":2016},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.827575Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:74ae3eef3d56752ab9b304a30b5fb4a4051446b1dba66a1f804b0bb35487eae8","observation_id":"fa979691-538a-4d86-a543-e88cc561bffa","resolution":{"observed_at":"2026-08-07T05:03:19.402351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19505","last_updated":"2024-12-30T09:08:12Z","snapshot_observed_at":"2026-08-11T05:45:15.918855Z","submitted_at":"2024-12-27T07:44:07Z","title":"DrivingWorld: Constructing World Model for Autonomous Driving via Video GPT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19505","snapshot_observed_at":"2026-08-07T05:03:12.935432Z","title":"Drivingworld: Constructingworld model for autonomous driving via video gpt.arXiv preprint arXiv:2412.19505, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:12.935432Z"},"links":{"cited_paper":"/paper/2412.19505","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:725ce8e9c6728c685844300cb9d2c3176bc8175edad59a41923b35cab784a49b","observation_id":"82e4a2a7-0850-40ef-9200-49d35d6dd197","resolution":{"observed_at":"2026-08-07T05:03:12.935432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11946","last_updated":"2025-02-18T07:29:10Z","snapshot_observed_at":"2026-08-01T18:52:39.594289Z","submitted_at":"2025-02-17T15:58:56Z","title":"Step-Audio: Unified Understanding and Generation in Intelligent Speech Interaction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11946","snapshot_observed_at":"2026-08-07T05:03:13.012840Z","title":"Step-audio: Unified understanding and generation in intelligent speech interaction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.012840Z"},"links":{"cited_paper":"/paper/2502.11946","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:a1df2e52ed04a36042a962c49fbaf73747625e40a3cb78729c7f577e35d05163","observation_id":"2ecf714d-a632-43b9-948e-0244e0216d2f","resolution":{"observed_at":"2026-08-07T05:03:13.012840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:13.099690Z","title":"Audiogpt: Understanding and generating speech, music, sound, and talking head","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.099690Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:108cad75a457027e3eb0df9b1043cfc3a9285c1ccb8a6314375d23e873d8ad60","observation_id":"e0ab10ad-e0c6-4cc2-9cb0-80ac60a65f79","resolution":{"observed_at":"2026-08-07T05:03:13.099690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T05:03:13.194856Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.194856Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:62cf09ad7f350716d1c2acbeb291bed44da72fed376c58cffbb3a2e87a978bf8","observation_id":"4f417131-a65b-427e-8cfc-91cb7a895586","resolution":{"observed_at":"2026-08-07T05:03:13.194856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:03:13.295965Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.295965Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:f428d735e8c5ce3686bbf6a615e3a817b3445776e2d19d33adc6f3384e9b30a0","observation_id":"8dfec203-8715-435f-9432-4cfbb285ceb1","resolution":{"observed_at":"2026-08-07T05:03:13.295965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13577","last_updated":"2024-11-26T09:20:48Z","snapshot_observed_at":"2026-08-06T09:02:03.671500Z","submitted_at":"2024-11-15T04:16:45Z","title":"WavChat: A Survey of Spoken Dialogue Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13577","snapshot_observed_at":"2026-08-07T05:03:13.393147Z","title":"Wavchat: A survey of spoken dialogue models.arXiv preprint arXiv:2411.13577, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.393147Z"},"links":{"cited_paper":"/paper/2411.13577","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:ef1a9249bb3f0bd62e7ba66d2eb929b6bbe0da00294a1127fc9a6e3691bee6ed","observation_id":"681a5cdb-7ba7-4382-9e1f-b936d7d04130","resolution":{"observed_at":"2026-08-07T05:03:13.393147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.208402Z","title":"An llm compiler for parallel function calling","venue":null,"work_id":"42459033-6c7b-455a-b187-6b4a75791452","year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.488079Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:3be3533cf74a88bc01c73768a5099fbcb45b6712ef6258e108ef8582fcaedcf7","observation_id":"3b51b3cd-7c60-4af5-b140-ae3258ec7077","resolution":{"observed_at":"2026-08-07T05:03:19.310225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06452","last_updated":"2024-02-19T14:39:07Z","snapshot_observed_at":"2026-07-29T18:39:02.141391Z","submitted_at":"2023-10-10T09:25:44Z","title":"Understanding the Effects of RLHF on LLM Generalisation and Diversity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06452","snapshot_observed_at":"2026-08-07T05:03:13.573676Z","title":"Understanding the effects of rlhf on llm generalisation and diversity.arXiv preprint arXiv:2310.06452, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.573676Z"},"links":{"cited_paper":"/paper/2310.06452","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:3d4a12233999a85685a01625005a40539d58d946a6ad5e187dc61129e4aced7c","observation_id":"4784308c-b4a6-411a-855a-1dc0db1d4d6d","resolution":{"observed_at":"2026-08-07T05:03:13.573676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01831","last_updated":"2024-05-28T05:44:53Z","snapshot_observed_at":"2026-08-07T19:26:44.980429Z","submitted_at":"2024-02-02T18:58:34Z","title":"Audio Flamingo: A Novel Audio Language Model with Few-Shot Learning and Dialogue Abilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01831","snapshot_observed_at":"2026-08-07T05:03:13.651263Z","title":"Audio flamingo: A novel audio language model with few-shot learning and dialogue abilities.arXiv preprint arXiv:2402.01831, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.651263Z"},"links":{"cited_paper":"/paper/2402.01831","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:0f4710faeda5afe6bd41962a60d1b251a419a7af3bf88912e1851e58b80555b8","observation_id":"4d3e3944-1c43-49b2-a452-e36b1b2eda44","resolution":{"observed_at":"2026-08-07T05:03:13.651263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:19.073877Z","title":"Flexkbqa: A flexible llm-powered framework for few-shot knowledge base question answering","venue":null,"work_id":"30baa191-2632-42e5-a06c-fc21e69bbfc0","year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.754388Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:32ba032c1427cd4f69849fb4b99526065c3cda5b84adb2d2b91212f84d2ff8d2","observation_id":"fa47b73e-e297-4d3f-a577-85bf14e82af4","resolution":{"observed_at":"2026-08-07T05:03:19.137327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:13.853463Z","title":"Merging models with fisher-weighted averaging.Advances in Neural Information Processing Systems, 35:17703–17716, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.853463Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:3653cfddc93a9bb39edb262035a86364e00f9c054ff0b18dbbef4552fea13d9a","observation_id":"945b7c88-6470-46fa-989f-fd6bb4e79769","resolution":{"observed_at":"2026-08-07T05:03:13.853463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:13.950462Z","title":"Using an llm to help with code understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:13.950462Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:74550c2d50ef31985d3ba72f997d338677b4358d0cf93551801ed615649755f8","observation_id":"a3ac23ad-a909-40b9-81fe-b2e8d0973b32","resolution":{"observed_at":"2026-08-07T05:03:13.950462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.855974Z","title":"The role of paralinguistic cues in social life.ANALYSIS OF MODERN SCIENCE AND INNOVATION, 1(2):215–218, 2024","venue":null,"work_id":"74710d91-ae45-43d7-92e3-372790f139b6","year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.045361Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:1f72163f6f4b9e14d8b16be2ecefb729a20c335b69a1132c6e7ba277139aea6c","observation_id":"6c60b368-3315-473a-bc21-6a6e4f930483","resolution":{"observed_at":"2026-08-07T05:03:18.931107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:14.141710Z","title":"A survey on speech large language models.arXiv preprint arXiv:2410.18908, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.141710Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:55d4269e971522e77d314848ae736356441e50de49b2e4839f0978d70b037326","observation_id":"2905d971-6f5a-4ca6-b4ba-96df5210b1ce","resolution":{"observed_at":"2026-08-07T05:03:14.141710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:14.234520Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36:53728–53741, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.234520Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:19919edfa19051d741ef8768968f06b8db9ffd8121b1d4d12fe544875446780d","observation_id":"cd1534b0-420e-4502-8a87-676fc3828313","resolution":{"observed_at":"2026-08-07T05:03:14.234520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-07T05:03:14.333366Z","title":"Audiopalm: A large language model that can speak and listen.arXiv preprint arXiv:2306.12925, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.333366Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:c25d3dc3c9326b279337ff75c6857ebd34c10b4dec295f6b892f37e558df6886","observation_id":"7f2b0cb2-a3ab-483b-adf7-e8e47cc6535a","resolution":{"observed_at":"2026-08-07T05:03:14.333366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.696337Z","title":"How to debug code with github copilot","venue":null,"work_id":"99cf36f1-f6f9-4477-b43b-e991495306dc","year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.429648Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:d0e5121046e66de802c9ceb78bf7bcd3fa68af3586c042d07cfa7a1977d6c28f","observation_id":"ddd32cd2-70b9-49a6-85db-d6918228071c","resolution":{"observed_at":"2026-08-07T05:03:18.762496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.534839Z","title":"Paralinguistics in speech and language—state-of-the-art and the challenge","venue":null,"work_id":"b2d0fbf1-1344-4e66-949d-612e62c50213","year":2013},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.503974Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:b639351e62e2311a86299d6dccd985fccd60560fbae7b9521bf4db566a0441f6","observation_id":"0450f964-3514-4b32-b6d4-1193c5f26a67","resolution":{"observed_at":"2026-08-07T05:03:18.596275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-03T00:52:54.308486Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17580","snapshot_observed_at":"2026-08-07T05:03:14.618551Z","title":"Hugginggpt: Solving ai tasks with chatgpt and its friends in hugging face, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.618551Z"},"links":{"cited_paper":"/paper/2303.17580","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:095e85355d90e97cd0db0c7093d6410c3cbc25a644215a38a58c5eb8958b1d41","observation_id":"1f9684bb-3fd8-44ed-ba66-efc89785ae4c","resolution":{"observed_at":"2026-08-07T05:03:14.618551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.381763Z","title":"Stepeval-audio-360","venue":null,"work_id":"fe9cc38f-2540-4a34-91b4-cc787abe61c5","year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.752046Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:a0188155362039d3acbb4c9af6b37ac0959a8bd1f25ca36abeeee08121b0e4b6","observation_id":"2c510c4f-08a8-4eb0-a358-fcd62f230dd2","resolution":{"observed_at":"2026-08-07T05:03:18.443217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-07T05:03:14.876677Z","title":"Salmonn: Towards generic hearing abilities for large language models.arXiv preprint arXiv:2310.13289, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.876677Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:a0595418b198eaa0e03e97a9cc15054219c1fd30d6519fcc7edd8e5e35dc2fc5","observation_id":"95470915-60f4-4c1e-8152-ab198d7116a5","resolution":{"observed_at":"2026-08-07T05:03:14.876677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.206789Z","title":"Preference alignment improves language model-based tts","venue":null,"work_id":"394c82b0-2b79-4e23-aba4-7d59de1bf98b","year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:14.945288Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:534f59924539057b5b6f0143e881a77bb9553c5bc95e6564fd363b6ae3d33a98","observation_id":"81d875f8-529e-42f4-811b-7d2830f9f202","resolution":{"observed_at":"2026-08-07T05:03:18.297584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:18.037487Z","title":"Lami: Large language models for multi-modal human-robot interaction","venue":null,"work_id":"2901a9b2-ed55-4353-bb20-6f7f8b6db0c4","year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.071882Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:021eac005b7efbe3e34de4f4c7dff36d1bce9867e6c258c9bd2ed026cd8891b9","observation_id":"d1195625-63a9-4c2a-b0c9-f18331437a73","resolution":{"observed_at":"2026-08-07T05:03:18.113523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02111","last_updated":"2023-01-05T15:37:15Z","snapshot_observed_at":"2026-08-07T10:11:17.796562Z","submitted_at":"2023-01-05T15:37:15Z","title":"Neural Codec Language Models are Zero-Shot Text to Speech Synthesizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02111","snapshot_observed_at":"2026-08-07T05:03:15.171753Z","title":"Neural codec language models are zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.171753Z"},"links":{"cited_paper":"/paper/2301.02111","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:584580961ba786ad8ea92c2fde707deb6c097dc14b460238efa488ab81cd611e","observation_id":"907f9a29-8e0a-4a27-99f6-cd12850217ed","resolution":{"observed_at":"2026-08-07T05:03:15.171753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16216","last_updated":"2026-05-16T18:30:31Z","snapshot_observed_at":"2026-08-02T12:01:06.084117Z","submitted_at":"2024-07-23T06:45:52Z","title":"Reinforcement Learning for LLM Post-Training: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16216","snapshot_observed_at":"2026-08-07T05:03:15.250044Z","title":"A comprehensive survey of llm alignment techniques: Rlhf, rlaif, ppo, dpo and more.arXiv preprint arXiv:2407.16216, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.250044Z"},"links":{"cited_paper":"/paper/2407.16216","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:406a75862ce7d57a4a4275d37a65a94c1662298addaf1d672934a2d13ac33cb4","observation_id":"41321313-bb77-41b8-856f-84ad7fcbe144","resolution":{"observed_at":"2026-08-07T05:03:15.250044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:15.331162Z","title":"Model soups: aver- aging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.331162Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:47ab19c2e5f8eba91a402af4b2e5b54b0f83218b9245351a5cfeb69131685da0","observation_id":"66595b68-8294-47cb-94a7-89faf54611fd","resolution":{"observed_at":"2026-08-07T05:03:15.331162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13071","last_updated":"2024-09-18T12:02:47Z","snapshot_observed_at":"2026-08-11T07:24:17.888340Z","submitted_at":"2024-02-20T15:13:38Z","title":"Codec-SUPERB: An In-Depth Analysis of Sound Codec Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13071","snapshot_observed_at":"2026-08-07T05:03:15.425974Z","title":"Codec-superb: An in-depth analysis of sound codec models.arXiv preprint arXiv:2402.13071, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.425974Z"},"links":{"cited_paper":"/paper/2402.13071","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:fc1882add86e3b0a91585f14d4455a3bd301d6ff4b7559741a7e60abd951a0ef","observation_id":"962da2ef-045a-4b6e-b459-fe49ff99f826","resolution":{"observed_at":"2026-08-07T05:03:15.425974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.818923Z","title":"When search engine services meet large language models: visions and challenges.IEEE Transactions on Services Computing, 2024","venue":null,"work_id":"38df2f7a-4a1f-4fe1-bfda-21aaad9f3bc9","year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.557323Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:4ec76da832fd7d1f3759bf9c6bb5bc1dfea5b13024b6d89b8a3e092f0127e997","observation_id":"07125a7f-1975-4d32-a803-21d414475f7b","resolution":{"observed_at":"2026-08-07T05:03:17.895203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T05:03:15.651302Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.651302Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:d769f7be3d887fbc86f8c0b9de00c43b4a077aa332db23eb9fe0a085a7d89384","observation_id":"7f1bb81c-d213-49f6-b752-269636b914d0","resolution":{"observed_at":"2026-08-07T05:03:15.651302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.567932Z","title":"Uniaudio: Towards universal audio generation with large language models","venue":null,"work_id":"8c454a00-bc85-42cb-baf9-3daec5b6979f","year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.749688Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:4c1ef24c62101c1fd73884868740c174866a4e9069917035730f17787e3877a0","observation_id":"bd288521-e2f9-45f7-b906-647636d89695","resolution":{"observed_at":"2026-08-07T05:03:17.676913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:15.837924Z","title":"Soundstream: An end-to-end neural audio codec.IEEE/ACM Transactions on Audio, Speech, and Language Processing, 30:495–507, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.837924Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:62a34157cc570414e12ef09853844071dfdd51c02f6063195b8863e0e2359db9","observation_id":"5eade042-b8c6-4f85-aa5f-faaa4851b64b","resolution":{"observed_at":"2026-08-07T05:03:15.837924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-07T05:03:15.913730Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot.arXiv preprint arXiv:2412.02612, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.913730Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:67863fcaeb6cbd9dfc47fc27295eed146619d2a8549ade85a7459da996d09f7e","observation_id":"6364a05c-56a0-4e4d-a795-8ba0b4bfed1d","resolution":{"observed_at":"2026-08-07T05:03:15.913730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:15.976166Z","title":"Root mean square layer normalization.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:15.976166Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:a34b300733d7b6bddfe3b2c7402e41572ac044ff17c40bf1f0c7f0f4989453d4","observation_id":"fb0bdad5-184f-4cb4-a36d-75ce3e54ac98","resolution":{"observed_at":"2026-08-07T05:03:15.976166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11000","last_updated":"2023-05-19T14:41:16Z","snapshot_observed_at":"2026-08-07T10:56:05.622094Z","submitted_at":"2023-05-18T14:23:25Z","title":"SpeechGPT: Empowering Large Language Models with Intrinsic Cross-Modal Conversational Abilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11000","snapshot_observed_at":"2026-08-07T05:03:16.062120Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities.arXiv preprint arXiv:2305.11000, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:16.062120Z"},"links":{"cited_paper":"/paper/2305.11000","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:751219b56e99fd9a3ce3c03cff10d7be34111698b9a37568ffb4aaaba641b85d","observation_id":"0d49440e-e10f-4e6a-9510-fbd1db9a59de","resolution":{"observed_at":"2026-08-07T05:03:16.062120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05600","last_updated":"2024-04-08T15:21:17Z","snapshot_observed_at":"2026-08-05T11:57:00.393189Z","submitted_at":"2024-04-08T15:21:17Z","title":"SpeechAlign: Aligning Speech Generation to Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05600","snapshot_observed_at":"2026-08-07T05:03:16.158400Z","title":"Speechalign: Aligning speech generation to human preferences.arXiv preprint arXiv:2404.05600, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:16.158400Z"},"links":{"cited_paper":"/paper/2404.05600","citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:774b9526632ed9d7a72ab18b46175361d0c96b77f8113ab0720e9d8e059981d2","observation_id":"359d011e-1276-4af3-b3e7-480e3cd1ae5c","resolution":{"observed_at":"2026-08-07T05:03:16.158400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:16.265675Z","title":"Vistorybench: Comprehensive benchmark suite for story visualiza- tion.arXiv preprint arXiv:2505.24862, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:16.265675Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:111b7fad617ae4842eb4339d6f9c45ff7a1e3404defc8506bd060eb06f73294f","observation_id":"2e36a9ec-f727-4c09-a3e8-6fcb7d392395","resolution":{"observed_at":"2026-08-07T05:03:16.265675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:16.429765Z","title":"Toolqa: A dataset for llm question answering with external tools.Advances in Neural Information Processing Systems, 36:50117–50143, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:16.429765Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:5736b811ef764b280d1fe7ae831d9c93df2bde70bef0bbdbf9955427b46209b5","observation_id":"4e967e3e-1770-489c-9c03-e9a1b3228968","resolution":{"observed_at":"2026-08-07T05:03:16.429765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:17.307611Z","title":"Pre-trained language model based ranking in baidu search","venue":null,"work_id":"05658991-8491-4ba6-a214-ab47548846d0","year":2021},"citing_paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:16.518476Z"},"links":{"citing_paper":"/paper/2506.08967"},"observation_digest":"sha256:3b65f725be315eca30a43245eb0a76c21c20dc57efb5e3c2c3444931e22fb6bd","observation_id":"a601aaa1-bf4b-4671-b545-3f298fe43b31","resolution":{"observed_at":"2026-08-07T05:03:17.385454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08967","last_updated":"2025-06-13T10:07:42Z","latest_version":2,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-08T15:39:54.287755Z","submitted_at":"2025-06-10T16:37:39Z","title":"Step-Audio-AQAA: a Fully End-to-End Expressive Large Audio Language Model"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 4 inbound Pith citation observations for arXiv:2506.08967."}