{"as_of":"2026-08-10T09:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4258ebe7a70cca1ceaa5873ded2df30ad04fdcbd5c3c97186b380b899f677f4","coverage":[{"denominator":85,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":85,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:58:42.951304Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T08:53:13.408944Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T21:28:58.307813Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"cited_work":{"arxiv_id":"2506.00975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00975","snapshot_observed_at":"2026-07-03T21:28:58.307813Z","title":"Ntpp: Generative speech language modeling for dual- channel spoken dialogue via next-token-pair prediction,","venue":null,"work_id":"5e1b89d1-bf5c-43ab-8de6-116a0d2f734e","year":2025},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-07-12T08:53:05.906087Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-03T21:22:38.888528Z"},"links":{"cited_paper":"/paper/2506.00975","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:1808ac20206e8cc67a00893619a82b56fdae6c6f996d84b24cd18c49896758af","observation_id":"0f6d85ff-3033-4893-b0eb-51c374cca2bf","resolution":{"observed_at":"2026-07-03T21:28:58.310003Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00975","snapshot_observed_at":"2026-07-12T08:53:13.408944Z","title":"Ntpp: Generative speech language modeling for dual- channel spoken dialogue via next-token-pair prediction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.01345","last_updated":"2026-07-05T19:53:45Z","snapshot_observed_at":"2026-07-12T08:53:05.906087Z","submitted_at":"2026-07-01T18:03:09Z","title":"TurnNat: Automatic Evaluation of Turn-Taking Naturalness in Dyadic Spoken Dialogue","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-12T08:53:13.408944Z"},"links":{"cited_paper":"/paper/2506.00975","citing_paper":"/paper/2607.01345"},"observation_digest":"sha256:08c5c428c2be3d5bd05c7caa1088423a9d8e797b52d69cb3ae8de1849bda9dcc","observation_id":"05a346ee-4bdb-427e-b5f7-2ae849d7bb49","resolution":{"observed_at":"2026-07-12T08:53:13.408944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00975/citation-record","integrity":"/paper/2506.00975/integrity","json":"/paper/2506.00975/citation-record.json","paper":"/paper/2506.00975"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:32.567763Z","title":"URL https://chattts.com/","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:32.567763Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:67784c3491a4903bcf52057ecd9e7bebaecbbdc4f7004fb0604f3db8195cc826","observation_id":"3c6e1d7f-e66e-450c-b2e6-694dcebd8e65","resolution":{"observed_at":"2026-08-07T11:58:32.567763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:32.619472Z","title":"L., Borgeaud, S., Brock, A., Nematzadeh, A., Sharifzadeh, S., Binkowski, M., Barreira, R., Vinyals, O., Zisserman, A., and Simonyan, K","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:32.619472Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:2c7b78fdbb3cea72935681d60c30aec11c01d712ab0310fb3ed58687bb882b96","observation_id":"e29e318d-d351-4b0b-b673-5f2dafab736c","resolution":{"observed_at":"2026-08-07T11:58:32.619472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02430","last_updated":"2024-06-04T15:48:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-04T15:48:29Z","title":"Seed-TTS: A Family of High-Quality Versatile Speech Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02430","snapshot_observed_at":"2026-08-07T11:58:32.751404Z","title":"Seed-tts: A family of high-quality versatile speech generation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:32.751404Z"},"links":{"cited_paper":"/paper/2406.02430","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:030ee5fa6ba5fec20c6713e36eba91e07d22f6677a9904388b427a10bc580e89","observation_id":"6c068f11-9a6e-4a59-b3d1-ebd2798c923b","resolution":{"observed_at":"2026-08-07T11:58:32.751404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:32.860327Z","title":"Speecht5: Unified-modal encoder-decoder pre-training for spoken language processing","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:32.860327Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:cb7d55ba53a508521a26bf24113cd94ff0d907860b9c6f53a22def90ca40f13a","observation_id":"895298cc-c608-419f-998e-e946641413b7","resolution":{"observed_at":"2026-08-07T11:58:32.860327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06670","last_updated":"2020-03-05T20:37:08Z","snapshot_observed_at":"2026-08-05T11:17:11.092255Z","submitted_at":"2019-12-13T19:22:44Z","title":"Common Voice: A Massively-Multilingual Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06670","snapshot_observed_at":"2026-08-07T11:58:32.997075Z","title":"M., and Weber, G","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:32.997075Z"},"links":{"cited_paper":"/paper/1912.06670","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:9d7f1c04bd2819f7ca29d1eab1e7b9573c7ec2720b4c755d38d73b6e9399a0aa","observation_id":"a1636c54-3f43-496b-9d53-5b339f20af2f","resolution":{"observed_at":"2026-08-07T11:58:32.997075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02973","last_updated":"2024-04-03T14:12:36Z","snapshot_observed_at":"2026-08-07T23:24:23.903592Z","submitted_at":"2023-10-04T17:10:23Z","title":"UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions","version":2},"cited_work":{"arxiv_id":"2310.02973","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.02973","snapshot_observed_at":"2026-08-07T11:58:43.562757Z","title":"UniverSLU: Universal Spoken Language Understanding for Diverse Tasks with Natural Language Instructions","venue":"cs.CL","work_id":"28079f25-609c-49ca-93bf-2a1b68ef5d24","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:33.119159Z"},"links":{"cited_paper":"/paper/2310.02973","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:3bce206eb73e3aa72b04dd5a800f41bd3afed4c7937427ab8581986f300a45fb","observation_id":"bf5438fe-1fe1-4d58-925c-5c8a7a0fdcdd","resolution":{"observed_at":"2026-08-07T11:58:43.660736Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:33.224038Z","title":"Wav2vec 2.0: Learning the structure of speech from raw audio","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:33.224038Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:c16f36e25e8d22503f62b53ef2939c8cfd5feea216b4f2971731ea87e052b24a","observation_id":"be36cb6e-4e8f-4c7f-a43f-6d65697acb32","resolution":{"observed_at":"2026-08-07T11:58:33.224038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:33.386322Z","title":"Audiolm: A language modeling approach to audio generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:33.386322Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:ad19436938e571b8197fa678638758f0f511b11fdad3c43c30b0318048d9d45b","observation_id":"27ea4246-ec6f-4fc2-9b03-b0f163153d80","resolution":{"observed_at":"2026-08-07T11:58:33.386322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:56.810084Z","title":"D., J \\' u nior, A","venue":null,"work_id":"d350f302-8474-4133-9786-e75dbd48f4cd","year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:33.522304Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:77c3640c706b403c0734939cac2ea994e1078ac54394fe0340c4c9be43c50dd7","observation_id":"7bb04f5b-c50f-4ee3-982c-7d70c3d03ece","resolution":{"observed_at":"2026-08-07T11:58:56.927864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:56.560744Z","title":null,"venue":null,"work_id":"40fe2bc6-ad46-43bd-94a0-be9f50341fa5","year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:33.640729Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:bc95f957275f7e02f18f3b2df2a946c45d8045f0e9f5e15e7235fea85ea55a1e","observation_id":"9e0bea6d-ba96-4772-ad3b-b985ffe392f6","resolution":{"observed_at":"2026-08-07T11:58:56.691490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05370","last_updated":"2024-06-17T04:39:08Z","snapshot_observed_at":"2026-08-08T07:23:06.245954Z","submitted_at":"2024-06-08T06:31:03Z","title":"VALL-E 2: Neural Codec Language Models are Human Parity Zero-Shot Text to Speech Synthesizers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05370","snapshot_observed_at":"2026-08-07T11:58:33.743754Z","title":"VALL-E 2: Neural codec language models are human parity zero-shot text to speech synthesizers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:33.743754Z"},"links":{"cited_paper":"/paper/2406.05370","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:d19d5fa96df1b7d6315b78cf5606cf7984734906cb319e002c0a0b15827fa66c","observation_id":"a3105a6d-23ac-44bc-adf1-d7dbaa5fd501","resolution":{"observed_at":"2026-08-07T11:58:33.743754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-07T11:58:33.890548Z","title":"Qwen2-audio technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:33.890548Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:8c26488f534989792b6c7daa0961ee309b51400267f2b25f11208cae816fb803","observation_id":"78a49792-6902-455d-b0a8-d4bde5038fe8","resolution":{"observed_at":"2026-08-07T11:58:33.890548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:56.327269Z","title":"Fisher english training speech part 1 transcripts","venue":null,"work_id":"8c4e39c7-28bb-47cf-b117-c6e72d013fdc","year":2004},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.008369Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:ec39049a48fc9b339698ae00f9af144fba11d9413bfa8be234e1dc6b1b5404c2","observation_id":"a5a904c0-bc0b-4e51-b1b9-2c30286229e6","resolution":{"observed_at":"2026-08-07T11:58:56.470785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:56.055309Z","title":"Simple and controllable music generation","venue":null,"work_id":"947a5bd8-82c9-46df-b907-bf7d5dacf941","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.130601Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:0bee3f11374ad4c9f52d244d1c65728b29e4ff030a1f2d51bc71e3dbd7b38d0b","observation_id":"22a12f79-7fe4-49e1-8e7f-61dfd7ec94ef","resolution":{"observed_at":"2026-08-07T11:58:56.194214Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:55.761444Z","title":"Y., Ermon, S., Rudra, A., and R \\' e , C","venue":null,"work_id":"aacb166c-af43-44c4-864c-10c184f9099e","year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.241000Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:d5e55d7b21fd5bbf97c9756f0f722dc313536363ebc3e09f6f81c51ec2d42441","observation_id":"312dfe16-cff2-4271-8325-6e2db28426ef","resolution":{"observed_at":"2026-08-07T11:58:55.926907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:55.536370Z","title":"Moshi: a speech-text foundation model for real-time dialogue","venue":null,"work_id":"eece44ec-4987-47d7-95f2-0f3268376c9a","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.396487Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:3f91f8ea38a4a920aa0fc0c973d95e5a99d71027882e22695b7fa08cb580b8cb","observation_id":"7d474f38-9b34-4734-a226-eb1c4ca373f0","resolution":{"observed_at":"2026-08-07T11:58:55.619710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:55.301977Z","title":"Pengi: An audio language model for audio tasks","venue":null,"work_id":"560d0b83-61bb-4b1b-9ce3-042d958efbbc","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.505924Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:1ce2336f78c01b4fc8bd730986d50587a346694026288a9e2937ecde183cdc28","observation_id":"8d72e998-71f2-475c-9171-1452dc0e2651","resolution":{"observed_at":"2026-08-07T11:58:55.424225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:58:34.644720Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.644720Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:f0fc357923a134e615ec89ed6ac15b1b836fde79c0cd73cc3ebe7fa65c09f40d","observation_id":"8035faf3-7c08-4760-b83f-b6f966129199","resolution":{"observed_at":"2026-08-07T11:58:34.644720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:55.073015Z","title":"A., and Wang, H","venue":null,"work_id":"14042351-dd90-4dbd-809e-41ba859924a5","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.781530Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:15ae2eda7f2eb748d4651e756414006e657cbba2653ff1da0b3d493caf20013c","observation_id":"bc2143a5-894e-4cd2-8ea6-84f5f8324f3d","resolution":{"observed_at":"2026-08-07T11:58:55.196143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.800327Z","title":"Taming transformers for high-resolution image synthesis","venue":null,"work_id":"8a64c9b6-8e91-496a-be5f-2eba7dba9c96","year":2021},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:34.905358Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:426ad3823ccd2bee2bf4e1254397204362eb87da37833e301105bf9f468f069c","observation_id":"92319e28-3802-475c-9737-cb73be4d4fd7","resolution":{"observed_at":"2026-08-07T11:58:54.968188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-07T11:58:35.040733Z","title":"Llama-omni: Seamless speech interaction with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.040733Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:fd249f86170e9d8cf09920b4a6aaaf065e9990922737d95ca531586922dc26c8","observation_id":"9277ae40-93a8-402b-a2fb-6f5c118d4c39","resolution":{"observed_at":"2026-08-07T11:58:35.040733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.560433Z","title":"Audiochatllama: Towards general-purpose speech abilities for llms","venue":null,"work_id":"d4bfbce6-753a-4775-b73c-4c94e503de0a","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.199376Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:fbabf9ecc23ade17f1d09b0c6fe0594d1740a5ceb5264eb0f90346815e8ce0b0","observation_id":"cbe33887-8a6b-4137-8a82-948411c9230e","resolution":{"observed_at":"2026-08-07T11:58:54.677786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.418129Z","title":"Vita: Towards open-source interactive omni multimodal llm, 2024","venue":null,"work_id":"f265e4f3-360e-4fe4-9d29-f0e6a17d436e","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.296527Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:ed615a7e6b48cf13259d336f78f4db0cbc9ac582346386b9b513c36c4d4ea0fd","observation_id":"3827e764-6204-4997-b37d-b787117fdf61","resolution":{"observed_at":"2026-08-07T11:58:54.488112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:54.137841Z","title":"Funasr: A fundamental end-to-end speech recognition toolkit","venue":null,"work_id":"ed2c5fd6-40e1-4d42-9aad-eb5621a98bd9","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.436272Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:fb5fdba5872083936533062b3d3325aa96b945693628b230210f46ca61b43b9e","observation_id":"3af4459a-7331-4898-9375-ffa2d8b34895","resolution":{"observed_at":"2026-08-07T11:58:54.283084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.843980Z","title":"A., Gat, I., Conneau, A., Kreuk, F., Copet, J., D \\' e fossez, A., Synnaeve, G., Dupoux, E., Schwartz, R., and Adi, Y","venue":null,"work_id":"d4a89d4d-b569-4bd0-af2f-1d21099dbc83","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.569886Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:f1dd3b039d7d5f0a09bb19cf053ffd7d307f8d81134a73732f2cb58ecd212826","observation_id":"ac321634-5ca9-484a-8c90-13f474f18b1f","resolution":{"observed_at":"2026-08-07T11:58:53.961536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.659084Z","title":"Kenlm: Faster and smaller language model queries","venue":null,"work_id":"30b7b327-32d7-4528-a0ac-644f8bd0d981","year":2011},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.700587Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:12361cb15ba5805cfc973f2d476a818441848fca809974986f6030d52c20c221","observation_id":"551d551f-dee4-47fd-8ee6-60bd884b59d8","resolution":{"observed_at":"2026-08-07T11:58:53.726981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.438892Z","title":"Make-an-audio: Text-to-audio generation with prompt-enhanced diffusion models","venue":null,"work_id":"9afa9978-07a7-416c-bac6-e0da4dcc2a91","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:35.899089Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:c0a0248e740dea58145ec78381f25fccc7f9f2442b1aecc97b40beb5081fdde6","observation_id":"8dc67ce7-02a3-4c47-882b-a35b76ec12f8","resolution":{"observed_at":"2026-08-07T11:58:53.570099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T11:58:36.013224Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.013224Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:597930152e5c2455cb14c618f6ee06eab475afdf2d134bf59d93dbfd1d3408e1","observation_id":"70df1984-f0c7-4d8c-8fcf-ba11ed3134da","resolution":{"observed_at":"2026-08-07T11:58:36.013224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03509","last_updated":"2023-06-06T08:54:49Z","snapshot_observed_at":"2026-07-06T15:39:06.851333Z","submitted_at":"2023-06-06T08:54:49Z","title":"Mega-TTS: Zero-Shot Text-to-Speech at Scale with Intrinsic Inductive Bias","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03509","snapshot_observed_at":"2026-08-07T11:58:36.096538Z","title":"Mega-tts: Zero-shot text-to-speech at scale with intrinsic inductive bias","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.096538Z"},"links":{"cited_paper":"/paper/2306.03509","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:3cbdaf709c97f0791cfc55eac31e761b746826d36ec6a8d99aa4b5aa5b4792da","observation_id":"3edb39cc-aa46-4f93-b2bc-0f6f5ec4b43f","resolution":{"observed_at":"2026-08-07T11:58:36.096538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:53.193147Z","title":"Speak, read and prompt: High-fidelity text-to-speech with minimal supervision","venue":null,"work_id":"5074776d-1c8a-4faf-bf04-0960c9d5d515","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.223271Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:7e39677179ffd8c5dd11d294490c2fbcc4333a8c2f52241ce17a74d17fce159b","observation_id":"bc7481c0-d0d8-401b-a7cb-ccaa79b20de2","resolution":{"observed_at":"2026-08-07T11:58:53.286789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.914952Z","title":"Hifi-gan: Generative adversarial networks for efficient and high fidelity speech synthesis","venue":null,"work_id":"16a379f4-94af-4d4f-99c3-bc4b68fee4a6","year":2020},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.333973Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:e0392bdcc6333ca521b6cdaba8e3e5e862c014e323ac1ebc63ff8f7e30ac7816","observation_id":"e6a44f7e-c36a-485a-8fcc-6b0313bede3d","resolution":{"observed_at":"2026-08-07T11:58:53.057115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.692112Z","title":"Diffwave: A versatile diffusion model for audio synthesis","venue":null,"work_id":"4de88fa2-871e-42d6-86e4-4c35c3798380","year":2021},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.431685Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:4bf0b6746cb25123afc66233b2115132806c37355a2c1edd570290eb7a95f5cc","observation_id":"4acb6830-e1a4-4ae2-9dd2-108b2a38de82","resolution":{"observed_at":"2026-08-07T11:58:52.777998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.478394Z","title":"Audiogen: Textually guided audio generation","venue":null,"work_id":"2009e850-6d23-410d-bad8-8d114d8b93e6","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.542580Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:8fbcfc9ea2958e05fb043689667aae850465e70e1e790646f4b049c972fb68ce","observation_id":"8aef1af1-6c15-46ed-aec2-25318c405e47","resolution":{"observed_at":"2026-08-07T11:58:52.568527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.295195Z","title":"Voicebox: Text-guided multilingual universal speech generation at scale","venue":null,"work_id":"420ca62b-9149-43de-851c-f7aa5e71fec3","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.660333Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:fd3a1d9d3c18f762c7bfd2b70f58ac6c511ce897198f6a36284b10c21590319a","observation_id":"99c49b36-5fe5-49e4-9401-1637cbae224d","resolution":{"observed_at":"2026-08-07T11:58:52.376290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:52.069653Z","title":"Autoregressive image generation using residual quantization","venue":null,"work_id":"82324b97-3cdd-49da-9d4f-5ba80f2bc154","year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.826730Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:e731c1a40980485531f064a839849104b790ead2133f20db59acf5bf40ddf93a","observation_id":"c18203e5-cdca-4886-98ff-5af9c24c8ace","resolution":{"observed_at":"2026-08-07T11:58:52.151875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.848567Z","title":null,"venue":null,"work_id":"dfb3719f-24db-420f-8aad-629b3bf10367","year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:36.965426Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:d83a47a497d0a685c4a7de9e79575464eed6c17ec1440f842bc5c6309bfd484d","observation_id":"9cada8b0-4ef0-4bcf-917b-c8d5e96ebc34","resolution":{"observed_at":"2026-08-07T11:58:51.953854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.588671Z","title":null,"venue":null,"work_id":"2bcc2ab5-084f-494d-aaab-408be39e6191","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.080037Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:61b67e4a8be0fabfb1ed975f6f773562569847f4b62d560bee52296152423e46","observation_id":"51370c96-703f-4c0e-a66f-2859258b346f","resolution":{"observed_at":"2026-08-07T11:58:51.714687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11838","last_updated":"2024-11-01T14:45:36Z","snapshot_observed_at":"2026-07-06T18:32:23.999019Z","submitted_at":"2024-06-17T17:59:58Z","title":"Autoregressive Image Generation without Vector Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11838","snapshot_observed_at":"2026-08-07T11:58:37.209661Z","title":"Autoregressive image generation without vector quantization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.209661Z"},"links":{"cited_paper":"/paper/2406.11838","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:21bfd77c72e8195e8ee4e4efb2e6164b0c803c9b5a9bafb848db505d57d25726","observation_id":"7cd156e9-0f03-46af-80cd-2e2aa83ec3e0","resolution":{"observed_at":"2026-08-07T11:58:37.209661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:37.351317Z","title":"Evolutionary-scale prediction of atomic level protein structure with a language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.351317Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:263ad07750fb1b1dbe49465a6fe6e0e925615b0148e7cb346cc1ca442f328857","observation_id":"5b84a7b0-9973-4d37-b53d-67fb7fac0404","resolution":{"observed_at":"2026-08-07T11:58:37.351317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.284836Z","title":"P., Wang, W., and Plumbley, M","venue":null,"work_id":"cfac945d-666f-423b-8b3e-e7954aa90aac","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.486134Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:ffd2adeeef589640faf6d07a6c6833e08e3d95c2f53f1a8a73c201852156fb29","observation_id":"577737c9-fc2d-49ef-a029-31c956a9fa82","resolution":{"observed_at":"2026-08-07T11:58:51.422593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:51.048355Z","title":null,"venue":null,"work_id":"caf67851-8952-4ed6-b9c9-af65c486ec6c","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.574388Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:fa14585580e0696424f03504227736234e0930dcb9463d5fde4a75c7a369cb6d","observation_id":"fe9c039f-14ea-439d-a24e-e7beb456a9aa","resolution":{"observed_at":"2026-08-07T11:58:51.155503Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02622","last_updated":"2024-08-05T16:47:22Z","snapshot_observed_at":"2026-08-06T01:09:51.135247Z","submitted_at":"2024-08-05T16:47:22Z","title":"Language Model Can Listen While Speaking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02622","snapshot_observed_at":"2026-08-07T11:58:37.678428Z","title":"Language model can listen while speaking","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.678428Z"},"links":{"cited_paper":"/paper/2408.02622","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:8fb038d14f7b40a6e3c9e8934ce8986bacbe41aee64b16a995458bc2ab0cd920","observation_id":"d6e50ae6-0bd2-4ffe-89d5-8c9e59471355","resolution":{"observed_at":"2026-08-07T11:58:37.678428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.756766Z","title":"R., Subramanian, S., Mohr, B","venue":null,"work_id":"7805a20d-680b-409c-b7ac-898c16e767e3","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.804722Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:5cb7adc1ea102b8340b0038492ad3e1b774964953dbdc93fa2d236bd13c9814a","observation_id":"cb002973-bc68-4d7f-9ed1-0634d35b79a6","resolution":{"observed_at":"2026-08-07T11:58:50.887528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15255","last_updated":"2024-05-31T01:29:27Z","snapshot_observed_at":"2026-08-10T03:54:59.024080Z","submitted_at":"2023-05-24T15:39:43Z","title":"Spoken Question Answering and Speech Continuation Using Spectrogram-Powered LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15255","snapshot_observed_at":"2026-08-07T11:58:37.901004Z","title":"J., and Ramanovich, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.901004Z"},"links":{"cited_paper":"/paper/2305.15255","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:7f3022f3da7d1789cd6e19a139069e8011bdbd10fe8ce296df9524a2f5502a1f","observation_id":"75dea8af-703c-4fbc-ad56-db0becf0e6c3","resolution":{"observed_at":"2026-08-07T11:58:37.901004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.557060Z","title":"J., and Ramanovich, M","venue":null,"work_id":"460beb7e-438c-47c3-92f8-69177e204044","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:37.970581Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:c5132fe1432d60fe1de7516bb1b44e2746d5463b42e902310ee764f4171e0535","observation_id":"d6f5d090-d7d9-4f53-aac1-56f46012cc2c","resolution":{"observed_at":"2026-08-07T11:58:50.643978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.361935Z","title":"A., Kharitonov, E., Copet, J., Adi, Y., Hsu, W., Elkahky, A., Tomasello, P., Algayres, R., Sagot, B., Mohamed, A., and Dupoux, E","venue":null,"work_id":"cdfdf99d-4a21-484f-9a7e-b67ebca524cb","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:38.153472Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:bac235975caf6791c7205ef6b0dda680d9fe2189a185f4ca39fa532a91a5345d","observation_id":"b78aef10-d1ba-489a-aa7c-b115592f2056","resolution":{"observed_at":"2026-08-07T11:58:50.461537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05755","last_updated":"2024-10-18T19:18:41Z","snapshot_observed_at":"2026-08-08T16:34:49.867190Z","submitted_at":"2024-02-08T15:39:32Z","title":"Spirit LM: Interleaved Spoken and Written Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05755","snapshot_observed_at":"2026-08-07T11:58:38.270437Z","title":"A., Muller, B., Yu, B., Costa - juss \\` a , M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:38.270437Z"},"links":{"cited_paper":"/paper/2402.05755","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:d1e810a2bcfc9475e131fd2a22a0c98254214373cdbc1cfbe7844827c0490ad6","observation_id":"cc02d0d4-486c-4a1a-8ae7-bc2233c0cdcd","resolution":{"observed_at":"2026-08-07T11:58:38.270437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T11:58:38.403257Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:38.403257Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:47d7a0aee09cc6f4c01ae3c05d93f5d363905dbaf66ac2f6532399208e7f81d3","observation_id":"a8d38a4a-ce27-44c7-8e0b-09a04e20b094","resolution":{"observed_at":"2026-08-07T11:58:38.403257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:50.112273Z","title":null,"venue":null,"work_id":"1536d082-dc3c-4755-9d0f-b96d9c4b7ec8","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:38.537332Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:bcc3e8e4af5dc7d7f88c7089fa835f90f33663bcb4491971b66e6e5c25cd1bc6","observation_id":"df8a2e81-3e6c-49fc-9f93-86634a4510a2","resolution":{"observed_at":"2026-08-07T11:58:50.225321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.871597Z","title":"S., Constant, N., Raffel, C., and Callison - Burch, C","venue":null,"work_id":"e6381347-02c3-4d99-958a-ec8c6efadd1b","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:38.665681Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:2d351c2dbb887c24769dbc0d92dbc5a90b1362576ea756da03f2cd887615db5f","observation_id":"27299d89-e9bc-4255-8f4d-c4c55c3362ed","resolution":{"observed_at":"2026-08-07T11:58:49.986362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.587886Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"120d3e6c-a585-4cbf-8453-51357f426ac7","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:38.778622Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:ed7e4520fe17cf7eb42b2c1c078d14e17e0828c7ed1c2d1d658c4ef485c8fef3","observation_id":"f1cd5d8c-5ea6-4c03-856d-6bec1acbf740","resolution":{"observed_at":"2026-08-07T11:58:49.691407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.309988Z","title":"Efficiently scaling transformer inference","venue":null,"work_id":"4f3d5ca4-6a59-4dbe-ae96-b356d3905729","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:38.895582Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:5465c0d4553e60a20968d84cadc47e8838c00ff2ca48c851f6c0cf8f953da0d7","observation_id":"42664b0f-f8b7-4927-9566-7a989af13eb5","resolution":{"observed_at":"2026-08-07T11:58:49.426335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:49.061175Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., Krueger, G., and Sutskever, I","venue":null,"work_id":"cdfac903-4c32-4262-884f-65267089bb3d","year":2021},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.038734Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:a0aabc9186892dedefff82aa6be932586d54b6e9b5bbfa0db17fba40607b0a0f","observation_id":"b1d2de32-f4f6-489b-80c9-03afcfa5fba9","resolution":{"observed_at":"2026-08-07T11:58:49.176260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.816349Z","title":"W., Xu, T., Brockman, G., McLeavey, C., and Sutskever, I","venue":null,"work_id":"8fd3a8e2-b39a-4fdf-9fb7-bc77adc1b31d","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.145468Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:9d52ce275749192bc7895e76497180624e912df56152802617c22c6829f185b0","observation_id":"5bca6c3d-f9c0-4063-a333-af37c71766f6","resolution":{"observed_at":"2026-08-07T11:58:48.949112Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.563966Z","title":"The candor corpus: Insights from a large multimodal dataset of naturalistic conversation","venue":null,"work_id":"d69e756b-f653-4670-a0b9-595822353709","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.261569Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:58173e6369859fbdc706a20465d191752dbde3fd47aefc8d624f26bcd728f11b","observation_id":"c0a44f52-f6db-4094-9d7c-9c56bafaca96","resolution":{"observed_at":"2026-08-07T11:58:48.665985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-07T11:58:39.378115Z","title":"K., Asawaroengchai, C., Nguyen, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.378115Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:f541fb91d7db046ffaf6dfa2584dec99ba4883de7529d0db0cc9a917ba99d236","observation_id":"7f46aba9-72bc-4c48-9fe1-a15b3e8476f3","resolution":{"observed_at":"2026-08-07T11:58:39.378115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.325696Z","title":"A., Bekas, C., and Lee, A","venue":null,"work_id":"cf052d1e-3589-4eee-920a-6f70aee9e01b","year":2019},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.514408Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:604128de3650105475ddc3f3f7c829fc6bccd0f604c1e0938bafaa629a41087f","observation_id":"251546c9-78fa-4bdc-8f80-5870134b192c","resolution":{"observed_at":"2026-08-07T11:58:48.434728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:48.115952Z","title":"Naturalspeech 2: Latent diffusion models are natural and zero-shot speech and singing synthesizers","venue":null,"work_id":"65c8a2dd-03e5-40cc-9b52-1e397e39acd7","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.602846Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:400f766b216e8a6b6bc888395c896bea8a6613c3b7cea3d4217b225c3b413522","observation_id":"4be0a642-827c-40a8-89a8-0ade6f0c6960","resolution":{"observed_at":"2026-08-07T11:58:48.208784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.864491Z","title":"Graphaf: a flow-based autoregressive model for molecular graph generation","venue":null,"work_id":"222ce4b8-42cc-4515-9a57-3f612c109aac","year":2020},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.699015Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:4643ea5ef6d8aec232f0a9efda1c6e0f3ab607fb9eae84edc2494c82d2048d0f","observation_id":"4458dc50-c08b-4f9c-9dd6-67226ad76cde","resolution":{"observed_at":"2026-08-07T11:58:47.985599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.629760Z","title":"Vocos: Closing the gap between time-domain and fourier-based neural vocoders for high-quality audio synthesis","venue":null,"work_id":"11b371bb-eea8-4724-ac3c-ccecb68dc310","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.858181Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:3945aea71bd090c574816a33d5c5383a7fdd0cebddc4953ff89978e1aa68a225","observation_id":"76212d70-838c-4c6e-88c9-e8652cd920d8","resolution":{"observed_at":"2026-08-07T11:58:47.748924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:39.979331Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:39.979331Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:8e6d8af51a38a6c37feae9da1af77df049f88b1ed3dc7fff0f6b54317ec4b2bb","observation_id":"0a36bdfc-2d8a-4785-9013-a3753838569f","resolution":{"observed_at":"2026-08-07T11:58:39.979331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-07T11:58:40.100604Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.100604Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:27a7d188cb1a072b58569a9c4e4385d1771644f451b1d1b4253a51f3ff112f96","observation_id":"2f64fc8b-29c9-40b4-b397-55cc1f6fb24d","resolution":{"observed_at":"2026-08-07T11:58:40.100604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.387754Z","title":null,"venue":null,"work_id":"be30297d-ea05-4442-8cff-91cb5b012e8c","year":2014},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.217367Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:5ea19717987f5c66008ab7e2d587ad4a0d91ef65684868da02c65d70d3cfba26","observation_id":"c0eecd77-e1a7-4f59-aac7-d6522552d8cb","resolution":{"observed_at":"2026-08-07T11:58:47.513859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:47.140953Z","title":"SALMONN: towards generic hearing abilities for large language models","venue":null,"work_id":"5757e849-5d5f-4349-86aa-1c42056a6f9a","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.305666Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:8e0b91044da4f564a4bd6aa34508ec2b236c145a2762e358d8be8c9e193d4496","observation_id":"53eefead-cdb1-4489-aac4-d01aed5c75f5","resolution":{"observed_at":"2026-08-07T11:58:47.257441Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.913992Z","title":"C., Ture, F., and Lin, J","venue":null,"work_id":"d4431b41-6f21-40d3-a893-109b2ffb1474","year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.406006Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:701e3496170861d2106bf47015d0bd74ba59f5c13857df6073f0db88eee00a09","observation_id":"ef1f5c20-0cd7-4bb2-a8a8-2266bcff8bb3","resolution":{"observed_at":"2026-08-07T11:58:47.008096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-07T11:58:40.519186Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.519186Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:9a38caa7f11449be7c11f2dcbf66d01e3f74c4b0c6eda2f31dd15eb510c966b2","observation_id":"ead31476-df3c-467a-b001-a59e2152fb08","resolution":{"observed_at":"2026-08-07T11:58:40.519186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-07T11:58:40.614181Z","title":"S., Love, J., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.614181Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:9e301bce750a5c83f4e7855ba0fec8ccf6bfc8700244c02d023b9f4f60eb838d","observation_id":"a3628434-6402-4c47-b395-c74b301bb76f","resolution":{"observed_at":"2026-08-07T11:58:40.614181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02905","last_updated":"2024-06-10T17:59:07Z","snapshot_observed_at":"2026-07-06T17:55:16.774337Z","submitted_at":"2024-04-03T17:59:53Z","title":"Visual Autoregressive Modeling: Scalable Image Generation via Next-Scale Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02905","snapshot_observed_at":"2026-08-07T11:58:40.740546Z","title":"Visual autoregressive modeling: Scalable image generation via next-scale prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.740546Z"},"links":{"cited_paper":"/paper/2404.02905","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:673a71a6678ee487c13ef8a4dca918e0f915249e9a65ee1c42825f76a110b3ab","observation_id":"9b29c5b4-6da7-4c8d-952b-b502da87403a","resolution":{"observed_at":"2026-08-07T11:58:40.740546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.684760Z","title":"Neural discrete representation learning","venue":null,"work_id":"9b5bcc57-2440-4226-8860-542fbf1614b3","year":2017},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.872224Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:fc50e3abc2da0744da47aa445678bbbbc4229d060ecd31acce5c70661032726b","observation_id":"c6014061-9c6e-4f7c-8312-53d06888a81b","resolution":{"observed_at":"2026-08-07T11:58:46.790852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15594","last_updated":"2024-09-23T23:01:31Z","snapshot_observed_at":"2026-07-06T19:20:51.266758Z","submitted_at":"2024-09-23T23:01:31Z","title":"Beyond Turn-Based Interfaces: Synchronous LLMs as Full-Duplex Dialogue Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15594","snapshot_observed_at":"2026-08-07T11:58:40.965073Z","title":"N., Yu, B., Gong, H., and Gollakota, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:40.965073Z"},"links":{"cited_paper":"/paper/2409.15594","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:19339762caaa482a3c6e41529e3079e21843abee1f1e32b230431378219a2dcb","observation_id":"66c2f283-ffc8-4f9b-9b40-b25d6adb6bc8","resolution":{"observed_at":"2026-08-07T11:58:40.965073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16107","last_updated":"2023-05-25T14:39:47Z","snapshot_observed_at":"2026-08-06T20:26:21.695165Z","submitted_at":"2023-05-25T14:39:47Z","title":"VioLA: Unified Codec Language Models for Speech Recognition, Synthesis, and Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16107","snapshot_observed_at":"2026-08-07T11:58:41.093509Z","title":"Viola: Unified codec language models for speech recognition, synthesis, and translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.093509Z"},"links":{"cited_paper":"/paper/2305.16107","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:df1072fd5e9ce3150a34e012373ac9947b7ccf710c1b4f4d9c717b8609846351","observation_id":"4870119f-084f-4438-ab2b-8d42b446748a","resolution":{"observed_at":"2026-08-07T11:58:41.093509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.419925Z","title":"a ckstr \\","venue":null,"work_id":"1c613960-5ac5-4ba1-94b6-e0c61a88ecdb","year":2020},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.201189Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:06fb1a2044758cb4e8b0301d3203ffce8331dd900a033e248a506a37db498159","observation_id":"30b2b3e3-7e84-42ff-a520-9b7525c41262","resolution":{"observed_at":"2026-08-07T11:58:46.543674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02207","last_updated":"2023-08-25T16:10:18Z","snapshot_observed_at":"2026-08-09T04:30:56.872401Z","submitted_at":"2023-06-03T22:35:27Z","title":"SpeechGen: Unlocking the Generative Power of Speech Language Models with Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02207","snapshot_observed_at":"2026-08-07T11:58:41.346118Z","title":"Speechgen: Unlocking the generative power of speech language models with prompts","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.346118Z"},"links":{"cited_paper":"/paper/2306.02207","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:6a70448287cd227e280d0d9dcaa800a13874165f947721bbfa53e041e24e95b6","observation_id":"feb87d25-b143-43c8-b5d0-e1124abada8c","resolution":{"observed_at":"2026-08-07T11:58:41.346118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:46.056462Z","title":"Next-gpt: Any-to-any multimodal LLM","venue":null,"work_id":"6dd90848-3adf-4743-9c9b-232794f2842f","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.460790Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:724a811d6fed5b9afcb155ec447f3f33e3ecd5e305062c6f2914ac4d817bdb69","observation_id":"7218aea1-0087-49b5-831f-f71b3e529ccc","resolution":{"observed_at":"2026-08-07T11:58:46.249196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.789683Z","title":"J., Wang, W., Lin, K","venue":null,"work_id":"f55bc1d4-33a0-41b2-8d71-1fa92d956a8e","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.609319Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:9759963cb08b8457de332a3e1b0b6e6e74a38ce7598982068865dc1fdc279b34","observation_id":"682e39be-d364-4755-8a56-0b5f53469a1f","resolution":{"observed_at":"2026-08-07T11:58:45.929927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-07T11:58:41.742682Z","title":"and Wu, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.742682Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:bb60ab3260f7287e267dfcf1624f02fe2e765ba75defe4bb19e34646b1f7666a","observation_id":"b034d105-1558-44c9-8ac2-b0fa4e255f43","resolution":{"observed_at":"2026-08-07T11:58:41.742682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.507876Z","title":"Diffsound: Discrete diffusion model for text-to-sound generation","venue":null,"work_id":"99a8d5e0-dfe6-40bb-a2ab-2cfc93b3984b","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:41.844624Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:84941cb35cce4c3cc0a7f99392eec6de9bd9d87007dabbdd9c41014ef97d7ce6","observation_id":"5c7c0083-2de3-4e05-9bd1-c91a2c79b57a","resolution":{"observed_at":"2026-08-07T11:58:45.640110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:45.254497Z","title":"Instructtts: Modelling expressive TTS in discrete latent space with natural language style prompt","venue":null,"work_id":"a690718e-fd46-4012-a6f0-2d3c6fe0a0cf","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.002641Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:68bc4361bd52b3d58109fd9a66875454761ba2e6ae12036347b16c47ad9ca828","observation_id":"e3e54503-2c5e-4ae0-946b-8f85d0a409e8","resolution":{"observed_at":"2026-08-07T11:58:45.384003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.972626Z","title":"L., and Leskovec, J","venue":null,"work_id":"ca83de79-de0c-4e54-ba7e-92239a2e7fc0","year":2018},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.157901Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:5ebcc21a168ada01716d3df1e51e2643e53111740c81b6917a18723fbd2386c1","observation_id":"3596fa4e-db4f-4031-b596-9e8ae20c528a","resolution":{"observed_at":"2026-08-07T11:58:45.100642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.710775Z","title":"Soundstream: An end-to-end neural audio codec","venue":null,"work_id":"ab60c991-de54-4119-a684-a3e79de1706a","year":2022},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.301302Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:8b444faca2c160c33d0455e3fb9f318905b4b1b4690f8500bfe51528c84bcdc1","observation_id":"4e621224-e9df-44e0-abb1-1c2d5ea4649a","resolution":{"observed_at":"2026-08-07T11:58:44.854884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.466478Z","title":"Speechgpt: Empowering large language models with intrinsic cross-modal conversational abilities","venue":null,"work_id":"e9cdf232-dfb3-43f3-9eb0-710c76f6c966","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.412141Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:324edf76361de6bc3d5c6ac62746d550f832803e7562d514dd352925f4314f14","observation_id":"0ce57509-82bb-4136-938e-900155ee3eae","resolution":{"observed_at":"2026-08-07T11:58:44.569687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.01037","last_updated":"2023-09-25T01:20:23Z","snapshot_observed_at":"2026-08-04T01:36:29.191456Z","submitted_at":"2023-03-02T07:47:18Z","title":"Google USM: Scaling Automatic Speech Recognition Beyond 100 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.01037","snapshot_observed_at":"2026-08-07T11:58:42.528594Z","title":"S., Haghani, P., Riesa, J., Perng, G., Soltau, H., Strohman, T., Ramabhadran, B., Sainath, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.528594Z"},"links":{"cited_paper":"/paper/2303.01037","citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:956df1cd2e460b4c38fc01d87acfbc5cf017557100a6e4d77176f536df9dfecb","observation_id":"f1ef71db-56d8-4cd7-bc49-777c03c8b47a","resolution":{"observed_at":"2026-08-07T11:58:42.528594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:44.148940Z","title":"Transfusion: Predict the next token and diffuse images with one multi-modal model, 2024","venue":null,"work_id":"ba1dbc9f-e6bd-45de-96c7-45693a42862c","year":2024},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.650407Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:f47e19e74d9a601894f6f734b2ef1b3deb5e653c3054532baa9a4d212a1656b2","observation_id":"4a439b41-1ec4-43d5-8231-6bb96448f359","resolution":{"observed_at":"2026-08-07T11:58:44.289109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:43.881431Z","title":"Mmspeech: Multi-modal multi-task encoder-decoder pre-training for speech recognition","venue":null,"work_id":"eb942d7b-0a8e-4bcb-a2ee-dd74651e1c7d","year":2023},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.812383Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:44cd044d675f0a4903f9185457c5b5f5f700339ad1d3d6c3a7e1c1d35acea414","observation_id":"997ba1d2-2a75-48b7-84e9-318ae13e46b4","resolution":{"observed_at":"2026-08-07T11:58:43.964694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:58:42.951304Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction","version":4},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-07T11:58:42.951304Z"},"links":{"citing_paper":"/paper/2506.00975"},"observation_digest":"sha256:04afce6159cb09b57b44ce3c07b122993717130fd0d32dca66a8ff31420f341a","observation_id":"69a63b19-1c08-4ca1-928d-38e2304b0bab","resolution":{"observed_at":"2026-08-07T11:58:42.951304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00975","last_updated":"2025-06-11T10:45:04Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:23:21.312419Z","submitted_at":"2025-06-01T12:01:40Z","title":"NTPP: Generative Speech Language Modeling for Dual-Channel Spoken Dialogue via Next-Token-Pair Prediction"},"reference_resolution":{"displayed":85,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":37,"verified_exact":0,"verified_fuzzy":47},"total_outbound_references":85},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 85 of 85 outbound references and 2 inbound Pith citation observations for arXiv:2506.00975."}