{"as_of":"2026-08-09T17:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:658b51a395bbd58564d02cc43cb65b1309d36c74cfd460a2ad836e18c25958ba","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":3,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":3,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:56:54.401206Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T00:52:04.433992Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16102","last_updated":"2025-08-09T10:01:51Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T17:43:50Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16102","snapshot_observed_at":"2026-08-07T14:56:54.401206Z","title":"InProceedings of the 22nd Annual Workshop of the Australasian Language Technology Association","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16983","last_updated":"2025-05-29T13:22:18Z","snapshot_observed_at":"2026-08-08T04:05:01.395737Z","submitted_at":"2025-05-22T17:53:28Z","title":"LLM as Effective Streaming Processor: Bridging Streaming-Batch Mismatches with Group Position Encoding","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:56:54.401206Z"},"links":{"cited_paper":"/paper/2412.16102","citing_paper":"/paper/2505.16983"},"observation_digest":"sha256:9ade50107f92d174e568ed4eaf2ac599da385003cdebb0f94ffba1017b32b705","observation_id":"9e006ab3-a34a-40c9-8419-e79ca9847a14","resolution":{"observed_at":"2026-08-07T14:56:54.401206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16102","last_updated":"2025-08-09T10:01:51Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T17:43:50Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16102","snapshot_observed_at":"2026-08-07T14:22:30.842860Z","title":"Interleaved speech-text language models are simple streaming text to speech synthesizers,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19206","last_updated":"2025-05-25T16:11:10Z","snapshot_observed_at":"2026-08-09T12:05:27.001330Z","submitted_at":"2025-05-25T16:11:10Z","title":"SpeakStream: Streaming Text-to-Speech with Interleaved Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:22:30.842860Z"},"links":{"cited_paper":"/paper/2412.16102","citing_paper":"/paper/2505.19206"},"observation_digest":"sha256:d7a1a379ef7feac43cae9f645fe0159e21dc2216a27f670eb32caa8aa6962f42","observation_id":"b18d51a4-4449-433f-b0d8-7f587de7c478","resolution":{"observed_at":"2026-08-07T14:22:30.842860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16102","last_updated":"2025-08-09T10:01:51Z","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T17:43:50Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","version":3},"cited_work":{"arxiv_id":"2412.16102","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16102","snapshot_observed_at":"2026-08-07T00:52:04.433992Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis","venue":"eess.AS","work_id":"ebc6ca5e-7b48-4dcf-9ddd-d8573306b39d","year":2024},"citing_paper":{"arxiv_id":"2506.12570","last_updated":"2025-06-14T16:53:39Z","snapshot_observed_at":"2026-08-09T04:18:05.919282Z","submitted_at":"2025-06-14T16:53:39Z","title":"StreamMel: Real-Time Zero-shot Text-to-Speech via Interleaved Continuous Autoregressive Modeling","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T00:52:02.441261Z"},"links":{"cited_paper":"/paper/2412.16102","citing_paper":"/paper/2506.12570"},"observation_digest":"sha256:e645f904717a4849c188364df1b2d3f1d08143f84ae4ed141530723b81becde0","observation_id":"2f204fc6-c3d9-4824-bc3b-a67581bde4cc","resolution":{"observed_at":"2026-08-07T00:52:04.503082Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16102/citation-record","integrity":"/paper/2412.16102/integrity","json":"/paper/2412.16102/citation-record.json","paper":"/paper/2412.16102"},"outbound":[],"paper":{"arxiv_id":"2412.16102","last_updated":"2025-08-09T10:01:51Z","latest_version":3,"primary_category":"eess.AS","snapshot_observed_at":"2026-07-06T20:11:06.248415Z","submitted_at":"2024-12-20T17:43:50Z","title":"Interleaved Speech-Text Language Models for Simple Streaming Text-to-Speech Synthesis"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 3 inbound Pith citation observations for arXiv:2412.16102."}