{"as_of":"2026-08-15T02:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:74d634ddb190ef5b548e9931444bdc5e2429d28c422f25c3edfa8906faa74d73","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:51:44.257192Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T22:51:39.700059Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15537","snapshot_observed_at":"2026-08-02T22:51:39.700059Z","title":"Standard benchmarks have been developed that assess how well these models capture lexical, syntactic, and semantic properties [15, 16]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.700059Z"},"links":{"cited_paper":"/paper/2602.15537","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:2e7e8bea5119be28f4514bda2267b4ec7a802f5573f33a71fb60b0e9395ccf68","observation_id":"9b5cc2af-be8c-460a-b457-bc1102c3223c","resolution":{"observed_at":"2026-08-02T22:51:39.700059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2602.15537/citation-record","integrity":"/paper/2602.15537/integrity","json":"/paper/2602.15537/citation-record.json","paper":"/paper/2602.15537"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.638708Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.638708Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:d68ae623e965314266b6ca820a90a615b7aaae828001043c76ae843532630996","observation_id":"5a2724dc-84b1-4933-b7fe-c1c7311ad345","resolution":{"observed_at":"2026-08-02T22:51:39.638708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15537","snapshot_observed_at":"2026-08-02T22:51:39.700059Z","title":"Standard benchmarks have been developed that assess how well these models capture lexical, syntactic, and semantic properties [15, 16]","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.700059Z"},"links":{"cited_paper":"/paper/2602.15537","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:2e7e8bea5119be28f4514bda2267b4ec7a802f5573f33a71fb60b0e9395ccf68","observation_id":"9b5cc2af-be8c-460a-b457-bc1102c3223c","resolution":{"observed_at":"2026-08-02T22:51:39.700059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.771347Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.771347Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:14cf60a1354dd6bc6b6060d5467734f70325939dbd95f7b95f4d210df0eef5e7","observation_id":"92db26e8-beb5-42a4-9182-7b9685a6fda5","resolution":{"observed_at":"2026-08-02T22:51:39.771347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.844483Z","title":"manufacturer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.844483Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:b663bb177d05a0badf1f61e3ff6c2ff7b48ea12aa37e780ca5b085497548fc95","observation_id":"ec4fd5b6-ea07-43fc-ba21-10a347b6c0d8","resolution":{"observed_at":"2026-08-02T22:51:39.844483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:39.941788Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:39.941788Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:bb9400e0fc57695408e9d4e428f2cd45a7019cf47914be5782d67a6990a3150e","observation_id":"e05fd215-dba4-4471-88b0-8974fa6a0e51","resolution":{"observed_at":"2026-08-02T22:51:39.941788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.096092Z","title":"By leveraging feature norms from a frozen SSL model (WavLM Large), ZeroSyl eliminates the complex multi-stage methods required by prior state-of-the-art syllabic tokenizers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.096092Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:05a394c8732651b5a800b82850fbe8f1ccf6fe87548852acffa2dbc251a61dbe","observation_id":"3a30aede-289b-4651-a82b-34ac4138aaf9","resolution":{"observed_at":"2026-08-02T22:51:40.096092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.232329Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.232329Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:cee27abcf138f47b72492b2dbe035c45597cd242ef423272cb45e08def955f2c","observation_id":"b11c5d75-e945-452c-a0e7-673b2a08cbfb","resolution":{"observed_at":"2026-08-02T22:51:40.232329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.378773Z","title":"Self-Supervised Speech Representation Learning: A Review,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.378773Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:deae6094efd73ce0f083a532a61a3fbba7a6b92bf7dab8caeaffab9ad40f4ebd","observation_id":"569f43d8-3730-4256-8f51-f15529dc1e9a","resolution":{"observed_at":"2026-08-02T22:51:40.378773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.439700Z","title":"Self-Supervised Lan- guage Learning From Raw Audio: Lessons From the Zero Re- source Speech Challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.439700Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:1649f9473c4a06893fee25b31e8123a0ac5169a51fb35f8c7b4723f5dc4df1da","observation_id":"908e30d1-0baf-4d96-ae02-b90bea9e758b","resolution":{"observed_at":"2026-08-02T22:51:40.439700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.575509Z","title":"On Generative Spoken Language Modeling from Raw Audio,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.575509Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:45c1f66f5b23e2d47878d2d880525358f843370f599f52b3727626225a1c4362","observation_id":"ddc974b0-e493-466c-80e5-82770f1dcff9","resolution":{"observed_at":"2026-08-02T22:51:40.575509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.729931Z","title":"AudioLM: A Language Modeling Approach to Audio Generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.729931Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:25f2a037f9fd64ae8c69b550a8a63b7e53580fb016017c7ba504fd56bd554376","observation_id":"32cccbc6-6e68-4d98-a2c4-657dc92d64eb","resolution":{"observed_at":"2026-08-02T22:51:40.729931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:40.824151Z","title":"w2v-BERT: Combining Contrastive Learning and Masked Language Modeling for Self-Supervised Speech Pre-Training,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:40.824151Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:9afa1e32789c62523c7388d27d96d15db17bac6b9b9dd4a613a9a22791e36733","observation_id":"d607a998-43ce-4bd6-b252-28fd86e25d33","resolution":{"observed_at":"2026-08-02T22:51:40.824151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.017062Z","title":"Scaling Properties of Speech Language Models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.017062Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:d9ed743b15283f7241bacab80701c1a4cf44ca56930994382d3f2e65f6932f22","observation_id":"45d80510-7194-4ff1-ba8f-eacc82b5147e","resolution":{"observed_at":"2026-08-02T22:51:41.017062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.124518Z","title":"SpidR: Learning Fast and Stable Linguistic Units for Spoken Language Models Without Supervision,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.124518Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:31a0ff8f9e178f2e8260646cb59b8ed5c0874147c9ca33f7b6c0c52c1e4cf984","observation_id":"71cc6aa4-dd04-4e29-b051-ca84f09a0588","resolution":{"observed_at":"2026-08-02T22:51:41.124518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.236292Z","title":"Generative Spoken Language Model Based on Continuous Word-Sized Audio Tokens,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.236292Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:c564d8cf00d95ac36b8b43cb8de68a31c3151b085b292d28fbe93b25a57344d8","observation_id":"634142eb-3115-4a54-baff-2656e5238e47","resolution":{"observed_at":"2026-08-02T22:51:41.236292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.325306Z","title":"Spoken Language Modeling with Duration-Penalized Self-Supervised Units,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.325306Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:85b4647329e5827d37789dc5a3006138475d44425bad1e670ed65e0a82890438","observation_id":"3087aa99-0c39-492e-a3c1-32453587d80c","resolution":{"observed_at":"2026-08-02T22:51:41.325306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.513349Z","title":"Sylber: Syllabic Embedding Repre- sentation of Speech from Raw Audio,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.513349Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:b59e6e1069ec736de54dcd0632b513cddaced96d394f8dbc876aa47ebd818528","observation_id":"74d9ad02-41cb-49ec-a1f3-e0048a743bc9","resolution":{"observed_at":"2026-08-02T22:51:41.513349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.620796Z","title":"SyllableLM: Learning Coarse Semantic Units for Speech Language Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.620796Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:e3bf757a20e1e897a8b77215c7f301176783b0b85cb7f539b67ace914cd1a74d","observation_id":"cfa2ee3e-09a2-42c7-8e80-23e1283fb2cd","resolution":{"observed_at":"2026-08-02T22:51:41.620796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.743514Z","title":"WavLM: Large-Scale Self- Supervised Pre-Training for Full Stack Speech Processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.743514Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:9ae6e7420756dd1fb65d9a7677c4f4a7c275adf64300c76572d8439439385401","observation_id":"36bf79a9-56e0-4c2e-a5e8-5c98b6828845","resolution":{"observed_at":"2026-08-02T22:51:41.743514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-02T22:51:41.884430Z","title":"OPT: Open Pre-trained Transformer Language Models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.884430Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:b6d66b3e70fee610ea284edd88947f3120af9e156ab107bbc46d76774f2e17c8","observation_id":"80dcf8b2-1ed9-4bd5-9ff9-e2271e83f1b9","resolution":{"observed_at":"2026-08-02T22:51:41.884430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:41.994416Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Sur- vey,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:41.994416Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:631385ee899f0cdb27aee84f1de624c8f131cb72c1a455d279b4f2afedcc27d8","observation_id":"c5244a5d-c6a9-4d7d-bf7f-20bab8e9abe9","resolution":{"observed_at":"2026-08-02T22:51:41.994416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.141907Z","title":"The Zero Resource Speech Challenge 2021: Spoken language modelling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.141907Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:42dc77e1e759d837aa6c0a1c2320a6889cc0fe3802ac8e488f7f39229a1620da","observation_id":"b6389fb6-729c-4ed1-898d-2643d3c68e04","resolution":{"observed_at":"2026-08-02T22:51:42.141907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.260479Z","title":"Textually Pretrained Speech Language Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.260479Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:1da0a21c511ef6976adbdef0d72a3ae3940a904101ade0d030341ce9ed41f861","observation_id":"80109e63-1e86-4912-b113-114f201ff291","resolution":{"observed_at":"2026-08-02T22:51:42.260479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.457422Z","title":"SD-HuBERT: Sentence-Level Self-Distillation In- duces Syllabic Organization in HuBERT,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.457422Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:557ab75a1cd3a29c9cb5a42b1fb87a7c79c497986735fb4d5afdc8f7aefc124a","observation_id":"dbd0c015-949c-492d-8beb-dfef5a38e36c","resolution":{"observed_at":"2026-08-02T22:51:42.457422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.548204Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.548204Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:f9f5f8789c2d1d6780ae5d68a8881fe70657fdc63df4b4217228fd4f9ad7a828","observation_id":"20a65383-33bf-49b6-8e53-45620eee2b40","resolution":{"observed_at":"2026-08-02T22:51:42.548204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.654043Z","title":"What Do Self- Supervised Speech Models Know About Words?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.654043Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:2c3e3d05f1483e3bea9c9a87956a342d1d8ba27fe815ab7888a07637c5ed4c40","observation_id":"5335851a-71ee-4d93-a9f2-de01830d88dd","resolution":{"observed_at":"2026-08-02T22:51:42.654043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.771487Z","title":"A Computational Model for Unsuper- vised Word Discovery,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.771487Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:e7e1e7438defae3373158960c10520ea7a943629c2cb6b3dfa5d2aeb5bf2c4be","observation_id":"b0c58d39-254d-4147-a4f8-6c619a44f3d5","resolution":{"observed_at":"2026-08-02T22:51:42.771487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:42.912427Z","title":"Unsupervised Word Discovery: Boundary Detection with Clustering vs. Dynamic Pro- gramming,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:42.912427Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:52c4268bbceb261d2079bd2a82ff96b1b15326b277e9d2638363f5cd75bb9eb4","observation_id":"41072480-7c04-4fc0-8890-61b690f5aa2b","resolution":{"observed_at":"2026-08-02T22:51:42.912427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.19204","last_updated":"2025-07-28T14:43:23Z","snapshot_observed_at":"2026-08-13T08:55:23.602846Z","submitted_at":"2025-07-25T12:19:16Z","title":"Should Top-Down Clustering Affect Boundaries in Unsupervised Word Discovery?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.19204","snapshot_observed_at":"2026-08-02T22:51:43.039657Z","title":"Should Top-Down Clustering Affect Boundaries in Unsupervised Word Discovery?","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.039657Z"},"links":{"cited_paper":"/paper/2507.19204","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:646dad04472dc315c27846f5b0f9329cc8498619527e78c783f012d1109ad33a","observation_id":"8ec74310-3cdb-4aec-b1cb-b84f63f40ed8","resolution":{"observed_at":"2026-08-02T22:51:43.039657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.152010Z","title":"Comparative layer-wise analysis of self-supervised speech models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.152010Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:74aadb5643009ee51eb44b05e2f7a95c12a37338290a64e0b751f5d926013b64","observation_id":"a46740af-3a65-4d40-a6a9-919448b5c92f","resolution":{"observed_at":"2026-08-02T22:51:43.152010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.310477Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.310477Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:d7c82854ed823a26fb038be5bb849ced6bf7cee1c6777e644a6a2d4760017379","observation_id":"58bab7bd-af8c-40c8-84e2-08472bda94e7","resolution":{"observed_at":"2026-08-02T22:51:43.310477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.507048Z","title":"The Faiss library,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.507048Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:86b13c7da2d8824fb5ca1678d45a850302e9554b7f84c2009da31af39f67ed00","observation_id":"bcbe4188-94dd-482b-90cd-8be818211d98","resolution":{"observed_at":"2026-08-02T22:51:43.507048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.697544Z","title":"Libri-Light: A Benchmark for ASR with Limited or No Supervi- sion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.697544Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:8766c50090bf6ff865a573ac88e8859748be05bc982faea7c1ee9d8daa506242","observation_id":"644889f1-3634-4fff-8eb7-eddb31f40b7b","resolution":{"observed_at":"2026-08-02T22:51:43.697544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.800836Z","title":"Montreal Forced Aligner: Trainable Text-Speech Alignment Using Kaldi,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.800836Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:7450eeedffc2fa6211c4623182f8e99dba0418d48bdec84e3a1f866400da5470","observation_id":"7bc85b8e-b30e-43db-ab9e-836171c13406","resolution":{"observed_at":"2026-08-02T22:51:43.800836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:43.899621Z","title":"Python module for syllabifying English ARPABET transcriptions,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.899621Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:5928b43ac912b6a60080838abbd5c753efbcea50d5ce45c3ea3c8bfa9333be98","observation_id":"3023e730-9ab6-4b94-a863-8880220d9770","resolution":{"observed_at":"2026-08-02T22:51:43.899621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:44.025746Z","title":"An improved speech segmentation quality measure: the R-value,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:44.025746Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:99741c309d474ac8de48bace8fc675956f63a89b9b1ec22b6aedc06fd12e2bab","observation_id":"e3e5fd01-f8f5-4690-bde1-31c4a5fcdb8a","resolution":{"observed_at":"2026-08-02T22:51:44.025746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T22:51:44.118442Z","title":"On the robust automatic segmentation of spontaneous speech,","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:44.118442Z"},"links":{"citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:38b80f65bbe0c3cf10dc3eebf00a78cc3b674e7c1b959c082682958ae012564b","observation_id":"3a8a7031-b2e1-449b-b163-449ae689dd00","resolution":{"observed_at":"2026-08-02T22:51:44.118442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03555","last_updated":"2022-10-25T20:27:17Z","snapshot_observed_at":"2026-08-07T06:55:45.110734Z","submitted_at":"2022-02-07T22:52:11Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03555","snapshot_observed_at":"2026-08-02T22:51:44.257192Z","title":"data2vec: A General Framework for Self-supervised Learning in Speech, Vision and Language,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:44.257192Z"},"links":{"cited_paper":"/paper/2202.03555","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:64abdcf3cf99ac7c3b9d259349c51f1df06d41578b8af2391b4c815e092d9e89","observation_id":"0905b55d-e95d-4f7f-be9b-717b67a9e59b","resolution":{"observed_at":"2026-08-02T22:51:44.257192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08281","last_updated":"2025-10-23T09:36:08Z","snapshot_observed_at":"2026-07-31T05:45:37.385210Z","submitted_at":"2024-01-16T11:12:36Z","title":"The Faiss library","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08281","snapshot_observed_at":"2026-08-02T22:51:43.594317Z","title":"Available: https://arxiv.org/abs/2401.08281","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T22:51:43.594317Z"},"links":{"cited_paper":"/paper/2401.08281","citing_paper":"/paper/2602.15537"},"observation_digest":"sha256:d0162db74a0a98877ff951522c524586468f7a32a51c749f020d0f73b1bd92d6","observation_id":"1bd3368c-f93f-452e-bbe2-67be22b86ee2","resolution":{"observed_at":"2026-08-02T22:51:43.594317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.15537","last_updated":"2026-06-16T15:15:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T13:40:09.131217Z","submitted_at":"2026-02-17T12:38:45Z","title":"ZeroSyl: Simple Zero-Resource Syllable Tokenization for Spoken Language Modeling"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2602.15537."}