{"as_of":"2026-08-09T14:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c381b93159705afab4171195842af359587f26ea5fe10f71afac4a4ec91a7bde","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T20:01:37.569548Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T20:01:37.569548Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:59:45.473466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.29042","snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Conse- quently, it remains unclear to what extent data scale, model ar- chitecture, and training objective contribute to multilingual PR performance","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"cited_paper":"/paper/2603.29042","citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:e4f574d62272ae78df2fec3fec8d7b2d2a3ba8bc4b884bb1f323bb2458b4e3de","observation_id":"4d827e40-68c4-4eec-8899-ff04ef42edf2","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"cited_work":{"arxiv_id":"2603.29042","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2603.29042","snapshot_observed_at":"2026-07-14T02:20:27.128615Z","title":"Mortensen","venue":null,"work_id":"9d296961-d001-4847-8f73-e0b635b34bf0","year":2026},"citing_paper":{"arxiv_id":"2606.22824","last_updated":"2026-06-22T04:06:28Z","snapshot_observed_at":"2026-08-09T13:44:55.025561Z","submitted_at":"2026-06-22T04:06:28Z","title":"BranchShine: Compact Raw-Audio-to-IPA Transcription with a RoPE E-Branchformer Encoder","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-26T09:16:32.538268Z"},"links":{"cited_paper":"/paper/2603.29042","citing_paper":"/paper/2606.22824"},"observation_digest":"sha256:61a4656702c5e3622e064c3d733832f8907ba7f51a590c380bad827b2231d752","observation_id":"22b71f50-3a12-4996-b463-0d13a99c1167","resolution":{"observed_at":"2026-07-14T02:20:27.128615Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2603.29042/citation-record","integrity":"/paper/2603.29042/integrity","json":"/paper/2603.29042/citation-record.json","paper":"/paper/2603.29042"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"PR is also heav- ily employed in atypical speech assessment [7, 8], computer- assisted language learning [9–11] and linguistic fieldwork [12– 14]","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:e46dd34b97001b313f592491edfc8ded09ce822f0b5230aefab052544d6263be","observation_id":"5e3e4d15-2ed5-4b48-be69-1aeadf236891","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.29042","snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Conse- quently, it remains unclear to what extent data scale, model ar- chitecture, and training objective contribute to multilingual PR performance","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"cited_paper":"/paper/2603.29042","citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:e4f574d62272ae78df2fec3fec8d7b2d2a3ba8bc4b884bb1f323bb2458b4e3de","observation_id":"4d827e40-68c4-4eec-8899-ff04ef42edf2","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"We evaluate the model with PRiSM [21], a benchmark for PR systems, and report the results in Table 1","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:4cfe72538143468e7ae9a695e435b40ba027f43f1671f927065a0277ed3c9941","observation_id":"7a26b9f5-882a-47ff-9454-0c3c00062bbd","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"2) MMS [45] (S3, S4), pretrained on 1k languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:118d16a7d9ce26cdbe1c30f0dd70f629491f5e10bde1e1a97bded480d517612d","observation_id":"cf4ec5b7-ff91-4ea7-b5d9-bcc1d3e4172d","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"We analyze the role of SSL in cross-lingual transfer via comparison with E-Branchformer (C5) which differs only in initialization to our recipe (C3)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:30a13bd71be552eb39bfa29f49c75202ead65029b6ef6ebab7f5e81d40e6458e","observation_id":"fbfac1f3-5548-49a9-947f-71c7a8ec9060","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:f55fb57b06bc99c511f26c9052d42a920acdef9842b89eb144ee1c61ee80a3a6","observation_id":"08006426-522c-44c7-8b1c-c3d75feaed4f","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"All outputs were reviewed and validated by the authors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:9b42b0417f39440ea3a9215f1b36bd9102300626fc4bc202caebe9367bf64213","observation_id":"40a6a27c-3b84-4797-a7d5-8b6a7d50d185","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"The Zero Resource Speech Challenge 2019: TTS Without T,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:691808c190f4459bb98b4439fd6d78246d9cecccbf7e429f55061b03aef0cb0d","observation_id":"cde200aa-9a29-4b6e-af81-f78b820cb78a","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"The Zero Resource Speech Challenge 2021: Spoken Language Mod- elling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:3790b18dc285f469aa803ae190742c1e95c36c92c655b526f40a4d458597cb4d","observation_id":"98cb50b9-0b5c-47a8-917f-ce0f41d639e7","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Self-supervised lan- guage learning from raw audio: Lessons from the zero resource speech challenge,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:ba2b42369557a92d92bfaca59a98b2b5663b4abfd00e0a2fdd35690e5d877a7f","observation_id":"9b77b322-c873-41da-93f7-354836801422","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"That Sounds Familiar: An Analysis of Phonetic Representations Transfer Across Lan- guages,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:8116ffe9f116a7835397e905674185210a1344da2afcb4dbe88d939044e1a506","observation_id":"ed909d16-6421-49e8-851c-5e8174e9fae0","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Multilingual and crosslin- gual speech recognition using phonological-vector based phone embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:26a8789499a20ec9b4c5412500ac79bb3719e64f0d7de6a10b45ec2716e77ac0","observation_id":"f66df82a-d1cb-4cc3-bc4a-712c3f52409c","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Differentiable Allophone Graphs for Language-Universal Speech Recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:17027592ab262668e755a37b31f66f1d7f43ff9ade97a12cd2ae81b5e8585caf","observation_id":"3102040b-05a6-4f43-b2aa-4c02e4a9c4d3","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Learner training for phonetic transcription of typical and/or disordered speech: A scoping review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:2e9d4a002d3b38c4ce975133a9659858b3a960fdea19a7180591529be7c95b0b","observation_id":"fef92280-94fd-4f94-9424-34bf81d9619b","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:7e36aeebd4bab7505b0bf9d42167c7df0b4a62aea3f8f89c80919710e56788dc","observation_id":"319a771b-fd92-40d7-87bb-36fe0cbdca01","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Advances in phone-based modeling for automatic accent classification,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:5175e7bdde6b15132574c97c6ee85f445a244de06593e121bae5cc272d308fc2","observation_id":"f536f4ca-cdc9-4569-9475-4ef9eb585f35","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"EduSpeak®: A speech recognition and pronunciation scoring toolkit for computer-aided language learning applications,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:188ba3fbf9b38eb596a213bb5ebb83c14918fddc0ca15c21b8eb7257e04d657e","observation_id":"1230ea7e-42f6-4be6-a27c-d4efb840656c","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Automatic Pronuncia- tion Assessment-A Review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:9ee27075ab9365ae15d4989f94fdfe0233cdf9f14828266d0af0e1d38536cb81","observation_id":"4b312190-bded-4466-bdf5-c3f558d70db5","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:2f311683c8ee52640f0e712beaaac086fac23915e48d07c0aa79475dcf1ee84e","observation_id":"1c4ea5be-452a-4cf8-b6c6-055c523106c2","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"The UCLA Phonetics Lab Archive,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:37632a1f2e2b7e102765013648317a13bf29c91f5b56582affb616cf0261de06","observation_id":"2dd708de-a768-41e5-b91a-d9c1601b3c5d","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Tusom2021: A Phonetically Transcribed Speech Dataset from an Endangered Language for Universal Phone Recognition Experiments,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:a723f53f945bbdeb32b1ec0f84df16d0f30e91faf002b89fe0404d231cce5790","observation_id":"a59e2e89-70a5-4732-a28b-59c49c82a164","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Automatic recognition of phonetic patterns in speech,","venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:dc1c8dc872f966a3cda6f746981859d254400bda743da856f6814d7c3692a7c8","observation_id":"e987bf23-5325-4995-a9d3-7f2e9e32d968","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Acoustic phonetic approach for speech recognition: A review,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:8c905c5491b6ef7894ca083af95ad9faafb724e701288d452b4f63b876de0a78","observation_id":"a48396fc-2177-4c2e-b1e8-567ef2b81b3a","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"HuPER: A Human-Inspired Framework for Phonetic Perception,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:7511d198ede411cb479ec2835e6e530536f3521b15edcd65d65d08e189fa6b84","observation_id":"9612e29a-00a5-4a4b-86b2-6391b93d3fea","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"XLSR Inclusive English Speech-to-IPA,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:f6fea9c44e421ba13a3673159b767023f7cbccd9fcd9f74ba5d5decd87010b14","observation_id":"05b3cfc7-c000-4786-919c-1b63ea88a38d","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"ZIPA: A family of efficient models for multilingual phone recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:085ddb2a67e0f893f3ae23b435ba8b4b58e264bab34af107c4f99d7e3fd87588","observation_id":"bb880130-0b75-4c17-8e4f-379cf7d41a79","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"POWSM: A Phonetic Open Whisper-Style Speech Foundation Model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:630d62d4e211c0bb85b61d564cdc8f19c8e4a9936a40f4959f4dab19da4c855d","observation_id":"9ff74116-b6ca-469a-8f39-e8099df60399","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.14046","last_updated":"2026-07-13T00:34:38Z","snapshot_observed_at":"2026-08-09T06:47:16.244200Z","submitted_at":"2026-01-20T15:00:36Z","title":"PRiSM: Benchmarking Phone Realization in Speech Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.14046","snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"PRiSM: Benchmarking Phone Realization in Speech Models,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"cited_paper":"/paper/2601.14046","citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:9919f96be93313b383c4e33e401f94bec8c22898821fed813e2eb185299e8680","observation_id":"b9eab9d5-9e15-4646-a4b4-10712446601e","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Gemini 2.5: Pushing the frontier with ad- vanced reasoning, multimodality, long context, and next genera- tion agentic capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:3ae5a9f15229a8ed3829b57bf5b667b804a4472ef41812fab4efda4e9c9eea64","observation_id":"a0f8b766-afd1-4bc8-b2f2-298f9702f638","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Qwen3-Omni Technical Report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:a98d87acc83129a922b3fc31f9e5a4d6b8b31572e482556bc888157d8c9a300f","observation_id":"6daa9862-0416-46d0-b0a1-ba732568f5c8","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Simple and Effective Zero-shot Cross-lingual Phoneme Recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:efaaceaa00792e10c167eda375ecf01d3211cb889a379c4ffc736ddc8adcad6b","observation_id":"d9698ef9-e626-4cde-8a28-1529787f8993","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Universal Au- tomatic Phonetic Transcription into the International Phonetic Al- phabet,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:2fb0b8e669cb58cc2a8a13877d202744ee36ebf2a6b63c4b4624393b82147127","observation_id":"3e6f2be4-c394-4d7d-81f8-9fc3cda807e3","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Towards zero-shot learning for automatic phonemic transcrip- tion,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:23a17cc93fb3b5f1d846abe530124f13a5cfbed54e60aee1c6c813068526047f","observation_id":"128ebd92-c589-418f-8046-e9ca89075dec","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Universal phone recognition with a multilingual al- lophone system,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:1a73a816b0cd47f369d4f9e8fd29f6c3c23413463f2bd4bb36b2f8087f342cc3","observation_id":"590de913-f9d9-49bd-82eb-5479dab30dfb","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Allophant: Cross- lingual Phoneme Recognition with Articulatory Attributes,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:6bf11a66df28e4345fcde92eed178bdaad1c95f29044dadd84d9770c49e6c7b6","observation_id":"24cc05e6-3c61-490d-adad-6c73ba79d539","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"The taste of IPA: Towards open-vocabulary keyword spotting and forced alignment in any language,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:60bf47b8aac61e30ec131c6d74ea8062f03a3e0f70ff1ef09504c28e1a9e9524","observation_id":"3508ec10-3a24-425a-99dd-2a1643470d49","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Multilingual Dysarthric Speech Assessment Using Universal Phone Recogni- tion and Language-Specific Phonemic Contrast Modeling,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:9c82e4ed2371d7e5aa4a8718f9e76d8446ec8473e1670ea8f55dedf7ffe50d83","observation_id":"a6561630-6b90-4bf7-8325-ab6c277bfbce","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Towards robust speech representation learning for thousands of languages,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:fe13867b59cf12eaa3660aca7649a4e495f6a278d7a89bd3dbe4a30f626b4042","observation_id":"5c140f6e-6fde-4407-8807-61636485ce15","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Layer-wise analysis of a self-supervised speech representation model,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:9bf45d1c5a48b198fd3b498e184dea2a918f00a5e3930934b6a97f7f7db1b5b5","observation_id":"7492c43d-0ab2-4be0-9a79-ddfea792190b","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Zipformer: A faster and better encoder for automatic speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:46a4e3c3c93d0daa74fb2c202f2b3d84c79878e3360bbe0f981a881102c58713","observation_id":"7e6c5455-f2a8-4c00-a4a6-9d9a29bfb127","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"CR-CTC: Consistency regularization on CTC for improved speech recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:685629de011b14c824eec5c61bc3a685e5ac8faf439da3a31abba3ba8d7186cf","observation_id":"e151e11b-70ec-4d40-95ac-6f85b69153a1","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Joint CTC-attention based end-to-end speech recognition using multi-task learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:f4fbfbdb22fe45dfb016df30e628383762741baa6f616445e1514188372918c5","observation_id":"38592093-7caa-4d83-a6df-1edef60dae46","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"PanPhon: A Resource for Mapping IPA Segments to Articulatory Feature Vectors,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:cfdcd22b59fc710d2fa9b54bd7f567df7c9b29197ed3cf3dfa02b267bc53c9fb","observation_id":"5b48696c-967c-4831-b87d-7dfd9754eadc","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Relaxing the Conditional Indepen- dence Assumption of CTC-Based ASR by Conditioning on Inter- mediate Predictions,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:04fe5ef25b74ddae6af59fd2a8f2550ad0e91372e31fea5e7c5cc289fc9d9100","observation_id":"50a72b78-cde4-4917-9f4c-b01148fa10e8","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Connectionist temporal classification: labelling un- segmented sequence data with recurrent neural networks,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:8a2bfba293a3c943dadd2ac6c8683ad11ba48e88403c174755463030ffcff805","observation_id":"02288618-6203-48e1-9e2d-f08aefa10f40","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Hierarchical Multitask Learning With CTC,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:dce53770acfddb399dc01ccc386f778fef1b29eade74471270a195bc30e2c8ad","observation_id":"b6934bed-6b3f-4547-9ade-2d8cebe192df","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Intermediate loss regularization for ctc- based speech recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:77c15f0dba2344dd2f31697e9b5e250afeccc46870f8175d0a5ea3c6a734b68f","observation_id":"c44816e8-8ce8-4db5-aba6-a48f93516f67","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Deja-vu: Double feature presen- tation and iterated loss in deep transformer networks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:ea636e39ffd016b4e925141a18858d87e35da68cd4cd0617075fe81ca12ed0ea","observation_id":"8ec224ea-dc8e-49a1-80fc-8766758bd88b","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Im- proving massively multilingual asr with auxiliary ctc objectives,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:3fcee1c0d420c5c5312e17747c4ce069c34c882f7730f78f678ab1e5e6507647","observation_id":"5e5f2907-d782-4665-9b3d-e00e2103dcae","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Hierarchi- cal conditional end-to-end asr with ctc and multi-granular sub- word units,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:c44b6d01f28950f4ad8d29fe0584e877983c57bf6ff0f8487dedc7ec5508c0b4","observation_id":"21e7fded-6a23-4dcd-af23-d5fd8f557eef","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"E-branchformer: Branchformer with enhanced merging for speech recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:9d5aaa34fd4698a1c060cfdf3177eb95359ca926663d4ccab2e2ea92900d293a","observation_id":"058efa0e-b149-42b5-ba05-5526b96095a0","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Scaling Speech Technology to 1,000+ Lan- guages,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:ba88bbea0aa56f117960b58eec636421a8f57180da2f25d0fd5a98162b48c30c","observation_id":"6f998681-c4c3-453a-8cc8-0dfe22a696f1","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.18899","last_updated":"2026-04-13T18:05:11Z","snapshot_observed_at":"2026-07-31T05:51:44.060112Z","submitted_at":"2026-02-21T16:43:13Z","title":"[b]=[d]-[t]+[p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.18899","snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"[b]=[d]-[t]+[p]: Self-supervised Speech Models Discover Phonological Vector Arithmetic,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"cited_paper":"/paper/2602.18899","citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:3744b3efa49294aceb6aea4b9237d5993f5a89394cf22953bcc2c7456fff8880","observation_id":"51c510a3-7692-4c03-88e4-0d755d256a06","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Hubert: Self-supervised speech represen- tation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:4a3eed0fb62ee7ec990e799ddff03655abfb7df34197767b0c356439d89b08ed","observation_id":"dd7980a8-44d0-452a-b761-70d6c00aeafb","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Phonetic Seg- mentation of the UCLA Phonetics Lab Archive,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:9a9e1b029dc19c66b416370a4179fed708190915fa51f4cf3f46515b0dd46066","observation_id":"c9a79db9-0f01-411d-9721-c96e53f6b80f","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"URIEL and lang2vec: Representing languages as typological, geographical, and phylogenetic vectors,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:c089c2120b6a8e90fac1a7b29f5c5233b5494a3f64c6a01e2bb39da92fe942de","observation_id":"28576cc6-9ee6-4fb3-b26d-49dbb099769e","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T20:01:37.569548Z","title":"Speech Accent Archive,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-14T20:01:37.569548Z"},"links":{"citing_paper":"/paper/2603.29042"},"observation_digest":"sha256:5e2e328b169c78645a47b888f670d630a29a8f5ce4cfee3f073bae0985b51035","observation_id":"7bef0f89-d439-4cde-aa89-6b422892d994","resolution":{"observed_at":"2026-07-14T20:01:37.569548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2603.29042","last_updated":"2026-07-13T00:41:09Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T04:43:59.157064Z","submitted_at":"2026-03-30T22:12:48Z","title":"An Empirical Recipe for Universal Phone Recognition"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 2 inbound Pith citation observations for arXiv:2603.29042."}