{"as_of":"2026-08-17T00:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91e5ca526d05a45496456a75168eda59b8fd96285f01a981baa70f2df04d04c3","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T10:18:35.114949Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T14:35:20.515352Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-10T14:35:33.970924Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"cited_work":{"arxiv_id":"2509.04357","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2509.04357","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"PARCO: Phoneme-augmented robust contextual ASR via contrastive entity disambiguation","venue":null,"work_id":"0589508e-11d1-434a-bca7-81e173b90394","year":2025},"citing_paper":{"arxiv_id":"2604.12398","last_updated":"2026-04-14T07:33:44Z","snapshot_observed_at":"2026-08-07T14:13:49.096555Z","submitted_at":"2026-04-14T07:33:44Z","title":"Contextual Biasing for ASR in Speech LLM with Common Word Cues and Bias Word Position Prediction","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-10T14:35:20.515352Z"},"links":{"cited_paper":"/paper/2509.04357","citing_paper":"/paper/2604.12398"},"observation_digest":"sha256:0996d02e8d6d4268ab686a7cf2b8f7d3fdfced187f7602adb0f99079c7df4707","observation_id":"3bd14a64-2d60-4b90-aa61-e92dbbc4c81d","resolution":{"observed_at":"2026-05-10T14:35:33.973336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2509.04357/citation-record","integrity":"/paper/2509.04357/integrity","json":"/paper/2509.04357/citation-record.json","paper":"/paper/2509.04357"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:43.974281Z","title":"Automatic speech recognition using advanced deep learning approaches: A survey,","venue":null,"work_id":"19ccac74-9077-40da-a751-9ef37f275941","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:30.675109Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:1e959f65aaa58c5da3eee3988fd1f1ddad0b0971943abd435fcca01e894d7161","observation_id":"322638c8-0df7-46b8-82f7-d8c9883e7077","resolution":{"observed_at":"2026-08-05T10:18:44.138182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:43.685273Z","title":"CIF-T: A novel CIF-based transducer architecture for automatic speech recognition,","venue":null,"work_id":"19828e14-7849-4091-8f85-2335c0162f26","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:30.760769Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:1f1eb04cb537189b70873eecca9a26eb35f3f27e54f20bb4071b29516152bc9d","observation_id":"6358ec6c-4e94-4cbc-9f48-94a2cdbf385a","resolution":{"observed_at":"2026-08-05T10:18:43.842173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:43.398160Z","title":"Dynamic encoder size based on data-driven layer-wise pruning for speech recognition,","venue":null,"work_id":"a42c58ac-c723-408e-928b-8d791707bc1b","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:30.872253Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:7339c6c8c26ac2f417d178d9b1c162df23990582077aa5f7ca9cf2c3bf187982","observation_id":"707e0721-383e-427c-8f13-d1ffe24296e8","resolution":{"observed_at":"2026-08-05T10:18:43.542786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:43.123973Z","title":"Instant one-shot word-learning for context-specific neural sequence-to-sequence speech recognition,","venue":null,"work_id":"4a417f14-592d-4bac-b825-d6bf03d8fa79","year":2021},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:30.951193Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:809157faaf9252c9e29c4ad1913944811463ad3968ee9b368322f0e2edee593a","observation_id":"c29b9954-db35-4fff-aafe-5128aa2cb42e","resolution":{"observed_at":"2026-08-05T10:18:43.269291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:42.869912Z","title":"Multi-modal video summarization based on two-stage fusion of audio, visual, and recognized text information,","venue":null,"work_id":"cc0116d4-ef8d-4ac4-a202-9aab7658c52c","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.056822Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:d897bea4fed484f4d9228c235712eabc7817c237ecc8510e67b8116299c54099","observation_id":"2159bfe9-17c3-4c83-be23-afb2cee21dbc","resolution":{"observed_at":"2026-08-05T10:18:43.004219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:42.652880Z","title":"2DP-2MRC: 2-dimensional pointer-based machine reading comprehension method for multimodal moment retrieval,","venue":null,"work_id":"60f9fc41-0524-4578-b2e2-20ff466a8b6b","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.163837Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:ec694a7c35e39265f289dbef0334617fcf60dcbb88bb84233c99a6eea2f6b8ff","observation_id":"0333500b-16b0-45af-a468-17a6b7d1dade","resolution":{"observed_at":"2026-08-05T10:18:42.748558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:42.385503Z","title":"MF-AED-AEC: Speech emotion recognition by leveraging multimodal fusion, ASR error detection, and ASR error correction,","venue":null,"work_id":"b47e0bfa-2742-481a-88f6-2a33f374716e","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.289314Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:1f0b5516be9a93d8dad91d27f97784f3aabc9bbd14bcfd4dbf597c2157204c1c","observation_id":"cd3180ed-365d-46e2-a515-cae055da9dff","resolution":{"observed_at":"2026-08-05T10:18:42.497534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08353","last_updated":"2025-03-23T16:45:04Z","snapshot_observed_at":"2026-08-16T13:43:41.325087Z","submitted_at":"2024-06-12T15:59:25Z","title":"Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques","version":3},"cited_work":{"arxiv_id":"2406.08353","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.08353","snapshot_observed_at":"2026-08-05T10:18:35.658471Z","title":"Speech Emotion Recognition with ASR Transcripts: A Comprehensive Study on Word Error Rate and Fusion Techniques","venue":"eess.AS","work_id":"b15bee05-2d28-49a6-8ad6-ef15f4e7c503","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.395886Z"},"links":{"cited_paper":"/paper/2406.08353","citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:8389fd4c7f83a47c11199e64d7c82d1a47d9b8cd93773333116d1e6f56c64a57","observation_id":"9c529a58-f17f-49f4-884e-b0ad911e284f","resolution":{"observed_at":"2026-08-05T10:18:35.743208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:42.211038Z","title":"A study on multimodal fusion and layer adapter in emotion recognition,","venue":null,"work_id":"93b96a76-c347-43a9-a1cd-425c95e2be3a","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.486417Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:ccda7bc08ee6a5cd2f5b6ba3e497983aa053da82570c9f0d442fd7ee0ad368d5","observation_id":"f2a2ecff-b578-4820-87e7-48a4b24bbd26","resolution":{"observed_at":"2026-08-05T10:18:42.286403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:42.110252Z","title":"Semi-supervised multimodal emotion recognition with consensus decision-making and label correction,","venue":null,"work_id":"70ad0341-6702-4c97-92b1-dd0eabe5fc6a","year":2023},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.561785Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:c38b8422d193fa8d1b5f146fdb1f4bde4b4c9ad223cc86f982efc0135f58f18e","observation_id":"55b48a87-d724-45d6-97c7-0fd935752f79","resolution":{"observed_at":"2026-08-05T10:18:42.144309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.998977Z","title":"Two-stage framework for robust speech emotion recognition using target speaker extraction in human speech noise conditions,","venue":null,"work_id":"7507d624-1137-4f4a-8e53-f1bc909bd697","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.702244Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:d2c0fcd08cc54641a48ecd23851dea4d994c713ace67fafa8c36a3d51688ff9a","observation_id":"55e6df77-f3d2-49aa-9728-74551656871d","resolution":{"observed_at":"2026-08-05T10:18:42.053582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.895865Z","title":"GIA-MIC: Multimodal emotion recog- nition with gated interactive attention and modality-invariant learning constraints,","venue":null,"work_id":"99d2a034-627a-48c2-a1c6-5af0ed67b22f","year":2025},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.790431Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:347e9cffa7e204b746f9124590fd302fe21886c7bd7ba2df143e2cadff4ec34a","observation_id":"9ab2cf47-a836-4db0-aec4-f7094889a8b3","resolution":{"observed_at":"2026-08-05T10:18:41.948292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.783637Z","title":"Tree-constrained pointer generator with graph neural net- work encodings for contextual speech recognition,","venue":null,"work_id":"17984b63-de0f-40ec-87f2-80b40f855e53","year":2022},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:31.912082Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:9d3b701759f46b63193a4733a3df661a4055e5bc0bb66c9b96f57af7e8d3bf52","observation_id":"e023085e-1261-4b71-871a-95805a352964","resolution":{"observed_at":"2026-08-05T10:18:41.831098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.648543Z","title":"MaLa-ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":"ad6df610-d7f7-4324-bb78-d9181366b7f2","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.002283Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:a28ebd87482a518b948d82d2554d129f29460835038a45f1ef62bad42c994bd8","observation_id":"e415bc14-3028-472a-9799-718efa49901c","resolution":{"observed_at":"2026-08-05T10:18:41.711393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.538700Z","title":"Improving neural biasing for contextual speech recognition by early context injec- tion and text perturbation,","venue":null,"work_id":"c4826345-438a-4361-95f3-eee34799dbd0","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.098255Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:433c6a960a7b1829b3a0ee7c4b7ef48289562ef38fa81df6299f2eee11dfcb96","observation_id":"8408ca26-dff3-4424-8e2b-6945d826a9a1","resolution":{"observed_at":"2026-08-05T10:18:41.596723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.374678Z","title":"Contextual speech recognition in end-to-end neural network systems using beam search","venue":null,"work_id":"05bc289d-bdca-4193-b7e5-12a99a504998","year":2018},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.204269Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:7ffb5194340088c7069613f512fd7d5c819d3e9178c4191fd7c7906ab0ca2fd7","observation_id":"84dc023b-a5c2-4f7a-9ca9-09960d2b0cb8","resolution":{"observed_at":"2026-08-05T10:18:41.451492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.201232Z","title":"Deep shallow fusion for RNN-T personalization,","venue":null,"work_id":"5f6f8476-af25-43a2-ad04-b9be57b9dcc5","year":2021},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.320515Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:c8656daabecb4512e1371b6f57978ca27b3b60cbef3d6df3d4db24a9b127a486","observation_id":"6f45496c-7df8-43df-a454-246a3dc1e699","resolution":{"observed_at":"2026-08-05T10:18:41.301407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:41.048407Z","title":"Factorized neural transducer for efficient language model adaptation,","venue":null,"work_id":"10de4800-a8ed-4bb2-9a9f-71f9e9e19a0f","year":2022},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.410364Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:68d0f8c288aa54ce44e8d40397cab542a6e4297af8f1e35125845d8a86149be5","observation_id":"6360ce2a-8fc2-450f-9c21-78c1c6c29af9","resolution":{"observed_at":"2026-08-05T10:18:41.124389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:40.830362Z","title":"ED-CEC: Improving rare word recognition using ASR postprocessing based on error detection and context-aware error correction,","venue":null,"work_id":"4cf43e5f-4ade-4b05-b1e8-97e771e434fe","year":2023},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.539128Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:db5c60c4f82d03d3b9e0b7f86e07fd05574718920fafaba644c1045cd3bcf486","observation_id":"2a07e40e-a9f5-48c3-8a72-beb3fb6ff9d3","resolution":{"observed_at":"2026-08-05T10:18:40.903330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16677","last_updated":"2024-09-13T01:56:05Z","snapshot_observed_at":"2026-08-16T13:49:16.543595Z","submitted_at":"2024-05-26T19:58:38Z","title":"Crossmodal ASR Error Correction with Discrete Speech Units","version":2},"cited_work":{"arxiv_id":"2405.16677","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.16677","snapshot_observed_at":"2026-08-05T10:18:35.448150Z","title":"Crossmodal ASR Error Correction with Discrete Speech Units","venue":"eess.AS","work_id":"a73e3dfc-af17-488c-8e99-8e71bdba7c64","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.645012Z"},"links":{"cited_paper":"/paper/2405.16677","citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:14cb704c04d7c8697cfc1f241b3144e2c9091ab363fba343e440820718fcf9b5","observation_id":"59079a0e-a6d2-4693-b4d5-55e2c437e270","resolution":{"observed_at":"2026-08-05T10:18:35.542175Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:40.640352Z","title":"Enhancing recognition of rare words in ASR through error detection and context-aware error correction,","venue":null,"work_id":"f2d9f117-1846-4c6c-876f-d34664285b56","year":2023},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.732671Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:6630f1b07b4eec39bc43f2aba2962a165b46f1559cab65994551ee8b8fd8805e","observation_id":"11eac815-64d4-403e-aa2b-3485ce38f2a0","resolution":{"observed_at":"2026-08-05T10:18:40.730018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:40.464616Z","title":"PMF-CEC: Phoneme-augmented multimodal fusion for context-aware asr error correction with error-specific selective decod- ing,","venue":null,"work_id":"ebffe257-2bc4-44d0-bbbf-f672e7480e7e","year":2025},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.812727Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:11c9459b256c0c16affc65127537f53e935feb2456e3549a0228a1fec98f2245","observation_id":"bcb58403-e8a3-4335-b7a0-5853f60fab9f","resolution":{"observed_at":"2026-08-05T10:18:40.546945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:40.280474Z","title":"Deep context: end-to-end contextual speech recognition,","venue":null,"work_id":"4df59d60-3ff8-454c-beac-1e34df6be652","year":2018},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:32.928532Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:cdc1b6835ca3079e220923c6791464d8a5cf42b5bccd303522c5982b7c706def","observation_id":"9988bda9-d071-439b-b13a-537601808cde","resolution":{"observed_at":"2026-08-05T10:18:40.365022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:40.119042Z","title":"Improving end-to-end contextual speech recognition with fine-grained contextual knowledge selection,","venue":null,"work_id":"356c1642-6948-4d0e-8856-c188c64aeee6","year":2022},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.009361Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:bc693fd9ca3ecbff1d5f827f2dc176ff29e7ea8d446267d20ceefb970c0cfa13","observation_id":"da288ae9-d567-4229-ab7d-8205d612daf1","resolution":{"observed_at":"2026-08-05T10:18:40.191821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:39.911385Z","title":"Internal language model estimation through explicit context vector learning for attention- based encoder-decoder ASR,","venue":null,"work_id":"5950d8fb-92ed-4d34-9eab-75c329112c33","year":2022},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.069199Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:4509c033040b84b84160ff36359593fd8f0c8f955841472ce04754f70080e694","observation_id":"c92e0b2c-6657-4b5a-bd03-b9c03a3363d5","resolution":{"observed_at":"2026-08-05T10:18:39.983423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.09003","last_updated":"2022-02-18T03:26:02Z","snapshot_observed_at":"2026-08-16T17:20:24.958747Z","submitted_at":"2022-02-18T03:26:02Z","title":"End-to-end contextual asr based on posterior distribution adaptation for hybrid ctc/attention system","version":1},"cited_work":{"arxiv_id":"2202.09003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2202.09003","snapshot_observed_at":"2026-08-05T10:18:35.238275Z","title":"End-to-end contextual asr based on posterior distribution adaptation for hybrid ctc/attention system","venue":"cs.CL","work_id":"895a615e-9ed7-46ed-b5ea-a6b87a82d8a3","year":2022},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.161195Z"},"links":{"cited_paper":"/paper/2202.09003","citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:909a555bc446fed8d87d29cdf4ea4e6bd12cc667f5ca4b25b3060ef33615000a","observation_id":"e46a84fb-e9b5-4c13-9eeb-17a5aa97d926","resolution":{"observed_at":"2026-08-05T10:18:35.328714Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:39.708389Z","title":"NAM+: Towards scalable end-to-end contextual biasing for adaptive ASR,","venue":null,"work_id":"70c337b5-f039-4265-8945-10feb80851d6","year":2023},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.252673Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:7fd6272a432cd1aed073e65e867c71f87ff5fc1987fd26da7449949a9083bf68","observation_id":"04fbef26-f470-4ca3-9bc9-a9aee470da09","resolution":{"observed_at":"2026-08-05T10:18:39.820530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:39.550918Z","title":"CopyNE: Better contextual ASR by copying named entities,","venue":null,"work_id":"2fd700cf-cc18-4dfc-b665-02f9cc4662a1","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.319730Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:0c379fc0a1955298f8c5713e251bd98f90c8a3f49a18979ab33e3f5c73515741","observation_id":"55dbaaae-2f9e-4aca-bb3e-dac85a01068a","resolution":{"observed_at":"2026-08-05T10:18:39.622313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:39.344024Z","title":"Improving contextual asr with enhanced phrase-level representation based on mctc loss,","venue":null,"work_id":"752aea65-eda9-4b3d-9a32-7ebc887c8ca2","year":2025},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.428056Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:b2ece7852b55e4b11be7fd53ce52ef2a10d35e36d26b547fd10b7803536afbbb","observation_id":"1dd9511a-3409-4955-b14b-b183d05c644b","resolution":{"observed_at":"2026-08-05T10:18:39.491365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:39.150710Z","title":"Token-level contextual network with ladder-shaped attention for end-to-end asr,","venue":null,"work_id":"f826da43-efed-4cae-963b-2959389949af","year":2025},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.538011Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:26ab9f6cbb5985e580435fc75e3368ecb6ae8e60891139e54e634cde16752e6b","observation_id":"1867c19e-3827-4c52-a31e-c434b8aef10b","resolution":{"observed_at":"2026-08-05T10:18:39.258482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:38.935771Z","title":"Phoebe: Pronunciation-aware contextualization for end-to-end speech recogni- tion,","venue":null,"work_id":"43890ebe-60c6-4d36-bf21-32b634727c15","year":2019},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.629311Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:cd76f5c08c08b12f511360466368d8dbeeb8a7d83cf1c442520d195952d3716a","observation_id":"86fa9729-79fa-49c9-a391-4275b22d1f4c","resolution":{"observed_at":"2026-08-05T10:18:39.013023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:38.692718Z","title":"Joint grapheme and phoneme embeddings for contextual end-to-end ASR","venue":null,"work_id":"76646c04-43ed-480d-a244-f6972ee0ea74","year":2019},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.695383Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:ada1eaa0a7cccdb9184d11206c54f4fa71d6bb144d53521403b774f5f7a96b25","observation_id":"2fb7a461-537d-4350-b836-d812c136f0aa","resolution":{"observed_at":"2026-08-05T10:18:38.817204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:38.507444Z","title":"PROCTER: Pronunciation- aware contextual adapter for personalized speech recognition in neural transducers,","venue":null,"work_id":"4f5f549a-9297-4e9b-a62f-b334c0812957","year":2023},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.823816Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:a1c175bedc7382a44bf278b3b6940c79ad7cfb0bbfd63e3fce9615a3d28731d7","observation_id":"62783f02-b3b5-41c2-8968-7d2b3e638aa4","resolution":{"observed_at":"2026-08-05T10:18:38.618070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:38.286732Z","title":"Phoneme-aware encoding for prefix-tree-based contextual ASR,","venue":null,"work_id":"c66680a5-99a3-4b34-bd63-764bc66d7289","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.903805Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:bbf79c5cb9813dc1c5fff97a97dbcc1bbf0554adedd4fb4951696619dfd050ca","observation_id":"b7158bc0-4e94-4523-b054-9ddbb27cff3f","resolution":{"observed_at":"2026-08-05T10:18:38.389326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:38.117903Z","title":"Joint CTC-attention based end- to-end speech recognition using multi-task learning,","venue":null,"work_id":"9eb21fce-63a5-43ea-985f-69fe9d5ae5fd","year":2017},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:33.967469Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:a8b5a326cd7b2a6e47f4775964c1d81eedf5e7384212b033f4a998aa64c8f685","observation_id":"0bf96b4c-e846-4639-b28d-42f9c13805c8","resolution":{"observed_at":"2026-08-05T10:18:38.217175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:37.900751Z","title":"Self-distillation for improving CTC-transformer-based ASR systems","venue":null,"work_id":"38ea68ee-e53e-42de-bda7-be9e7a633cc3","year":2020},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.081232Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:47240e1b2ab0afb1abf49fe711da133a46ce69b6d6500fcf57673537b6689840","observation_id":"12170272-32fe-4dfa-9a7f-cbe47c41c2bb","resolution":{"observed_at":"2026-08-05T10:18:38.007676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:37.669979Z","title":"Context-aware transformer transducer for speech recognition,","venue":null,"work_id":"dd9f4049-03ac-4004-8951-a64530b5b6c8","year":2021},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.168754Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:58ada3a69ad70f0c01c5f8373d97ce33555ea043b57ab93fcec7335c733e9ab2","observation_id":"e8ba383b-0d66-418b-a36a-2f327d9bed96","resolution":{"observed_at":"2026-08-05T10:18:37.782198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:37.396272Z","title":"Improving ASR contextual biasing with guided attention,","venue":null,"work_id":"57e4e12c-0217-4a6d-a070-dc7ac6c4559c","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.272132Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:5ea5b9b08d67110ff0a39a931f45a81dd40584e03cd8d63dbfa1aa7d006111c2","observation_id":"2cf92c9d-3b41-4f7e-a08c-7e8cd517a978","resolution":{"observed_at":"2026-08-05T10:18:37.562610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:37.146873Z","title":"Contex- tualized automatic speech recognition with attention-based bias phrase boosted beam search,","venue":null,"work_id":"53f6a424-1a8c-4b28-917e-4fc59414e314","year":2024},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.360002Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:341ace239610cdd2c6d8e0c76d3bed75af639d4543df1e568124b5be49babcd9","observation_id":"b1f8a09d-70db-42e6-a94f-449dfdcc3732","resolution":{"observed_at":"2026-08-05T10:18:37.274919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:36.945862Z","title":"Conformer: Convolution- augmented transformer for speech recognition,","venue":null,"work_id":"e4b616c8-1cfe-4014-a910-9cfcf29b0e3e","year":2020},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.497078Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:ca298e39ff030f1985c60c8cfaa0ceb3daa7e9e84c412cd745b366070221f8e4","observation_id":"494978f9-7b2e-4916-9b0c-ec058b9650e0","resolution":{"observed_at":"2026-08-05T10:18:37.061641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:36.728090Z","title":"AISHELL-1: An open- source mandarin speech corpus and a speech recognition baseline,","venue":null,"work_id":"50901fd2-ee71-465d-a69d-91fb47c5c123","year":2017},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.579682Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:165714d009efff48b20e307e9d2471bfd06f3fecefc457fed70067580969d622","observation_id":"902eb5cb-42b7-40ab-ab30-9426c20ff8f4","resolution":{"observed_at":"2026-08-05T10:18:36.834252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:36.494066Z","title":"End-to-end named entity recognition from english speech,","venue":null,"work_id":"9ea46515-b45e-4882-9853-60b12f78b6fb","year":2020},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.703664Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:36af46036f4398d3bd8e6b6ef019728721a0b4cccc0ffb904e86c972953179be","observation_id":"ffcb07d3-dac4-4297-83d6-25fb5321c9aa","resolution":{"observed_at":"2026-08-05T10:18:36.611020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01882","last_updated":"2015-12-10T13:35:33Z","snapshot_observed_at":"2026-08-14T22:19:47.948209Z","submitted_at":"2015-12-07T02:07:21Z","title":"THCHS-30 : A Free Chinese Speech Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.01882","snapshot_observed_at":"2026-08-05T10:18:34.826758Z","title":"THCHS-30: A free Chinese speech corpus,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.826758Z"},"links":{"cited_paper":"/paper/1512.01882","citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:39f56f1a1cbda6d92fca890f0da57a847d6962ef975607152c50fd241c1799aa","observation_id":"61d16c84-5b01-4a81-bcb6-80c9ec3e2799","resolution":{"observed_at":"2026-08-05T10:18:34.826758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:36.265476Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":"9a84aa4d-83b7-4440-b9b3-5eb135f9b053","year":2015},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:34.915296Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:ed68331773d71cf05cb86f7bb05758fb0cb8d1f72d0c57f36df984afb2e7b019","observation_id":"3e7b0fd7-9217-4ecf-8144-69f4e9f3f2b3","resolution":{"observed_at":"2026-08-05T10:18:36.392459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:36.049883Z","title":"CIF-based collaborative de- coding for end-to-end contextual speech recognition,","venue":null,"work_id":"ba28dbbf-21c8-40e4-8532-f1a5f5825e8e","year":2021},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:35.003765Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:ae09f1ee276582e89ff802a3eed1f3faa84fee509bc8d55e1b9cfcf82ef203eb","observation_id":"e719cce7-8f12-4531-a26e-061d2c17b214","resolution":{"observed_at":"2026-08-05T10:18:36.127421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T10:18:35.833339Z","title":"AISHELL- NER: Named entity recognition from Chinese speech,","venue":null,"work_id":"8e89453f-d0bc-4ee6-8f70-af87ffcdc60c","year":2022},"citing_paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T10:18:35.114949Z"},"links":{"citing_paper":"/paper/2509.04357"},"observation_digest":"sha256:5de1526370c6802041e0c32b00ec8c17a35405c75a65dd5c1195daca089dbf61","observation_id":"a78f6239-7e8e-4026-9b32-aac52f190fcc","resolution":{"observed_at":"2026-08-05T10:18:35.916885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.04357","last_updated":"2025-09-04T16:18:34Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T02:29:59.457036Z","submitted_at":"2025-09-04T16:18:34Z","title":"PARCO: Phoneme-Augmented Robust Contextual ASR via Contrastive Entity Disambiguation"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":3,"verified_fuzzy":42},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 1 inbound Pith citation observation for arXiv:2509.04357."}