{"as_of":"2026-08-14T09:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7a6fcdc1a73b4c2f1a16af46ea3fe8d2b3f8b646dc6a4cad3164a6327dbeedf0","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:10:00.192129Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11064/citation-record","integrity":"/paper/2506.11064/integrity","json":"/paper/2506.11064/citation-record.json","paper":"/paper/2506.11064"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.372063Z","title":"Robust speech recog- nition via large-scale weak supervision,","venue":null,"work_id":"d252c5a6-4dde-402e-9a05-c2619814a790","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.535544Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:dad2c4bfc87aea3477548481309313740b16af92d1306e9d5891c4a65cde6b7a","observation_id":"795184c4-9f4c-4280-b093-7aad874d0be9","resolution":{"observed_at":"2026-08-07T12:10:13.476004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.212224Z","title":"Improving neural biasing for contextual speech recognition by early context injection and text perturbation,","venue":null,"work_id":"74caa0ab-e843-4ee1-a825-656fa1791ba3","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.606799Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:9ca37451cff393e1f5c313130e66957760e26ff3e338c468be66013ffb6b4dd4","observation_id":"befd6656-ab63-4123-b91c-fdb025c445de","resolution":{"observed_at":"2026-08-07T12:10:13.298437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:13.051041Z","title":"Multi-modal video sum- marization based on two-stage fusion of audio, visual, and recognized text information,","venue":null,"work_id":"bc986cf6-5cec-4fb6-8359-3e27943e2ac9","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.685814Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:4e41430bf6e682e2f4831370abef4c08a7f15c78151bceba9947ace314a52bbf","observation_id":"02b2d899-25dd-4727-8d3e-af9fec6917d1","resolution":{"observed_at":"2026-08-07T12:10:13.122617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.835157Z","title":"In-context learning for few-shot nested named entity recognition,","venue":null,"work_id":"f4fe34e8-d676-4f70-87b6-a629a7a00af1","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.807340Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:abae87c8f63ffd26dd347d89fc083a9c6aed11f0249153d86b9b62b9ae170fbc","observation_id":"17bd42fa-a2ed-44b3-8334-fe95ba27b8ce","resolution":{"observed_at":"2026-08-07T12:10:12.931173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.600404Z","title":"MF-AED-AEC: Speech emotion recognition by leveraging multimodal fusion, ASR error detection, and ASR error correction,","venue":null,"work_id":"a22c1888-21e1-48a7-8cd9-69252719700a","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.879097Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:7d425e87705a5da284a89b495ff143a39f9737bea3cbbf4587fec20fd44abf82","observation_id":"2736ff4e-81a3-4d60-9b8a-7d594796d1e1","resolution":{"observed_at":"2026-08-07T12:10:12.706390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.462589Z","title":"Tree-constrained pointer generator with graph neural network encodings for contextual speech recognition,","venue":null,"work_id":"c8251e0f-6d7e-4985-9560-1d6b83acb651","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:54.989920Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:305f2a0fdd0c7c1a4ab15f49da744344c3b4247e91fd80d61fbbac22f8fbd7ec","observation_id":"4cc8b090-3aac-4e9e-8c33-4a84c6b18652","resolution":{"observed_at":"2026-08-07T12:10:12.513934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:55.053460Z","title":"MaLa-ASR: Multimedia-assisted LLM-based ASR,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.053460Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:921354f7619041cda073c2505bd75cf8706cb0c6a0e5ad8b9afddbb604c8a3b8","observation_id":"a8a60f8e-9764-4364-8119-5398b2c59625","resolution":{"observed_at":"2026-08-07T12:09:55.053460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.315366Z","title":"Contextual speech recognition in end- to-end neural network systems using beam search","venue":null,"work_id":"fc943edb-01d4-4dd8-99f3-f0d711ed7ae6","year":2018},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.166690Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:b923dc3b1d765908bff605a35e2e8faeee3f634e01cb52ffd3f3b56a1f1db20f","observation_id":"e60ec4d0-4368-4047-af1c-86504a958918","resolution":{"observed_at":"2026-08-07T12:10:12.371221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:12.115080Z","title":"Deep shallow fusion for RNN-T personalization,","venue":null,"work_id":"d48987aa-c6d6-4303-a10c-01c2c8ec69e9","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.276976Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:50ff735a3e5efcc58b36685b35f1f2c9ffb59d198d362484c9c84f2093e14d7e","observation_id":"9a6815ff-2714-4889-ae35-2b666f096cc3","resolution":{"observed_at":"2026-08-07T12:10:12.214946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.941637Z","title":"Fac- torized neural transducer for efficient language model adaptation,","venue":null,"work_id":"80659d0c-37ae-4530-96ed-3f6b2e9bc15a","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.362025Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:a63ed94b7662956957c2dbcaac32a61072d04e029813a500bd833621211c6f36","observation_id":"e5bde053-7127-4c71-a8c9-422bdf04ef2f","resolution":{"observed_at":"2026-08-07T12:10:12.001988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.767359Z","title":"Tree-constrained pointer generator for end-to-end contextual speech recog- nition,","venue":null,"work_id":"bb5e9663-8117-4372-9f81-f1d1bb8812a3","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.478617Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ea20827959b4a3bd1355b81bf8507fd84562996498d57e0299761927fdcae6ad","observation_id":"f14c9184-6399-4a9f-889a-3ccd8c9b3638","resolution":{"observed_at":"2026-08-07T12:10:11.852805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.538110Z","title":"Graph neural networks for contextual ASR with the tree-constrained pointer generator,","venue":null,"work_id":"41af5d61-5f7a-4b7e-a7b7-4b50ada938b5","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.567078Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:715643fb177261da883011cda85825877174a88d37d8f627eba0345fe96d2c32","observation_id":"305e3948-682a-495e-bff0-d3c88a480ccc","resolution":{"observed_at":"2026-08-07T12:10:11.635358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.342184Z","title":"Deep context: end-to-end contextual speech recognition,","venue":null,"work_id":"f8b73732-58ee-4f45-a5e7-7c619d61356f","year":2018},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.649689Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:48bfee19c3a927d6963dfe7df71cb4de8d8178232abd8bd3e091d5c1ba610c81","observation_id":"7e5ba78e-f86e-419c-8043-1eb7ab052706","resolution":{"observed_at":"2026-08-07T12:10:11.402200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:11.150868Z","title":"In- stant one-shot word-learning for context-specific neu- ral sequence-to-sequence speech recognition,","venue":null,"work_id":"a689fb1b-d6e6-4732-ba63-dcf913c29789","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.738916Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:b050d3089702a8ff30fe7922e88c9a629f142f3149a614349926c2c4851f2ced","observation_id":"18a7c00d-a718-4c7d-9b93-c69a37359616","resolution":{"observed_at":"2026-08-07T12:10:11.238213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04675","last_updated":"2024-07-10T09:01:17Z","snapshot_observed_at":"2026-08-13T15:17:10.560696Z","submitted_at":"2024-07-05T17:38:03Z","title":"Seed-ASR: Understanding Diverse Speech and Contexts with LLM-based Speech Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04675","snapshot_observed_at":"2026-08-07T12:09:55.809973Z","title":"Seed-ASR: Understanding diverse speech and contexts with LLM- based speech recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.809973Z"},"links":{"cited_paper":"/paper/2407.04675","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ac260414d3ee432d12eea81c155a5fff2a117c1a7074f39484bb59501e950cdd","observation_id":"ba4234d8-d03c-420c-8bc8-b5ebc8443421","resolution":{"observed_at":"2026-08-07T12:09:55.809973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08846","last_updated":"2024-02-13T23:25:04Z","snapshot_observed_at":"2026-08-13T04:19:27.486516Z","submitted_at":"2024-02-13T23:25:04Z","title":"An Embarrassingly Simple Approach for LLM with Strong ASR Capacity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08846","snapshot_observed_at":"2026-08-07T12:09:55.881758Z","title":"An embarrassingly simple approach for LLM with strong ASR capacity,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.881758Z"},"links":{"cited_paper":"/paper/2402.08846","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:eea99f7d0c20f56cdb6333d5c04fb38926f7e7abe94b79a3b3afd301a05eb888","observation_id":"917b0f81-305f-4f0d-a635-503c76013c37","resolution":{"observed_at":"2026-08-07T12:09:55.881758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.972088Z","title":"PATCorrect: Non-autoregressive phoneme-augmented transformer for ASR error correction,","venue":null,"work_id":"c1a52243-4cec-4958-bbcc-9b9946b4392d","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:55.963474Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:0b20d41a910ae3a8e662f0912ed489c7d2980eb3f4bffff1b90757b9bd881700","observation_id":"5007eac8-be5f-4d3f-bcc1-58a2a1e1a547","resolution":{"observed_at":"2026-08-07T12:10:11.048365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.821856Z","title":"Towards contextual spelling correction for customization of end-to-end speech recognition systems,","venue":null,"work_id":"9779cb6a-1430-4308-8f86-4794aa885f16","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.029694Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ae91932606f94dfa70fbb47fef71a45fd5e713eacd08860ea77073e4b79c0ec8","observation_id":"c64b3490-c5af-4d02-9dd9-d02c4e85965e","resolution":{"observed_at":"2026-08-07T12:10:10.905612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.642066Z","title":"ASR error correction with constrained decoding on operation prediction,","venue":null,"work_id":"54c57636-7013-4a20-adf5-eb65e7433c15","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.120735Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:16ac373446f46d611193d2a916ddee1c1c2973f4cca4aa935829816bc12cb2f8","observation_id":"63675498-1a5d-425b-9ba6-7ce5793ea438","resolution":{"observed_at":"2026-08-07T12:10:10.732161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.419693Z","title":"Crossmodal ASR error correction with discrete speech units,","venue":null,"work_id":"9fcd59cf-870b-469b-a6d0-6741a1644546","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.235752Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:47730c42e11341afa4940fb2a5c695b0e2d54f59404ebf78cff604a5b94d4b05","observation_id":"6b305f5c-6fb4-4e82-bf83-22cc9e91e26d","resolution":{"observed_at":"2026-08-07T12:10:10.515885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:56.309353Z","title":"ED-CEC: Improving rare word recognition using ASR postprocessing based on error detection and context-aware error correction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.309353Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:010b3bdf46c92545cd1dd8efcd7f2db9e92306dd0787e208631d0d0e65000540","observation_id":"be5203e1-5c66-4c82-b2da-693cbf8ecb7d","resolution":{"observed_at":"2026-08-07T12:09:56.309353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:10.164663Z","title":"ASR error correction with dual-channel self-supervised learning,","venue":null,"work_id":"bcb5333c-ad3c-47dc-b3a2-024a2f2cfc35","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.392563Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ce30dde648acc8d9bcffac2863db788a7ba91d6ce070d26ca0e7128329f11996","observation_id":"e33e5840-d7e4-471e-8e2c-70c77f0703e1","resolution":{"observed_at":"2026-08-07T12:10:10.295592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.940061Z","title":"Enhancing recognition of rare words in ASR through error detection and context- aware error correction,","venue":null,"work_id":"53d82d6d-4437-4a4d-aa42-b9a7848a2562","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.450865Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:05d16d1a058313152c3a0b12a8cefa66c4b67955941da21d1b552f9efa43ac45","observation_id":"171d958c-11f7-499f-a350-f65ff468b93f","resolution":{"observed_at":"2026-08-07T12:10:10.042072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.770282Z","title":"Pronunciation guided copy and correction model for ASR error correction,","venue":null,"work_id":"9cd6082c-acc9-4574-8b5b-d01d4284ab74","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.507396Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:5033ba278326226717f2867821ae034b712a538bda8279e8cc9a0f096a1fe3f5","observation_id":"128aa5aa-9cd5-499e-a144-464796e04fb2","resolution":{"observed_at":"2026-08-07T12:10:09.854351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.607495Z","title":"Hyporadise: An open baseline for generative speech recognition with large language models,","venue":null,"work_id":"3a4f7c79-3829-493e-86d3-a44dc6c13457","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.576657Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:d160c2db106ef538b2290677e96ebbb2653498c9e99c8286254e078724da24b3","observation_id":"759e06a5-14fe-407c-b277-1a6f8e12f3ea","resolution":{"observed_at":"2026-08-07T12:10:09.675944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.403203Z","title":"Generative speech recognition error correction with large language models and task-activating prompting,","venue":null,"work_id":"46c310e7-11ad-4fb0-a8b1-6e145168735b","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.669039Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:9f5897019d5d38adb6f48055b5e848d7731507046d1e78924afca58f5f903775","observation_id":"334b07ab-3ad2-4cf7-ab71-524361572dce","resolution":{"observed_at":"2026-08-07T12:10:09.475503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.196958Z","title":"Large language model based generative error correction: A challenge and baselines for speech recognition, speaker tagging, and emotion recognition,","venue":null,"work_id":"f7c9a1f5-ddbf-4454-8ab9-675bf7cb90cb","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.727413Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:d1c01ecca9ad26c72f6dbc4c24af1370194b819b520bf3023079730ffd804e87","observation_id":"c90d9aca-8435-40ad-9fff-4b954195a4aa","resolution":{"observed_at":"2026-08-07T12:10:09.259523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:09.088438Z","title":"Large language models are efficient learners of noise-robust speech recognition,","venue":null,"work_id":"ac14bca3-ea42-42e0-a4f7-e5e9f363ee9c","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.779737Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:91d3d97e5636c8f15567cebc1511c6a88101270925cdbf752263a63dcb19da3f","observation_id":"b47b8166-9b18-45d8-a995-eb967d3b6174","resolution":{"observed_at":"2026-08-07T12:10:09.153363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.879393Z","title":"Revise, reason, and recognize: LLM-based emotion recognition via emotion-specific prompts and ASR error correction,","venue":null,"work_id":"8908a72d-b214-4419-b4cd-9d01c0b2bf37","year":2025},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.846069Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:3e83c7f9c90253ff8b8ac0c696f68f36b43ed397920d0b8ddfe75518b22cbd76","observation_id":"a5c5d98f-ead1-4ecb-9a94-525b193f3fc6","resolution":{"observed_at":"2026-08-07T12:10:08.986466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.732672Z","title":"ASR error cor- rection using large language models,","venue":null,"work_id":"936a1659-48f7-49ec-90ec-e6f84992e38d","year":2025},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.907624Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:847f4311b1bfe734939606082b78e606db063f6fbce5f9e8343df69657620597","observation_id":"b6fd0513-432d-4f9c-9dd1-26ed7026b28c","resolution":{"observed_at":"2026-08-07T12:10:08.787156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.529248Z","title":"Bringing contextual information to Google speech recognition","venue":null,"work_id":"d0c9ebb2-0f1c-4097-997f-226aab180caf","year":2015},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:56.995198Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:77d252c15826df1b508d640e5e7a5003780ce6b16639fbb8007ddabcb1c61f0f","observation_id":"263b21d7-a261-42a1-85ed-60a6ff20b07b","resolution":{"observed_at":"2026-08-07T12:10:08.606086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.366887Z","title":"Personalized speech recognition on mobile devices,","venue":null,"work_id":"5b314506-4a5e-44e9-b940-8ef17513ef79","year":2016},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.072870Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:da547dbdf441bc7f155bc46b33fc0cc5aa5ba82c7ad002d73305fbc4029d3c34","observation_id":"6942ae83-7a25-4b46-8207-9a8a3d89f54d","resolution":{"observed_at":"2026-08-07T12:10:08.455790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.180823Z","title":"Shallow-fusion end-to-end contex- tual biasing","venue":null,"work_id":"9a414d37-2717-41a7-b702-d51dcf376cc0","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.138781Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:4042b9c5e75a9fb5df1d3b981fc368368f02cadec3ef283edabfd4983373220a","observation_id":"05d110ab-6f19-4eb2-8fa2-1c14d7f7577d","resolution":{"observed_at":"2026-08-07T12:10:08.271125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:08.041914Z","title":"Im- proving ASR contextual biasing with guided attention,","venue":null,"work_id":"2379516e-b1c7-41bf-aa74-968ebe03634b","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.197498Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:73f541588fe16b18deb0448c35b72718a80fc27a7f92cf5dfc02cfda609b73cf","observation_id":"2635b13b-620e-4749-928a-e68e5dd2a5ae","resolution":{"observed_at":"2026-08-07T12:10:08.107981Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.873172Z","title":"NAM+: Towards scalable end-to-end contextual biasing for adaptive ASR,","venue":null,"work_id":"14362644-2af0-4318-bc21-67ad56b4a250","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.286122Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:af7ee133bfc727801888fa40020d1a5e18fd87e0a23428276e3def68bccb14e7","observation_id":"ba8632d8-e878-43ac-9d8a-c466a43c2c1b","resolution":{"observed_at":"2026-08-07T12:10:07.965694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.696240Z","title":"Robust JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 16 acoustic and semantic contextual biasing in neural trans- ducers for speech recognition,","venue":null,"work_id":"6e836863-4cee-4cbe-93be-5d7c074c2111","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.354191Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:c0e925c03d48a0ca95e04cc3dd30475f1d758d67aac1dd47129b4ac3e046a0e3","observation_id":"7c5e6537-bada-4715-885a-e10be976b10f","resolution":{"observed_at":"2026-08-07T12:10:07.756030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.541577Z","title":"Contextualized streaming end-to-end speech recognition with trie-based deep biasing and shallow fusion,","venue":null,"work_id":"269ff309-b68c-488e-b3fa-679020214cb1","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.412402Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:e868bc1e9710e805c5fcf7f3ae68eec1262f2dd555c1510b1fd8a932b6e06d9a","observation_id":"b48b89d5-985c-4cef-9207-3fead8decb60","resolution":{"observed_at":"2026-08-07T12:10:07.622967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.382876Z","title":"Joint grapheme and phoneme embeddings for contextual end-to-end ASR,","venue":null,"work_id":"331ac129-88de-4ec1-966c-0b99698a3c8a","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.442711Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ac02d063a1d08c9cfc900eec89484d41d796a507f31393fcb8d7222c0c5bbc6d","observation_id":"e541cadc-a635-483e-9890-f9297642cfc4","resolution":{"observed_at":"2026-08-07T12:10:07.467810Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:07.165951Z","title":"Phoebe: Pronunciation-aware contextualization for end-to-end speech recognition,","venue":null,"work_id":"985897d9-44e0-4d4e-a69c-8a112fe542bb","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.502307Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:b129e127bccfb8934825a724a61a77ba169ebec030dd4d561b53be1313e9d305","observation_id":"eecf21bb-f178-4ba4-b139-4d5c4c2fac48","resolution":{"observed_at":"2026-08-07T12:10:07.288103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.951080Z","title":"Context-aware transformer transducer for speech recognition,","venue":null,"work_id":"44914d1b-b969-4e33-bee7-2629f9804d1f","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.555725Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:01a8e738a0b7c587e37b150349dd4fe079bee87e2a12ce0f0bcbae4b60bf90e7","observation_id":"b9020583-7c6b-416b-8bce-39d069e9390b","resolution":{"observed_at":"2026-08-07T12:10:07.046443Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.793747Z","title":"Contextual adapters for personalized speech recognition in neural transducers,","venue":null,"work_id":"73d19d29-8088-4f4f-919c-8c6771ed9c5f","year":2022},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.621783Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:ac66e7404db6f3a277994fd9be5a3b160693335e0e8332b2eb5f7be548e954d0","observation_id":"30c7dd88-902f-4fed-946f-a645a16e5442","resolution":{"observed_at":"2026-08-07T12:10:06.862201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.599427Z","title":"Contextualized automatic speech recog- nition with attention-based bias phrase boosted beam search,","venue":null,"work_id":"955db3e0-1d51-4cc3-9fa9-f38ef495c67d","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.673300Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:c66150a97974db0177ff42c5e97ba9283113fa6869f4c2759de63e4acba8c286","observation_id":"431bb925-2adc-49c5-ae84-556ef5458f26","resolution":{"observed_at":"2026-08-07T12:10:06.695090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:06.465068Z","title":"LCB-Net: Long- context biasing for audio-visual speech recognition,","venue":null,"work_id":"8d9b9d40-ffdf-4815-a955-8c2005bf55cf","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.731673Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:56f21176c98f8340119f2143f17872f2eebee9be8f956ac703afeea784f62692","observation_id":"78d49a82-cf8a-4e4a-85fa-1ba5c671a9df","resolution":{"observed_at":"2026-08-07T12:10:06.533002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:05.197094Z","title":"A light-weight contextual spelling correction model for customizing transducer-based speech recognition systems,","venue":null,"work_id":"847ce928-0913-493b-8d51-8b5482fa435b","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.791870Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:2d73b7d004561ade91dd32b360f11fc8b101d068566b7cb101ccb5df3b3d3419","observation_id":"e44ffb73-6b3e-4f5b-8374-c0c7c25a1e53","resolution":{"observed_at":"2026-08-07T12:10:06.398668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:04.256487Z","title":"Contextual modeling for document-level ASR error correction,","venue":null,"work_id":"b542359e-ac22-45b9-b0e7-5ba50573f882","year":2024},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.795723Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:38116240222c82be90604dd03e9ee084c621c80490af3c38da91583b5d794e38","observation_id":"a1b80ee5-6db5-409b-bc8e-d33d508b9a38","resolution":{"observed_at":"2026-08-07T12:10:04.605985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-07T12:09:57.799976Z","title":"Google’s neural machine translation system: Bridging the gap between human and machine transla- tion,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.799976Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:6ce6b6f695b1f07c61067ea8814b9870afc8f481ffb895784956d90aee4a6d97","observation_id":"d26de918-d19e-4c7a-8f2c-bf47120f68b4","resolution":{"observed_at":"2026-08-07T12:09:57.799976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:03.803359Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":"3cd78330-7da3-4211-bb44-51484a6384a9","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:57.876538Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:5133a119dc9679c045499ed7b73537adc0728ca9e9f411374a62937c2f70869c","observation_id":"773f2ee5-dacf-4b3e-91fe-bdf226f3796f","resolution":{"observed_at":"2026-08-07T12:10:03.916007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:03.487562Z","title":"Attention is all you need,","venue":null,"work_id":"5a0a5179-9659-4f1a-93dd-030f0ab978dd","year":2017},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.066167Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:53fcf7cd3f50a4dedeae3cf91702f7f2d766fe8e792e3158d4213254f8419e56","observation_id":"385c6b1b-fcbb-42d5-bff4-045d0616ef01","resolution":{"observed_at":"2026-08-07T12:10:03.622423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:03.191374Z","title":"XPhoneBERT: A pre-trained multilingual model for phoneme representations for text-to-speech,","venue":null,"work_id":"3e18c009-abc1-4c2d-8be8-04d585b779f4","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.223113Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:b7b886c008a9200a52f9e10294c647b7f52cce38be1888c60b7694f8044f26d1","observation_id":"030290e0-6c3b-4079-b45a-7c094466f19d","resolution":{"observed_at":"2026-08-07T12:10:03.335176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.901684Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":"996be152-c6ca-49f9-ba52-953baa5b8ced","year":2015},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.384702Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:001e9613c49df54fd69459822c762768f357e4e7929138960912a8b116141904","observation_id":"6f7da346-6b58-467a-a0b3-15291e0272a3","resolution":{"observed_at":"2026-08-07T12:10:03.067905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.693388Z","title":"Phoneme- BERT: Joint language modelling of phoneme sequence and ASR transcript,","venue":null,"work_id":"daff0938-423b-44a2-840b-a549167c5d38","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.558760Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:28b42ec7a2a1f829ecd03ed9da1dfb53365f3a379c26c96fc999157ca84d55d0","observation_id":"c0eb8ff4-1f65-4906-9c2a-1360b27dfcfa","resolution":{"observed_at":"2026-08-07T12:10:02.804668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.504666Z","title":"Listen, attend and spell: A neural net- work for large vocabulary conversational speech recog- nition,","venue":null,"work_id":"a82a0227-2b40-41c4-b55f-ec8fd8e9f168","year":2016},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.700119Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:0cc5e54839a91ef12d14fa1cb47686edc42a4de3cd73b2c392e5dc89139919b4","observation_id":"bcb3941c-9dce-4b3b-af25-d81af6aaa558","resolution":{"observed_at":"2026-08-07T12:10:02.619361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:02.275947Z","title":"Learning ASR-robust contextualized embeddings for spoken language under- standing,","venue":null,"work_id":"0d419233-b616-45f2-8cc5-5a8ea0f9321c","year":2020},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.868801Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:a1d696e85d3b753c5ada1c63307354fe4ef1dcc70b6c129881f743c7bfeab800","observation_id":"2d9c8ce2-f19e-4ca8-8baf-5c660b662a1b","resolution":{"observed_at":"2026-08-07T12:10:02.377713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.969517Z","title":"The Kaldi speech recognition toolkit,","venue":null,"work_id":"618bd359-a31f-4da3-9c12-def7a81266a5","year":2011},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:58.995741Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:34bd9a56d7e41f2f80977160ffac25ebc06a988fcb1c83e9a8a85df416149267","observation_id":"65194e8d-7309-4d15-a140-a8cbd90c6919","resolution":{"observed_at":"2026-08-07T12:10:02.108163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:09:59.139644Z","title":"LibriSpeech: An ASR corpus based on public domain audio books,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.139644Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:d079c6e5e681abc69619409917e84a61e985019fd7fd25d9d851a5689226a4c1","observation_id":"fc3a365c-4a72-46c8-a135-8ff4744ddc62","resolution":{"observed_at":"2026-08-07T12:09:59.139644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.587588Z","title":"WeNet: Pro- duction oriented streaming and non-streaming end-to-end speech recognition toolkit,","venue":null,"work_id":"dc70763c-aa11-45dc-8970-c9d537def2b7","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.273949Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:53a47ba7128968357755a18851576fe8347417c0a3dfb5a5e6cba7eff2c5ded4","observation_id":"397deb37-405e-47a3-b1e4-2282af85d61a","resolution":{"observed_at":"2026-08-07T12:10:01.801836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.297819Z","title":"End-to-end named entity recognition from english speech,","venue":null,"work_id":"d4089a38-cc5d-4c71-9128-4beb382b803a","year":2020},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.392515Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:209b5d26469ab64a429a3709621792be1121a8e2b349494a2247de68f1a3419c","observation_id":"15503f58-4c14-4e7e-a39e-29ac6b2c62c2","resolution":{"observed_at":"2026-08-07T12:10:01.470161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:01.069732Z","title":"ESPnet: End-to-end speech processing toolkit,","venue":null,"work_id":"a3629989-d37e-47b9-a63f-16e14f77b9ab","year":2018},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.460713Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:e0807408f1414e8647bb5091c73e7038b0b5eae9d2453a80f8606ce855b6248a","observation_id":"67445069-ac20-4ac8-9038-34aea226c645","resolution":{"observed_at":"2026-08-07T12:10:01.183635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.886090Z","title":"Multimodal corpus analysis of autoblog 2020: lecture videos in machine learning,","venue":null,"work_id":"01dee486-cd25-4ea1-9ab8-96596221c291","year":2020},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.548179Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:5784e62b3824834f3c0561b6a2657529174663f04e733bda26e02cd3966c7944","observation_id":"80b05360-a624-4d6c-a359-7af441e8cdaa","resolution":{"observed_at":"2026-08-07T12:10:00.960115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.04624","last_updated":"2021-06-08T18:22:56Z","snapshot_observed_at":"2026-08-14T05:20:02.331354Z","submitted_at":"2021-06-08T18:22:56Z","title":"SpeechBrain: A General-Purpose Speech Toolkit","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.04624","snapshot_observed_at":"2026-08-07T12:09:59.651665Z","title":"SpeechBrain: A general-purpose speech toolkit,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.651665Z"},"links":{"cited_paper":"/paper/2106.04624","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:4313854a848060a1bab99a30d4a8d3713d407afd6228ca0c4f64201ff8cac9dd","observation_id":"8f580526-bd99-4d0e-a2fa-353338163af2","resolution":{"observed_at":"2026-08-07T12:09:59.651665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.720640Z","title":"BART based semantic correction for Mandarin auto- matic speech recognition system,","venue":null,"work_id":"6412b208-b742-4130-93cb-5c7ff7e96563","year":2021},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.777769Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:c669fe0b2900cd51e91e7453f4e5349ccb306ed61b52d1c8a6f3e5c251d8d27b","observation_id":"131cc46b-f282-42ad-b172-f0a9b886f988","resolution":{"observed_at":"2026-08-07T12:10:00.796798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13002","last_updated":"2020-10-28T04:47:59Z","snapshot_observed_at":"2026-08-10T23:17:13.735566Z","submitted_at":"2020-10-24T23:15:43Z","title":"Pre-trained Summarization Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13002","snapshot_observed_at":"2026-08-07T12:09:59.880897Z","title":"Pre-trained summarization distillation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.880897Z"},"links":{"cited_paper":"/paper/2010.13002","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:2baa8e46385ce0d13ae7412419612b96256b051541a9122c824d34bb360977b8","observation_id":"02294ade-0622-47e8-8e3f-00f6aaaadeef","resolution":{"observed_at":"2026-08-07T12:09:59.880897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.553383Z","title":"Language models are unsupervised multitask learners,","venue":null,"work_id":"f9335c96-1c0f-464e-bfb5-6183f5ddbcb8","year":2019},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:09:59.982285Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:781e3712166f5e1ff7cea5cffb2bee62f2234ec630e7427f99e5faa166ee9c92","observation_id":"13c16aed-3391-465f-8d53-3a9ef908e7f3","resolution":{"observed_at":"2026-08-07T12:10:00.634610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:10:00.368375Z","title":"Whispering LLaMa: A cross-modal generative error correction framework for speech recognition,","venue":null,"work_id":"28feb9f9-7152-487f-b422-d708512aa741","year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:10:00.093377Z"},"links":{"citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:6ac38224375deb41bde9c4ef07e7e949450a5d799b0810027e47565e810df06a","observation_id":"1d311449-8541-4fe4-99b9-1a802f4c38f2","resolution":{"observed_at":"2026-08-07T12:10:00.422771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:10:00.192129Z","title":"LLaMa: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:10:00.192129Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.11064"},"observation_digest":"sha256:86381e2777f76d859da0575a8409810942d767b6c509d555a5b9cb112a1dbd69","observation_id":"eaf7e625-a27d-4df6-aa27-bf3f2c2a7460","resolution":{"observed_at":"2026-08-07T12:10:00.192129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11064","last_updated":"2025-05-31T08:18:34Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-13T15:14:00.309669Z","submitted_at":"2025-05-31T08:18:34Z","title":"PMF-CEC: Phoneme-augmented Multimodal Fusion for Context-aware ASR Error Correction with Error-specific Selective Decoding"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":56},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2506.11064."}