{"as_of":"2026-08-23T11:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:460d9e12a081f3489849c9520980d6f39605e6855ea77a9dc25113cfdd2a9720","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T20:25:33.127942Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06831/citation-record","integrity":"/paper/2607.06831/integrity","json":"/paper/2607.06831/citation-record.json","paper":"/paper/2607.06831"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.748261Z","title":"The application of hidden Markov models in speech recognition,","venue":null,"work_id":"287e4ad3-d7b8-46fb-9154-426cceaa4441","year":2008},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:c7c34cb47d78811d4f75ac000710fe1b853444f41390c43cd77e8e3d479bd7f6","observation_id":"d966a59c-cd8c-476f-a0b9-3b35211818d5","resolution":{"observed_at":"2026-07-10T20:27:36.749417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.731058Z","title":"A tutorial on hidden Markov models and selected applications in speech recognition,","venue":null,"work_id":"666af909-490d-4eb8-9c6e-996ed6863b15","year":1989},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:9ea2c515672d609cc73c89eb6a98a27182e82ab6877ac2cefe0db5ca3ac8fcf3","observation_id":"d45345d8-d7fe-4b76-9a97-2b18a0f7cf52","resolution":{"observed_at":"2026-07-10T20:27:36.732459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.744776Z","title":"Montreal Forced Aligner: Trainable text-speech alignment using Kaldi,","venue":null,"work_id":"491e97e6-eea2-489f-be90-aa6794438fa8","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:f5a5186311bef4da0729c829cd7dd94e91e2b602964c20afe7e483aa6209a043","observation_id":"aeb462a3-2d33-4f03-b2df-157037d21e14","resolution":{"observed_at":"2026-07-10T20:27:36.745973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.746558Z","title":"Less peaky and more accurate CTC forced alignment by label priors,","venue":null,"work_id":"d099b94e-fd89-4e52-ac39-40a47491c8c8","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:6c81289efaa5922fbe82b8e7069a2effcb9505806c3ceee16fa8cbb01a0e9ecd","observation_id":"6f3e1311-fec4-47c0-93b7-664107fb0ff3","resolution":{"observed_at":"2026-07-10T20:27:36.747709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.724873Z","title":"Tradition or inno- vation: A comparison of modern asr methods for forced alignment,","venue":null,"work_id":"a1201e26-d279-46e2-a1e6-ad0de6e11049","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:bf4fdbccbf95f803dd5d4bed4677fa92015906429f559e03761755d87a113b7f","observation_id":"50d9969e-337f-4be5-8045-927e882fac6d","resolution":{"observed_at":"2026-07-10T20:27:36.726454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.741182Z","title":"End-to-end speech recognition: A survey,","venue":null,"work_id":"a8d57227-0fc2-46d2-9043-d9c95ae3866d","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:a6fa1c3f65f559433a11552c009954ac4bd87c2314b9fe99ef34ae47200a77e6","observation_id":"810712ad-b30a-4540-a290-e964861f9a83","resolution":{"observed_at":"2026-07-10T20:27:36.742389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.732992Z","title":"Connection- ist temporal classification: labelling unsegmented sequence data with recurrent neural networks,","venue":null,"work_id":"361a3f24-73a3-4f03-b53f-87a74c7c2373","year":2006},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:44b6eaf2893478a93d85c3fd5fd45bbb2e81867ab0ddf1c2360ddd106e9d076c","observation_id":"857bdb36-5b2c-4174-a6c7-da2b75041ccf","resolution":{"observed_at":"2026-07-10T20:27:36.734322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1211.3711","last_updated":"2012-11-14T19:25:21Z","snapshot_observed_at":"2026-08-15T00:39:21.296689Z","submitted_at":"2012-11-14T19:25:21Z","title":"Sequence Transduction with Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":"1211.3711","doi":"10.48550/arxiv.1211.3711","metadata_source":"pith","pith_arxiv_id":"1211.3711","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Sequence Transduction with Recurrent Neural Networks","venue":"cs.NE","work_id":"4553c1f9-9627-48f1-bcb4-69ce67d2ad80","year":2012},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/1211.3711","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:9063e4c4c54fa2407eda7d3ea3c32aa77c148d2b4531debdfde7feb80a1ab82c","observation_id":"c54e7385-2112-4562-ae87-af83100b8fae","resolution":{"observed_at":"2026-07-10T20:27:36.593477Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.759019Z","title":"Attention-based models for speech recognition,","venue":null,"work_id":"b0a0cb06-aaa1-4b73-a8de-d1fc46f22d25","year":2015},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:803157e01003ba41a999253a182ea8a5cfe52065631ff99eb14021c576fafd0e","observation_id":"f47e5bcf-50fd-4cae-9ac1-d048fd931d7a","resolution":{"observed_at":"2026-07-10T20:27:36.760103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.757308Z","title":"Listen, attend and spell: A neural network for large vocabulary conversational speech recognition,","venue":null,"work_id":"ccf62408-c35b-49b6-bc1d-df48d0156977","year":2016},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:bb9ca24e0a7ae50e9625480a1ade2e54d7ad2d1e92f75157247a133b459fec30","observation_id":"3a4df90a-b69d-4449-939a-776b5f7ec512","resolution":{"observed_at":"2026-07-10T20:27:36.758483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.735069Z","title":"Improved training of end-to- end attention models for speech recognition,","venue":null,"work_id":"bc9648d9-98b0-4b84-b984-8560af48772e","year":2018},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:785358174ddc9b56432d0d53a7130e46927d657bed250181d06724a64f7a57c6","observation_id":"68e4eecd-db03-4145-b76c-bb713c403e0d","resolution":{"observed_at":"2026-07-10T20:27:36.736486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.727101Z","title":"SpeechGPT: Empowering large language models with intrinsic cross-modal conversational abilities,","venue":null,"work_id":"882ec02b-7d10-412c-8b99-1142bd1ff2ba","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:33241c81d5455079dc7c69f8bf0d0ecf87520d980d695925cc7cffec28294df8","observation_id":"9c46d745-96f8-469c-91f5-b5f7f68023dc","resolution":{"observed_at":"2026-07-10T20:27:36.728620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:bf41b5f501d6aab54c681937e1cb700eeade16854cd9d5591809916a68c16e7c","observation_id":"7ce561c0-0674-4ab2-b590-4b95fa456615","resolution":{"observed_at":"2026-07-10T20:27:36.581542Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2603.15045","last_updated":"2026-07-07T07:07:08Z","snapshot_observed_at":"2026-08-09T22:36:02.204265Z","submitted_at":"2026-03-16T09:57:06Z","title":"LLMs and Speech: Integration vs. Combination","version":3},"cited_work":{"arxiv_id":"2603.15045","doi":null,"metadata_source":"pith","pith_arxiv_id":"2603.15045","snapshot_observed_at":"2026-07-10T20:27:36.586362Z","title":"LLMs and Speech: Integration vs. Combination","venue":"eess.AS","work_id":"b0692ac2-491b-450a-b8fa-698b22b6dacc","year":2026},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2603.15045","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:95e3a140164fcb23078ab1a3561b904d7a1632cc2519d09333ad7714de568793","observation_id":"399b1390-7481-4696-a009-023215cc1122","resolution":{"observed_at":"2026-07-10T20:27:36.588062Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.780517Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"322d1e1e-90a5-43d7-967c-77e55461030f","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:98ab7d166f7233daaca45ccdd67c955195d1eedf6a06efe35fc734bf96c830f1","observation_id":"ae15985d-1df6-4eb3-bf05-092468164318","resolution":{"observed_at":"2026-07-10T20:27:36.781600Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.753652Z","title":"WhisperX: Time-accurate speech transcription of long-form audio,","venue":null,"work_id":"b42cf93b-bc16-4316-98b3-46e0ebae8231","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:133e4b5767bf67ab788a14ff439d3ff437649e60b1f665f8516e8d92d90aee2e","observation_id":"60c69c61-7a2a-4850-a787-41f8ad045c9d","resolution":{"observed_at":"2026-07-10T20:27:36.754796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.791214Z","title":"CrisperWhisper: Accurate timestamps on verbatim speech transcriptions,","venue":null,"work_id":"e3af4c17-1ae3-4195-a528-912c1976717f","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:8fd9b706e2638524de2f89d9704b48c4dffc880fdfd8b664ae2f24d522d4606b","observation_id":"b199a002-115e-49f6-bdbb-7ae779d26b93","resolution":{"observed_at":"2026-07-10T20:27:36.792339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.787540Z","title":"Whisper has an internal word aligner,","venue":null,"work_id":"2859b057-746b-4e7f-ac87-6fcde9077245","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:5c6012a24ffebe755354a9467b92ad457b7ca8bad076fd2c463a9ab00790c6e2","observation_id":"f96fb2a6-db40-4145-a810-8a5fed11c603","resolution":{"observed_at":"2026-07-10T20:27:36.788911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19723","last_updated":"2024-10-18T11:54:14Z","snapshot_observed_at":"2026-08-19T20:17:42.213756Z","submitted_at":"2024-04-30T17:17:07Z","title":"Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech","version":2},"cited_work":{"arxiv_id":"2404.19723","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.19723","snapshot_observed_at":"2026-07-10T20:27:36.603669Z","title":"Attention-Constrained Inference for Robust Decoder-Only Text-to-Speech","venue":"eess.AS","work_id":"406bd3da-5b43-425e-be1c-d6690b475e40","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2404.19723","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:442761423bbaca87b601e25aa213ed6eac8d3b770190a6e4ecbd6ae185abc4dd","observation_id":"fb35d85a-b9c4-4f0e-98b6-f83dc377ac08","resolution":{"observed_at":"2026-07-10T20:27:36.605092Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31432","last_updated":"2026-05-29T15:27:26Z","snapshot_observed_at":"2026-08-12T14:19:48.428951Z","submitted_at":"2026-05-29T15:27:26Z","title":"DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs","version":1},"cited_work":{"arxiv_id":"2605.31432","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.31432","snapshot_observed_at":"2026-07-10T20:27:36.583253Z","title":"DOA: Training-Free Decoder-Only Attention Policy for Long-Form Simultaneous Translation with SpeechLLMs","venue":"cs.CL","work_id":"3ce6d94b-d015-4fad-93f8-48ef7d5235a6","year":2026},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2605.31432","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:8503b3f915f975a0b6dd8e06a4abe681adb99b324ff833b16e779449997816a2","observation_id":"db745102-9d9f-4963-8f66-cf92f78b966d","resolution":{"observed_at":"2026-07-10T20:27:36.584712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.18220","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.597298Z","title":"Available: https://arxiv.org/abs/2601.18220","venue":null,"work_id":"b6812bc0-16d1-443f-a8ad-8ef9e5c81882","year":2026},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:af605d0457ae15e94f2b918cb8639e0f92eeb1be10728d7313d5cd158b2040f7","observation_id":"8fa22560-df82-4b40-b451-dfd3f57a013f","resolution":{"observed_at":"2026-07-10T20:27:36.599158Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6034","last_updated":"2014-04-19T11:54:52Z","snapshot_observed_at":"2026-08-17T14:45:30.096775Z","submitted_at":"2013-12-20T16:45:54Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","version":2},"cited_work":{"arxiv_id":"1312.6034","doi":"10.48550/arxiv.1312.6034","metadata_source":"pith","pith_arxiv_id":"1312.6034","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Deep Inside Convolutional Networks: Visualising Image Classification Models and Saliency Maps","venue":"cs.CV","work_id":"4b5c8148-382f-461b-8caf-6da2a9acbef5","year":2013},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/1312.6034","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:60349d7194ab9776f4d6c5abd7d96593ba4d0aa17ab9383b5b89c3cbc303759a","observation_id":"46faea88-3537-461b-89de-0bdc9534c20e","resolution":{"observed_at":"2026-07-10T20:27:36.610300Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04521","last_updated":"2025-01-09T09:28:37Z","snapshot_observed_at":"2026-08-19T03:05:24.440114Z","submitted_at":"2025-01-08T14:14:19Z","title":"Right Label Context in End-to-End Training of Time-Synchronous ASR Models","version":2},"cited_work":{"arxiv_id":"2501.04521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.04521","snapshot_observed_at":"2026-07-10T20:27:36.589504Z","title":"Right Label Context in End-to-End Training of Time-Synchronous ASR Models","venue":"cs.SD","work_id":"7782d72d-8752-48e0-b4eb-1ddb9f6776c6","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2501.04521","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:ba16b228493c18b1676e92e13c957463fa8b0d0dbfbdf624568291f459e72009","observation_id":"b5413ae3-61ac-42fb-8423-5534e301fb5b","resolution":{"observed_at":"2026-07-10T20:27:36.590845Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.755370Z","title":"Saliency-driven word alignment interpretation for neural machine translation,","venue":null,"work_id":"621e16fe-1a50-4b01-aed4-6de426cee9fa","year":2019},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:96eb996e48a95a60c5ff5735cf24f4c16af92c03d27c6fafbc174188624d704e","observation_id":"14c126d0-ee23-44f9-996c-8862d3fdc5e3","resolution":{"observed_at":"2026-07-10T20:27:36.756579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.785710Z","title":"Joint CTC/attention decoding for end-to-end speech recognition,","venue":null,"work_id":"51c0858e-c564-474d-a809-9f922a33220d","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:d90327a3ff39147ba6a2bddb9f487b24aa0c3605755509c1fa5c64f7e083fe44","observation_id":"80b417cf-69a4-4c7a-8385-efd91f5a14d2","resolution":{"observed_at":"2026-07-10T20:27:36.786985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.783846Z","title":"Scaling speech tech- nology to 1,000+ languages,","venue":null,"work_id":"99bbb3e2-fb39-483c-ab8d-28ff7228bd18","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:c1bb3e38710847cbe8174fc7d35b76fa7faf57f609593d395cbef2e47bb72c76","observation_id":"2b14ce76-a4ce-442e-a644-f717c54a511d","resolution":{"observed_at":"2026-07-10T20:27:36.785158Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.722646Z","title":"TorchAudio 2.1: Advancing speech recognition, self-supervised learning, and audio processing components for PyTorch,","venue":null,"work_id":"95b30d7b-6a66-4820-acad-8a8db2315465","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:0ba05218655c4d1f0f7b41ece14f279b8b44555a714c2083e40b118809de3601","observation_id":"141c56c5-d111-482b-ad7d-12872cc90159","resolution":{"observed_at":"2026-07-10T20:27:36.724159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.764453Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"95597efd-e3f2-46b8-8e97-4bf7aada8356","year":2020},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:be082dbe2c7d5b7f5718dcaab7be000129a5a4969e4bfb7180b6f9a1752026e1","observation_id":"7e474b36-d535-4835-af3f-56cce3229774","resolution":{"observed_at":"2026-07-10T20:27:36.765630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.768081Z","title":"Automatic phoneme recognition on TIMIT dataset with Wav2Vec 2.0,","venue":null,"work_id":"167526ea-c28e-49d0-a241-8d584cbd4828","year":2022},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:33495e0aa8921c1d7f1e678b3989b5922fb8280e1380c37d6ec05fdc3f618948","observation_id":"909c4e4a-76a3-4b23-afcd-9256897df7fd","resolution":{"observed_at":"2026-07-10T20:27:36.769218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.775374Z","title":"XLS-R: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":"9e566d81-0bbf-4752-8a84-84281c8486f7","year":2022},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:f8b8a6b9ba0d9761e92177594c40084366ad6e810977fb1bcd2a8532ee3c57dc","observation_id":"faa55225-00b2-46c4-bc19-88ece0e60d4c","resolution":{"observed_at":"2026-07-10T20:27:36.776543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.782113Z","title":"Fast conformer with linearly scalable attention for efficient speech recognition,","venue":null,"work_id":"0ac91775-5d15-4e09-bc66-35f6450f454d","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:34506700df238633ec893ef399da8a4b49241b15a5e28ae696823e51dc0acaef","observation_id":"f8a77ee5-878e-41e4-9de1-0f4b186747bb","resolution":{"observed_at":"2026-07-10T20:27:36.783272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.789461Z","title":"OWSM v4: Improving open whisper-style speech models via data scaling and cleaning,","venue":null,"work_id":"9e11ca6c-4e6a-40af-9bd6-c115fab9580b","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:b99acfc2c672a67218b4d31ad4331f7f7c6cd647493f44ef3d004066f61f73dd","observation_id":"e61fd5aa-ba69-4030-87ff-2ca320b7a803","resolution":{"observed_at":"2026-07-10T20:27:36.790646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.766191Z","title":"OWSM-CTC: An open encoder-only speech foundation model for speech recognition, translation, and language identification,","venue":null,"work_id":"76699e3f-2cb0-4c88-84c1-76a7501a152c","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:0fc019bf2311e0188f6973a0d7cac846bd8bf1ce135c35be29a64d6bc96ee5c6","observation_id":"192f1e8d-8680-45ed-9418-f3228e4196ea","resolution":{"observed_at":"2026-07-10T20:27:36.767507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.769760Z","title":"Stateful conformer with cache-based inference for streaming automatic speech recognition,","venue":null,"work_id":"03285169-fed5-4bfd-a1a1-6baa70a55175","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:d23eb660590fd483d56eeb14974d5334ba5ad5620ee5c823bfb50a5e802f6d86","observation_id":"a9eaa9a3-1064-4281-b3d4-2894d73a38a3","resolution":{"observed_at":"2026-07-10T20:27:36.770999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.762563Z","title":"Efficient sequence transduction by jointly predicting tokens and durations,","venue":null,"work_id":"1c024f3e-4c99-4a6e-a752-a1d958082ea9","year":2023},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:e6a5b5b848abb96b1532013f4c6f7de02c32b53282143a2283a69b6d705a0c80","observation_id":"6c777291-1348-41e2-85d0-09d8e82d52cf","resolution":{"observed_at":"2026-07-10T20:27:36.763726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.751881Z","title":"Emformer: Efficient memory transformer based acoustic model for low latency streaming speech recognition,","venue":null,"work_id":"efb54f6b-13ce-4424-90db-e235cbb30052","year":2021},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:19e14b8d9da17be2de451fa8ab5f6e38e24c544286c87e505ac71f47a7fc31eb","observation_id":"2b966bde-edd6-4365-83b5-d13f50453e29","resolution":{"observed_at":"2026-07-10T20:27:36.753093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.777122Z","title":"TorchAudio: Building blocks for audio and speech processing,","venue":null,"work_id":"346e7e5e-43ba-449a-8277-60bbf2c6d736","year":2022},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:4952d676963b74d04777ea0a79551e403a3e755de0c48bd3201fdfd1be78b7e2","observation_id":"bfa1780e-6102-4e67-b507-77b61a9746c3","resolution":{"observed_at":"2026-07-10T20:27:36.778265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.760822Z","title":"OWLS: Scaling laws for multilingual speech recognition and translation models,","venue":null,"work_id":"3ee63782-6d5a-4d29-bce8-a697a5774358","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:544d8e798c6aef776ba4f1b6a3f0fb584f5cc890496d394be9dd8173a475275e","observation_id":"8d6223ec-4015-456d-ad38-511db9c02f77","resolution":{"observed_at":"2026-07-10T20:27:36.762010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13264","last_updated":"2025-07-17T16:17:37Z","snapshot_observed_at":"2026-08-13T21:23:10.892449Z","submitted_at":"2025-07-17T16:17:37Z","title":"Voxtral","version":1},"cited_work":{"arxiv_id":"2507.13264","doi":"10.48550/arxiv.2507.13264","metadata_source":"pith","pith_arxiv_id":"2507.13264","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"V oxtral","venue":"cs.SD","work_id":"d8af79fd-31af-429f-b7c7-b98cea5e46ed","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2507.13264","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:08938ef71fa2a16fa0a5aab71124789f90db81896ada1222ea9acc9fc11d5497","observation_id":"3db9f10c-f72e-4a63-802f-e476e6864eec","resolution":{"observed_at":"2026-07-10T20:27:36.607654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-15T22:57:45.773661Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":"2503.01743","doi":"10.18653/v1/2023.wmt-1.23","metadata_source":"pith","pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","venue":"cs.CL","work_id":"83956045-536a-41ff-af02-b80e2a614eab","year":2025},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:67584536342780792282ce6489fe4a5306a8e2e518994af9038e84c206fa1324","observation_id":"0f200d49-b50b-44bd-b3c5-d4edadfefd4d","resolution":{"observed_at":"2026-07-10T20:27:36.602301Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.739063Z","title":"Less is more: Accurate speech recognition & translation without web-scale data,","venue":null,"work_id":"c8969a30-0e8f-4376-b63d-8438a2f9a8fe","year":2024},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:b2ec63b9a34c16b7fd99ee74d1755274e306499178569090e0abb6dda85ade04","observation_id":"2d604f11-08f7-4c62-86ce-c490b9e6441f","resolution":{"observed_at":"2026-07-10T20:27:36.740428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.778820Z","title":"TIMIT acoustic-phonetic continuous speech corpus,","venue":null,"work_id":"276a9d17-171d-4a09-b033-6d54ac1714cb","year":1993},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:d7f1712ec0610961bfa1a50cdede1181671e1a4773097bc2d4e8c8a5058b7822","observation_id":"5f231df0-a75d-4f6e-885a-dee428eb86c7","resolution":{"observed_at":"2026-07-10T20:27:36.779980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.742927Z","title":"The Buckeye corpus of conversational speech: Labeling conventions and a test of transcriber reliability,","venue":null,"work_id":"a382af78-b446-4205-a320-a2335b7612e9","year":2005},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:ee328538aeb9bde3b7a9ae1e0921d0cbb91d998b283442a5c7513e62f06c73a0","observation_id":"84564faf-fd3a-448e-abb3-4dfb050d909e","resolution":{"observed_at":"2026-07-10T20:27:36.744190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.737190Z","title":"Learning important features through propagating activation differences,","venue":null,"work_id":"12c11178-cf2b-435a-8e22-1c479062cb4b","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:8977ea1bddecdefde6415d5e0548eb864c4cda2eb1f5a9d5a9bc26d070de2115","observation_id":"cc9ab90d-6d58-4ff2-8ea6-9c477c6d02dd","resolution":{"observed_at":"2026-07-10T20:27:36.738421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.749986Z","title":"Towards better understanding of gradient-based attribution methods for deep neural networks,","venue":null,"work_id":"e7d8517b-ee00-4603-9087-cfbf877dc797","year":2018},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:d90af4c115ba07c82e713956796b31f462c523891ec8ef881a330ec5906ba102","observation_id":"d7e1feb3-8b81-4716-a2eb-1b8bbd2bf388","resolution":{"observed_at":"2026-07-10T20:27:36.751310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03825","last_updated":"2017-06-12T19:53:30Z","snapshot_observed_at":"2026-08-21T17:36:12.443942Z","submitted_at":"2017-06-12T19:53:30Z","title":"SmoothGrad: removing noise by adding noise","version":1},"cited_work":{"arxiv_id":"1706.03825","doi":"10.48550/arxiv.1706.03825","metadata_source":"pith","pith_arxiv_id":"1706.03825","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SmoothGrad: removing noise by adding noise","venue":"cs.LG","work_id":"9fe7734e-4726-441f-abc1-88bbce75815c","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"cited_paper":"/paper/1706.03825","citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:bac95a28a5df7d01defe2da9de04481e820eb888627b34bd079f5a4c84a4afa7","observation_id":"2290b8b4-2ec2-4619-9cca-56ae8b26d3dc","resolution":{"observed_at":"2026-07-10T20:27:36.596077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.771544Z","title":"Sanity checks for saliency maps,","venue":null,"work_id":"6002cd4a-31bf-42ae-a046-f0422c278d79","year":null},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:f9689afe765b9a073f0c38140bd257552d3a5e65f86f37a54f77fd69b85b8795","observation_id":"5ba70317-85aa-43c0-a86f-3db544ec09e8","resolution":{"observed_at":"2026-07-10T20:27:36.772994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.792876Z","title":"Available: https://proceedings.neurips.cc/paper files/ paper/2018/file/294a8ed24b1ad22ec2e7efea049b8737-Paper.pdf","venue":null,"work_id":"832aea5c-ed79-4d21-a900-3f5be9053ec8","year":2018},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:47bb36e0434a3b17494e662b570fa901a40f1f637cfac554a6d06c2b81997c9b","observation_id":"41457776-1484-4b60-adca-67d6ee3eee18","resolution":{"observed_at":"2026-07-10T20:27:36.794010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.729255Z","title":"Axiomatic attribution for deep networks,","venue":null,"work_id":"ed84816f-db48-4850-b644-367e423ae7fe","year":2017},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:119fe750efaf7f93436a359ac38c8a9a0af4100572d8a794086cb90af2f6d03b","observation_id":"c0fb4029-8cc0-4385-9891-18f15ccd52b5","resolution":{"observed_at":"2026-07-10T20:27:36.730491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T20:27:36.773596Z","title":"Improving performance of deep learning models with axiomatic attribution priors and expected gradients,","venue":null,"work_id":"c6a61a4d-4405-49a9-8a75-a354d72baa48","year":2021},"citing_paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-10T20:25:33.127942Z"},"links":{"citing_paper":"/paper/2607.06831"},"observation_digest":"sha256:6049baa4364885f8209c70c7a27012118db0dd0dbe6b2acf367aef99f1edd4c7","observation_id":"bb1834f8-f027-4183-b870-7fb7c94926f4","resolution":{"observed_at":"2026-07-10T20:27:36.774812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06831","last_updated":"2026-07-07T21:57:54Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T21:57:27.056849Z","submitted_at":"2026-07-07T21:57:54Z","title":"Gradient-Based Speech-to-Text Alignment for Any ASR Model: From CTC to Speech LLMs"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":39},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2607.06831."}