{"as_of":"2026-08-10T05:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b74195d160f3d25dc9eb6314d802da9e2495365ae2d2ee0ab767e357e73da517","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:34:09.446488Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.17019/citation-record","integrity":"/paper/2506.17019/integrity","json":"/paper/2506.17019/citation-record.json","paper":"/paper/2506.17019"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-06T23:34:06.447360Z","title":"arXiv preprint arXiv:2503.01743","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.447360Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:6e08aab90e9477e861ea8f2790a56596f087c7d7fef81293877179edc05de168","observation_id":"f723c553-dd42-4d7d-b2bf-1f1b8bea7139","resolution":{"observed_at":"2026-08-06T23:34:06.447360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:06.624600Z","title":"arXiv preprint arXiv:2503.10620","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.624600Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:c97724a721e07138a9a1a7faee810d5dcfa25c3a27854887b076d7e3a62811e6","observation_id":"88e5864e-a2e5-4be5-a0b6-af6a54601ce3","resolution":{"observed_at":"2026-08-06T23:34:06.624600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10759","last_updated":"2024-07-15T14:38:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T14:38:09Z","title":"Qwen2-Audio Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10759","snapshot_observed_at":"2026-08-06T23:34:06.960891Z","title":"arXiv preprint arXiv:2407.10759","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.960891Z"},"links":{"cited_paper":"/paper/2407.10759","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:34de8d478fdda016b05583b5e5a461da36bd0b6245733b0072a8137b7fe34420","observation_id":"7e6a1902-06e1-4559-98fb-e208df2133fc","resolution":{"observed_at":"2026-08-06T23:34:06.960891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T23:34:07.072917Z","title":"arXiv preprint arXiv:2311.07919","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.072917Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:589849e1f31e0d66030d85fccb52c848b7d776cdd4a00606444d620d5e5c1f6d","observation_id":"483e7c21-5dfc-4b52-bfac-70f87284c879","resolution":{"observed_at":"2026-08-06T23:34:07.072917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:11.117562Z","title":"In 2022 IEEE Spoken Language Technology Workshop (SLT), pages 798–805","venue":null,"work_id":"0e02cdc9-7a74-4e5f-86aa-7c5fac0f10ad","year":2022},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.129512Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:6d3985fb2d27d8581c1e4163862d96b8628a6400de1b5ac888b2f85ea469b64e","observation_id":"a3ff050c-a152-471c-940b-a48d59925cba","resolution":{"observed_at":"2026-08-06T23:34:11.169768Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-06T23:34:07.278388Z","title":"arXiv preprint arXiv:2409.17146","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.278388Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:e240969a852371cbd6947c464878fb9a5ae5569d0fae5a2ccf4f43087d885c43","observation_id":"3e69669d-9fc9-4cac-bb93-3d48cdd6be69","resolution":{"observed_at":"2026-08-06T23:34:07.278388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-06T23:34:07.562021Z","title":"arXiv preprint arXiv:2408.00118","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.562021Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:6759e5407f8e1f51f1c1ce73f35f63cb6542d0792aead82fdc56cd5fc1514f8b","observation_id":"6dcc4476-94e2-48e5-b951-dbf7ab1d4ac7","resolution":{"observed_at":"2026-08-06T23:34:07.562021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T23:34:07.676909Z","title":"arXiv preprint arXiv:2407.21783","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.676909Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:73ee0778efe677abd634a369e7e51a3aa34a6c2c9f7b422dea12b3c11bb3b084","observation_id":"36ee1ed8-a703-4db4-8cbf-4966191d8a52","resolution":{"observed_at":"2026-08-06T23:34:07.676909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.978126Z","title":"In Findings of the Asso- ciation for Computational Linguistics: EMNLP 2024, pages 4552–4572, Miami, Florida, USA","venue":null,"work_id":"e267a3d0-e41a-4d0a-a80e-9f5e01600797","year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.937565Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:2b165d2ecccbc4b2190dad5ea97884dcb841a02df701b9951ac0c6ebb97a4ac8","observation_id":"c7cc3634-92b5-4eea-86da-8264703a0e80","resolution":{"observed_at":"2026-08-06T23:34:11.046606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.13585","last_updated":"2023-12-21T05:32:49Z","snapshot_observed_at":"2026-08-09T02:04:31.523385Z","submitted_at":"2023-12-21T05:32:49Z","title":"Speech Translation with Large Language Models: An Industrial Practice","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.13585","snapshot_observed_at":"2026-08-06T23:34:08.081674Z","title":"arXiv preprint arXiv:2312.13585","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.081674Z"},"links":{"cited_paper":"/paper/2312.13585","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:c52ca0630c37dc7c7bea4ef1060bd2fb3fd7d6cafe65f93487bd26af961ebaa4","observation_id":"d1bc3b29-c5cb-4d4e-9183-02054e959fba","resolution":{"observed_at":"2026-08-06T23:34:08.081674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.635026Z","title":"In ICASSP 2024-2024 IEEE Inter- national Conference on Acoustics, Speech and Signal Processing (ICASSP), pages 13326–13330","venue":null,"work_id":"8d07482a-406c-4ebb-8f83-dda9e0d80a2d","year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.247414Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:243bab0b3de87990138955875cf53abf4059a1a4c35858814fbb7b727b70300d","observation_id":"c2cc3502-ee96-4697-b803-f288712f68e8","resolution":{"observed_at":"2026-08-06T23:34:10.732535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.16235","last_updated":"2024-09-24T16:51:36Z","snapshot_observed_at":"2026-07-06T19:21:20.826877Z","submitted_at":"2024-09-24T16:51:36Z","title":"EuroLLM: Multilingual Language Models for Europe","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.16235","snapshot_observed_at":"2026-08-06T23:34:08.333794Z","title":"Preprint, arXiv:2409.16235","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.333794Z"},"links":{"cited_paper":"/paper/2409.16235","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:fd6831118f9b6c4ae06528724c995650df101d14a29008165770b813a2a3dbec","observation_id":"912abaa8-18dd-420b-b3a2-6c4210d234ec","resolution":{"observed_at":"2026-08-06T23:34:08.333794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.209260Z","title":null,"venue":null,"work_id":"bdca4107-5de1-4777-bc16-ee0446a51d22","year":2020},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.694602Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:7e30686d0f8be11235e941f67634630b69bdeae9757a6f28f49e60947971e988","observation_id":"52b9ffae-d251-4592-8138-9f2843071aff","resolution":{"observed_at":"2026-08-06T23:34:10.304258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:09.994463Z","title":"In Proceedings of the Seventh Conference on Machine Translation (WMT) , pages 634–645, Abu Dhabi, United Arab Emirates (Hybrid)","venue":null,"work_id":"ce19ba77-ef8e-463a-9758-d5abf7c0bdd3","year":2022},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.823192Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:58fceae70621cd5c3c4683b2fe6fa42ff0f1190bf95c5afda46b32a18dd40b86","observation_id":"8be90602-4665-47d1-9e30-66dedbaac60b","resolution":{"observed_at":"2026-08-06T23:34:10.105964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-06T23:34:08.892983Z","title":"arXiv preprint arXiv:2306.12925","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.892983Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:3bf8667effeb6b76e1ab922a821bee682422ad79bdecda8962f40cfce99817d6","observation_id":"3769e255-2bcd-4641-a8d3-7107add7efd4","resolution":{"observed_at":"2026-08-06T23:34:08.892983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-06T23:34:08.989599Z","title":"arXiv preprint arXiv:2310.13289","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.989599Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:860c385b8762eef1623f618b3d3f5ea437dc413519949ec0c82218cf08dce097","observation_id":"ee251e65-6943-49ba-b351-b7e7d8353639","resolution":{"observed_at":"2026-08-06T23:34:08.989599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00390","last_updated":"2021-07-27T04:04:57Z","snapshot_observed_at":"2026-08-09T19:09:23.880235Z","submitted_at":"2021-01-02T07:24:21Z","title":"VoxPopuli: A Large-Scale Multilingual Speech Corpus for Representation Learning, Semi-Supervised Learning and Interpretation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00390","snapshot_observed_at":"2026-08-06T23:34:09.173525Z","title":"Preprint, arXiv:2101.00390","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:09.173525Z"},"links":{"cited_paper":"/paper/2101.00390","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:1cddd90abe87673b27793280a8b3adf1ce60922026e052e94df6d21223413176","observation_id":"9d90560f-7ae2-47ac-a5cf-b99fa37eaee7","resolution":{"observed_at":"2026-08-06T23:34:09.173525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.10310","last_updated":"2020-10-24T06:07:01Z","snapshot_observed_at":"2026-08-09T21:19:30.065131Z","submitted_at":"2020-07-20T17:53:35Z","title":"CoVoST 2 and Massively Multilingual Speech-to-Text Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.10310","snapshot_observed_at":"2026-08-06T23:34:09.324302Z","title":"arXiv preprint arXiv:2007.10310","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:09.324302Z"},"links":{"cited_paper":"/paper/2007.10310","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:ea5b51abca59aec330716a93f8311ecd81cb929d3f4c0f18573b6957536a1edb","observation_id":"2cd2468b-8d69-4899-8a8f-edfd7ca0502b","resolution":{"observed_at":"2026-08-06T23:34:09.324302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T23:34:09.446488Z","title":"arXiv e-prints, pages arXiv–2305","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:09.446488Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:b0e55349a05d7b6a8eace3fc47c314523660bf38095796d66b55510b8a78935f","observation_id":"cc82fe11-6225-4091-9bae-df733af749d4","resolution":{"observed_at":"2026-08-06T23:34:09.446488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.389665Z","title":"In 2015 IEEE international conference on acoustics, speech and signal processing (ICASSP), pages 5206–5210","venue":null,"work_id":"1bcdca26-f704-46fc-bc04-d4085f6dd8e5","year":2015},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.567919Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:fb8766e49c54e5681b3749f166a7aebc08ebaddb66f13b1398c35b20f24e9d38","observation_id":"75a282bb-6d7c-4218-9015-e2b28c55ef58","resolution":{"observed_at":"2026-08-06T23:34:10.497929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:10.831793Z","title":null,"venue":null,"work_id":"974b48c8-f96d-4d0b-846a-4904ea3c2fe2","year":2018},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.177645Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:ebd0536f0d23e63e7d13c326c93b7a964521713980e0c973dce6149af7bea643","observation_id":"3cbfb931-1243-401a-9c4d-1451cfd44ed1","resolution":{"observed_at":"2026-08-06T23:34:10.891849Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-06T23:34:07.813102Z","title":"Preprint, arXiv:2005.08100","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.813102Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:28a36f0ec5f6162919012f75dfb25bbc4bdf0080f46444a3b5ece6f33c147d08","observation_id":"da49e256-227c-4898-9ed6-4c9792f3051c","resolution":{"observed_at":"2026-08-06T23:34:07.813102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09344","last_updated":"2021-11-17T19:14:40Z","snapshot_observed_at":"2026-07-06T12:09:37.468149Z","submitted_at":"2021-11-17T19:14:40Z","title":"The People's Speech: A Large-Scale Diverse English Speech Recognition Dataset for Commercial Usage","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09344","snapshot_observed_at":"2026-08-06T23:34:07.432916Z","title":"Preprint, arXiv:2111.09344","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:07.432916Z"},"links":{"cited_paper":"/paper/2111.09344","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:fac2f344d84c172a3d3b02955311bc742b86d5e0998e9f18bb8db9c6c54e46c8","observation_id":"82dc9500-d820-4672-8a3b-a1b4f3ff12c7","resolution":{"observed_at":"2026-08-06T23:34:07.432916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-06T23:34:08.449809Z","title":"arXiv preprint arXiv:2207.04672","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:08.449809Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:e2bf8f6e6a95695ff6bcfaeaa142e8737f134349c1cfba17ce4f251fd31c642e","observation_id":"97ce2ada-7205-422f-9073-2058f440d569","resolution":{"observed_at":"2026-08-06T23:34:08.449809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05187","last_updated":"2023-12-08T17:18:42Z","snapshot_observed_at":"2026-08-06T14:36:57.042438Z","submitted_at":"2023-12-08T17:18:42Z","title":"Seamless: Multilingual Expressive and Streaming Speech Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05187","snapshot_observed_at":"2026-08-06T23:34:06.852611Z","title":"arXiv preprint arXiv:2312.05187","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.852611Z"},"links":{"cited_paper":"/paper/2312.05187","citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:1c9e47e00ba0d1a81a5f8b9c113523eb50ecf16408b874c6ba3066b76cb2eba5","observation_id":"8117339d-05be-41c1-85d4-dc3e9f67baea","resolution":{"observed_at":"2026-08-06T23:34:06.852611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:11.240322Z","title":"In Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, pages 21318–21340, Miami, Florida, USA","venue":null,"work_id":"71994d53-35e6-4cf5-af04-ae145cab730e","year":2024},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.715685Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:7351376e598ab84bf93aa4dc5da870bb589f2a6c5b6d09d98e9d93e3606a8b22","observation_id":"cf7879b9-d990-47df-88d3-753e3a0f641b","resolution":{"observed_at":"2026-08-06T23:34:11.300091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:34:11.367963Z","title":"In Proceedings of the 22nd Interna- tional Conference on Spoken Language Translation (IWSLT 2025), Vienna, Austria (in-person and on- line)","venue":null,"work_id":"661e9fbf-6945-4737-9d3f-08a99705efc7","year":2025},"citing_paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T23:34:06.365008Z"},"links":{"citing_paper":"/paper/2506.17019"},"observation_digest":"sha256:48125e58654409638ca44308b11fe55b42744f04e4c7688ef59a7734ae45e5dd","observation_id":"d21fd134-09ea-408a-994e-1be5c6334827","resolution":{"observed_at":"2026-08-06T23:34:11.419483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.17019","last_updated":"2025-06-20T14:17:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T06:47:23.717165Z","submitted_at":"2025-06-20T14:17:42Z","title":"Instituto de Telecomunica\\c{c}\\~oes at IWSLT 2025: Aligning Small-Scale Speech and Language Models for Speech-to-Text Learning"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.17019."}