{"as_of":"2026-08-15T03:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:056beb8978733f2f30b363cfb6a1a87bef291cad5d2f25836a93398fa0f05059","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:24:15.943799Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:10:45.846040Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T05:10:46.013949Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"cited_work":{"arxiv_id":"2411.18294","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18294","snapshot_observed_at":"2026-08-07T05:10:46.013949Z","title":"Aligning Pre-trained Models for Spoken Language Translation","venue":"cs.CL","work_id":"ca08a41f-016b-49d9-9c77-fc5cfec93b2a","year":2024},"citing_paper":{"arxiv_id":"2506.08633","last_updated":"2025-06-10T09:46:29Z","snapshot_observed_at":"2026-08-14T00:36:34.324746Z","submitted_at":"2025-06-10T09:46:29Z","title":"Approaching Dialogue State Tracking via Aligning Speech Encoders and LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:10:45.846040Z"},"links":{"cited_paper":"/paper/2411.18294","citing_paper":"/paper/2506.08633"},"observation_digest":"sha256:d85fdb8a818e0794785e9caaae3407a319e7f4f39bf754acc02fd03d3bdf0f84","observation_id":"106ac024-06cc-4c38-9ce2-e4a47fdef12d","resolution":{"observed_at":"2026-08-07T05:10:46.018666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.18294/citation-record","integrity":"/paper/2411.18294/integrity","json":"/paper/2411.18294/citation-record.json","paper":"/paper/2411.18294"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:17.172379Z","title":"Menick, Sebastian Borgeaud, Andy Brock, Aida Nematzadeh, Sahand Sharifzadeh, Mikolaj Binkowski, Ricardo Barreira, Oriol Vinyals, Andrew Zisserman, and Kar \\' e n Simonyan","venue":null,"work_id":"3897bfd6-7837-4e60-85fa-1624168bb034","year":2022},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.703683Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:0509ff99c308fca9c825901ebfb5f63d907b8bc514f3053f1c9b46160d51b719","observation_id":"99e2e9da-c896-4149-bbee-3f475a2133f0","resolution":{"observed_at":"2026-08-12T11:24:17.180102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:17.149775Z","title":null,"venue":null,"work_id":"57137a00-b8f1-4cbc-a724-bedcde727b83","year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.710030Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:dd4aaaf683201ef734ecd4a26752d0d201df5e4facde1db4cea31c9e2859631c","observation_id":"e1609d27-def9-4415-bba1-03520bd8ae23","resolution":{"observed_at":"2026-08-12T11:24:17.156775Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.09144","last_updated":"2020-10-08T18:37:54Z","snapshot_observed_at":"2026-08-13T21:48:35.364697Z","submitted_at":"2020-08-20T18:10:13Z","title":"PTT5: Pretraining and validating the T5 model on Brazilian Portuguese data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.09144","snapshot_observed_at":"2026-08-12T11:24:15.715722Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.715722Z"},"links":{"cited_paper":"/paper/2008.09144","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:5ba31b1b974fc8de0a220e2220f8152bedff90c03b20f87c5584ae71a3ff011a","observation_id":"72a13040-395d-48fc-bbc4-f6e7eb61a8c9","resolution":{"observed_at":"2026-08-12T11:24:15.715722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.04160","last_updated":"2023-05-22T02:37:02Z","snapshot_observed_at":"2026-08-13T11:47:54.095263Z","submitted_at":"2023-05-07T02:25:42Z","title":"X-LLM: Bootstrapping Advanced Large Language Models by Treating Multi-Modalities as Foreign Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.04160","snapshot_observed_at":"2026-08-12T11:24:15.721973Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.721973Z"},"links":{"cited_paper":"/paper/2305.04160","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:8e9e058fb7306e2f104d2fccd3421d8e37729a65a5c178cecaa6a44aedaa2b05","observation_id":"fae0fcaf-4eda-4690-ae29-91f3bb256fa0","resolution":{"observed_at":"2026-08-12T11:24:15.721973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13292","last_updated":"2023-05-23T07:48:15Z","snapshot_observed_at":"2026-08-13T11:37:00.458654Z","submitted_at":"2023-05-22T17:51:22Z","title":"VideoLLM: Modeling Video Sequence with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13292","snapshot_observed_at":"2026-08-12T11:24:15.727131Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.727131Z"},"links":{"cited_paper":"/paper/2305.13292","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:c8ea6062e6d12d1b9a036edf9e561d9368fad0efe48fb70fbb87d11b013afc19","observation_id":"204775bb-7094-4398-aeb5-7ec675a8c958","resolution":{"observed_at":"2026-08-12T11:24:15.727131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.733094Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.733094Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:da5759821220ac9644f5765b69463c7436eb8e1d4bf92c3fea626c867f5c1cfc","observation_id":"d97bc9aa-ea25-419c-938b-d29996d2b0af","resolution":{"observed_at":"2026-08-12T11:24:15.733094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:17.116035Z","title":null,"venue":null,"work_id":"5547e8ce-4f31-44e2-bd48-5fe4bb78d5bf","year":2019},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.738216Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:2da5c869223df067f91a49389f2c5860ea9a854dc5e4fe8196b8707e02273b6a","observation_id":"5376897e-5aa9-45ab-abff-a1d1da3ff0ee","resolution":{"observed_at":"2026-08-12T11:24:17.122430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:17.099917Z","title":null,"venue":null,"work_id":"9e85418b-7d65-4ba6-b3ff-44f7380550d8","year":1994},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.742945Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:22d742c6b8abccfd2a350f7c831a32c8321c6c09981499f5fdaf0fa7d9c9d999","observation_id":"10134141-ea84-4be1-871a-4b0175a08303","resolution":{"observed_at":"2026-08-12T11:24:17.105169Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.750124Z","title":"Godfrey, E.C","venue":null,"work_id":null,"year":1992},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.750124Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:c1f8564ccf65b1fae3e0a37adb7f7a00667ea4e3a0e25b568c4e79852102edcd","observation_id":"b1c883a6-086a-4252-a29d-e030dfd4b681","resolution":{"observed_at":"2026-08-12T11:24:15.750124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.754174Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.754174Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:03582d92097ca74345f08751e377152a49039ece6351ae89a2f6cda5f6c24b30","observation_id":"7da5daf3-b73d-4f6e-80b4-279bdeb38510","resolution":{"observed_at":"2026-08-12T11:24:15.754174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03668","last_updated":"2024-06-06T15:24:16Z","snapshot_observed_at":"2026-08-13T05:08:31.724164Z","submitted_at":"2023-12-06T18:34:42Z","title":"Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition","version":2},"cited_work":{"arxiv_id":"2312.03668","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03668","snapshot_observed_at":"2026-08-12T11:24:16.708199Z","title":"Integrating Pre-Trained Speech and Language Models for End-to-End Speech Recognition","venue":"eess.AS","work_id":"3c9f7e3f-ab55-486a-a5ba-e7ca9fce165d","year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.758848Z"},"links":{"cited_paper":"/paper/2312.03668","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:da1a7e2a75228d99541f2585650156b849241d33e8bb1d294786906b84a74fe5","observation_id":"becb228d-93e6-4da0-9330-9a3a47da5701","resolution":{"observed_at":"2026-08-12T11:24:16.716290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-demos.34","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:16.116039Z","title":null,"venue":null,"work_id":"d52db328-38d4-4d4a-8faf-15440efd045d","year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.767023Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:73350005d36c3d89fc8171a6fa3b7089456b62aff028ba172972926d53ca96a9","observation_id":"29faea5b-a5dc-4a5c-bb9e-435c63a21579","resolution":{"observed_at":"2026-08-12T11:24:16.122246Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.774364Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.774364Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:d3b6ed2f8c64a1bedd3229acef03c03d01b3a4b826fb9264f659cfecb7da1548","observation_id":"e4fc2100-55dc-4030-9a57-6d42928bf0f9","resolution":{"observed_at":"2026-08-12T11:24:15.774364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.780436Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.780436Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:d0b22fd65bf8fba57b925d7b54451f57b983ecadbc1f2a81ab8c63ed0409b941","observation_id":"205917b9-66c9-4a29-ad03-e0086822d36b","resolution":{"observed_at":"2026-08-12T11:24:15.780436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.786182Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.786182Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:c47ab01e9261b3c1408a9b5605025e58580dfa22dff8f2df21c3fc443a0d60b3","observation_id":"10340bbf-6062-4d7c-8630-1c46650f3382","resolution":{"observed_at":"2026-08-12T11:24:15.786182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.790994Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.790994Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:80d724f8e65ac4f530eb2c49f3f95cbbaf29dbfd86ca7807fb769d93b7e93d34","observation_id":"518a5d7f-e0e1-4db1-a068-9de003c253f4","resolution":{"observed_at":"2026-08-12T11:24:15.790994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.796465Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.796465Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:f87cd802f0cf35847c00c72622ad05692eda77b1c9f2b17076ae7b3d2afb3308","observation_id":"bf7b1afe-f745-4790-a849-a41ef7c58042","resolution":{"observed_at":"2026-08-12T11:24:15.796465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.802843Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.802843Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:551b6c41f008695493f70365bb66685af6b0ad278761a8e8ef4a091a53f4f086","observation_id":"7596a358-beec-4d5e-a270-89cead6a4b4d","resolution":{"observed_at":"2026-08-12T11:24:15.802843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:17.049248Z","title":null,"venue":null,"work_id":"ebe69038-a47c-400b-8095-7dc6f79c6073","year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.811419Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:0b11ae649e4e38fc7ba6acc34a52c8bc1fe3f90c4a2f0c7cc94dcbb6bd2eb3cb","observation_id":"fe3da516-9f7e-4ec9-9680-9d241d01ee4b","resolution":{"observed_at":"2026-08-12T11:24:17.054506Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09093","last_updated":"2023-06-15T12:45:25Z","snapshot_observed_at":"2026-08-13T11:16:45.283010Z","submitted_at":"2023-06-15T12:45:25Z","title":"Macaw-LLM: Multi-Modal Language Modeling with Image, Audio, Video, and Text Integration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09093","snapshot_observed_at":"2026-08-12T11:24:15.821992Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.821992Z"},"links":{"cited_paper":"/paper/2306.09093","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:65b8dca7434426fca4e8eec20d622de7fb8e5c468a86a4b48d95f9e0497c7d30","observation_id":"a8ef66c2-02cb-486c-9647-a1d08d3bf058","resolution":{"observed_at":"2026-08-12T11:24:15.821992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:17.028566Z","title":null,"venue":null,"work_id":"113e7a11-15bf-4247-8e29-9ea9fb0feebb","year":2019},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.827647Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:ad605dd36938c126d74cc5a4be30532ccf911656fcd299c0a5bf79e5ecf8f123","observation_id":"5e909cb4-95ac-49b8-bcf0-1501ebb45027","resolution":{"observed_at":"2026-08-12T11:24:17.035478Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.832873Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.832873Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:4715f688bb0ebef0880dc9c26bb1bbe20c0f9ce6dfb1c6434cd8d34814b489df","observation_id":"c1b0be25-5b4f-40f5-9b69-0654bf739c62","resolution":{"observed_at":"2026-08-12T11:24:15.832873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.836779Z","title":null,"venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.836779Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:73c6a8949689719099dd08bd51acac1a823b1b537a7df46dac35e069fcf8b631","observation_id":"33a1e83d-431f-49ed-8a43-b7956177b181","resolution":{"observed_at":"2026-08-12T11:24:15.836779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.841710Z","title":"Park, William Chan, Yu Zhang, Chung-Cheng Chiu, Barret Zoph, Ekin D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.841710Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:2e97c94aef3423701db65f53a4c592d2e3c4b82a658c7bc7976c0d27be192bd6","observation_id":"c7ecf2a7-f8c1-4888-ba8d-a023c545659a","resolution":{"observed_at":"2026-08-12T11:24:15.841710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:17.006416Z","title":"Paul and Janet M","venue":null,"work_id":"cf0869f5-3b9c-4d5d-8d56-715249f92d0e","year":1992},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.847174Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:cdd86e13b19dcbb9b31ef91e5328616a12a8ac83bc1b15b80dd034babb61dc77","observation_id":"c8c21e6c-d5e7-434f-96d2-258443883f67","resolution":{"observed_at":"2026-08-12T11:24:17.011074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.852877Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.852877Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:476d69db6bfc4dcdcd6acf6e8e7803724a3a7b3e42419aa8c476b8581992d5d8","observation_id":"c75ca28f-3aa9-4009-b68e-4e27ed73505b","resolution":{"observed_at":"2026-08-12T11:24:15.852877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:16.993380Z","title":null,"venue":null,"work_id":"40f4858d-88e3-4dc1-a55c-b17f4aedcffc","year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.859226Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:50821d72f4010cc3c8d91b41f7eb59fc13cbc93b9f95cdfd19a8747f0d6928b7","observation_id":"92984805-bbf7-48f8-83ba-288c58f1e30e","resolution":{"observed_at":"2026-08-12T11:24:16.997626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.866474Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.866474Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:dba3509c462afb73ad29ca0d37638e747f65ec5d116e2b6aee4a328712e4cce8","observation_id":"6cc1e1ab-ce23-4446-af75-bd30ed8019bf","resolution":{"observed_at":"2026-08-12T11:24:15.866474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00347","last_updated":"2018-12-07T07:03:52Z","snapshot_observed_at":"2026-08-14T18:05:47.659963Z","submitted_at":"2018-11-01T12:47:11Z","title":"How2: A Large-scale Dataset for Multimodal Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00347","snapshot_observed_at":"2026-08-12T11:24:15.871316Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.871316Z"},"links":{"cited_paper":"/paper/1811.00347","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:1e019103b30707e3d2438c7f7750b5f109d1083fb3c19c40ea122850cb6bdcaa","observation_id":"5bd8e7c4-c523-4bb6-8549-bde3a65d3366","resolution":{"observed_at":"2026-08-12T11:24:15.871316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:16.960801Z","title":null,"venue":null,"work_id":"a04c8f2f-da6a-4b1b-9ed2-08dbb58378b7","year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.875845Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:4faa6486652f270db9b79d223725b846441319226501eff8a4f480f858079046","observation_id":"d1dea5de-1a1a-44b9-86ef-cf663cf91d6c","resolution":{"observed_at":"2026-08-12T11:24:16.965477Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.881567Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.881567Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:5685428560a936110914777c787bb1b95575d643cc35ab557479e8ea2ec8d003","observation_id":"fdcbdeb3-2ec1-41e6-bba4-9ec8b669c573","resolution":{"observed_at":"2026-08-12T11:24:15.881567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.885585Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.885585Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:cf6fd02bfc560400e28f5d77b4120232c6aa449028b3630ed62b64a537bfd440","observation_id":"e6813408-ed97-4561-8443-324852977eaa","resolution":{"observed_at":"2026-08-12T11:24:15.885585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.892358Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.892358Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:34122479074b0ef3f328bcb993db2f7c0ee0fa61d08db455d6ec710920753966","observation_id":"8657a8c3-8345-4df8-88a3-7db6e675273d","resolution":{"observed_at":"2026-08-12T11:24:15.892358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.896553Z","title":"Hari Vydana, Martin Karafi\\' a t, Kate r ina Z mol\\' i kov\\' a , Luk\\' a s Burget, and Jan C ernock\\' y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.896553Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:41ca22df7f96cdd9319d5c2605d74e78fc73db66724535fd13991cd113b5d7b7","observation_id":"5c3b1f18-1f0a-44de-aeb3-5bcd04d364cd","resolution":{"observed_at":"2026-08-12T11:24:15.896553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.901300Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.901300Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:f33ea8a3a997618442cc9d904861459d1848da32ed3b305bb08bbb4325fab23a","observation_id":"c3e259fb-005f-47bb-a3bd-276a3ccd6396","resolution":{"observed_at":"2026-08-12T11:24:15.901300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:16.902099Z","title":null,"venue":null,"work_id":"88e22f87-160c-4304-98c2-61dcb601c861","year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.906409Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:97fadacf919dfc434899059ff37a2525c798048e3b332ec99495dc9207bf3cde","observation_id":"8bce8744-0fba-4f2d-80d8-e33c55cacadb","resolution":{"observed_at":"2026-08-12T11:24:16.906638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.910832Z","title":"Rubenstein, Lukas Zilka, Dian Yu, Golan Pundak, Nikhil Siddhartha, Johan Schalkwyk, and Yonghui Wu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.910832Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:1fc525ae58f493cbbdc381b4adf03d884bc6185026dcdfc0296a3f4e19e3fa39","observation_id":"277d8ebc-8be6-42e7-9660-759656fe3fa5","resolution":{"observed_at":"2026-08-12T11:24:15.910832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.915674Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.915674Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:2efc04b51ccd67993b1d27559d1def40f87b9409ba5b2e2a0ee2bb4dbe60fe91","observation_id":"8f86f43e-fd3c-4769-97ac-d0f759460b8e","resolution":{"observed_at":"2026-08-12T11:24:15.915674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13963","last_updated":"2023-09-26T11:09:25Z","snapshot_observed_at":"2026-08-13T10:05:44.200896Z","submitted_at":"2023-09-25T08:57:07Z","title":"Connecting Speech Encoder and Large Language Model for ASR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.13963","snapshot_observed_at":"2026-08-12T11:24:15.920214Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.920214Z"},"links":{"cited_paper":"/paper/2309.13963","citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:e2de71cdfe2d77aa46999a3519e0ef5f88ebd3f797df445b0073fb3100664ebc","observation_id":"17319cf9-9fe6-4f32-a4d6-1ddaca03974a","resolution":{"observed_at":"2026-08-12T11:24:15.920214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.927676Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.927676Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:3e33b6880d749af911e8108f461b1b1d6bf0f19e0fa66b8b49d3f7e91b3fc742","observation_id":"b88db5cb-70af-4fee-8a2e-a7977e68bd20","resolution":{"observed_at":"2026-08-12T11:24:15.927676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.931765Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.931765Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:1f2ffd58feac8fcd0a9658f00741b55404bd9f9f3a19216af78904ba4149a781","observation_id":"c4c5a985-a50c-4ab9-8fba-2faa338d4903","resolution":{"observed_at":"2026-08-12T11:24:15.931765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:24:15.943799Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T11:24:15.943799Z"},"links":{"citing_paper":"/paper/2411.18294"},"observation_digest":"sha256:68583f7fc52b849383f536d86b9ee391c6ee22c3bad9ab0e531e28aeedaa417c","observation_id":"68007c7e-90a5-4789-9788-edde1bcdc4c7","resolution":{"observed_at":"2026-08-12T11:24:15.943799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.18294","last_updated":"2024-11-27T12:32:41Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T22:11:16.911163Z","submitted_at":"2024-11-27T12:32:41Z","title":"Aligning Pre-trained Models for Spoken Language Translation"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":2,"verified_fuzzy":2},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2411.18294."}