{"as_of":"2026-08-21T23:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b51896dbbdb420579ef556898f2825daf30a5754c51a7fec635092b662b5f123","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":5,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":5,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T10:35:09.298096Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T21:49:52.237467Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","snapshot_observed_at":"2026-08-16T18:10:35.546569Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units","version":2},"cited_work":{"arxiv_id":"2107.05604","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.05604","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct speech-to-speech translation with discrete units","venue":null,"work_id":"a132d783-7fc3-4fe7-a7e0-90b3908b98c3","year":2021},"citing_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T21:49:52.184932Z"},"links":{"cited_paper":"/paper/2107.05604","citing_paper":"/paper/2210.13438"},"observation_digest":"sha256:3ba5fb0d3dc7c06887bccc609d4ea0c598c99bf3c07a264cf6ca728c54c57bb5","observation_id":"9f55e88c-2a18-48d1-9e6a-bb7b75c8a9cc","resolution":{"observed_at":"2026-05-13T21:49:52.239011Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","snapshot_observed_at":"2026-08-16T18:10:35.546569Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05604","snapshot_observed_at":"2026-08-11T10:35:09.298096Z","title":"Direct speech-to-speech translation with discrete units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16530","last_updated":"2024-12-21T08:15:52Z","snapshot_observed_at":"2026-08-19T05:22:33.490282Z","submitted_at":"2024-12-21T08:15:52Z","title":"Improving Lip-synchrony in Direct Audio-Visual Speech-to-Speech Translation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T10:35:09.298096Z"},"links":{"cited_paper":"/paper/2107.05604","citing_paper":"/paper/2412.16530"},"observation_digest":"sha256:dc42dde3ae511e2849fa3ee29eea0d72aa38d82ff0cff0db6120a7832738d834","observation_id":"2c217f1f-2490-4f0c-aaac-ef9188e734cd","resolution":{"observed_at":"2026-08-11T10:35:09.298096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","snapshot_observed_at":"2026-08-16T18:10:35.546569Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05604","snapshot_observed_at":"2026-08-09T19:16:37.857796Z","title":"Direct speech-to-speech translation with discrete units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00377","last_updated":"2025-02-01T09:29:21Z","snapshot_observed_at":"2026-08-16T09:56:33.713959Z","submitted_at":"2025-02-01T09:29:21Z","title":"When End-to-End is Overkill: Rethinking Cascaded Speech-to-Text Translation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T19:16:37.857796Z"},"links":{"cited_paper":"/paper/2107.05604","citing_paper":"/paper/2502.00377"},"observation_digest":"sha256:50155396abbdc93be7a246dc3cb56bfc8bc73ea6efa245e246c02a76a384f04b","observation_id":"af77003e-b8f4-4571-b116-5b776e43fa43","resolution":{"observed_at":"2026-08-09T19:16:37.857796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","snapshot_observed_at":"2026-08-16T18:10:35.546569Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05604","snapshot_observed_at":"2026-08-08T17:12:07.392609Z","title":"Direct speech-to-speech translation with discrete units","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.05980","last_updated":"2025-02-19T21:39:35Z","snapshot_observed_at":"2026-08-19T05:47:37.677352Z","submitted_at":"2025-02-09T18:15:00Z","title":"Speech to Speech Translation with Translatotron: A State of the Art Review","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T17:12:07.392609Z"},"links":{"cited_paper":"/paper/2107.05604","citing_paper":"/paper/2502.05980"},"observation_digest":"sha256:cd2ec65fc40da1232e2b9318fed130708be31b193188a5d9588d184ee693b6d8","observation_id":"b19e3aa1-19bc-44ed-97e5-15545b1308ee","resolution":{"observed_at":"2026-08-08T17:12:07.392609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","snapshot_observed_at":"2026-08-16T18:10:35.546569Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.05604","snapshot_observed_at":"2026-08-01T17:45:41.971525Z","title":"arXiv preprint arXiv:2107.05604 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17544","last_updated":"2026-07-20T04:42:07Z","snapshot_observed_at":"2026-08-20T18:07:24.704838Z","submitted_at":"2026-07-20T04:42:07Z","title":"X-Translator: A Real-Time Multilingual Speaker-Aware Speech-to-Speech Translation System","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T17:45:41.971525Z"},"links":{"cited_paper":"/paper/2107.05604","citing_paper":"/paper/2607.17544"},"observation_digest":"sha256:d3800e45cfe0897ce701666665a53135883f6d2bfd98201f78e79b63755a6034","observation_id":"c958fde4-9c36-466c-8ee0-bfdbeef854d0","resolution":{"observed_at":"2026-08-01T17:45:41.971525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2107.05604/citation-record","integrity":"/paper/2107.05604/integrity","json":"/paper/2107.05604/citation-record.json","paper":"/paper/2107.05604"},"outbound":[],"paper":{"arxiv_id":"2107.05604","last_updated":"2022-03-21T20:00:14Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T18:10:35.546569Z","submitted_at":"2021-07-12T17:40:43Z","title":"Direct speech-to-speech translation with discrete units"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 5 inbound Pith citation observations for arXiv:2107.05604."}