{"as_of":"2026-08-14T22:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bfee20ae5c8ae07feda3c6d86fe9a3d3fc6e68da6d313a2ed9635c0b7ad96f7e","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:36.199609Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:50:33.692524Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:50:36.461320Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"cited_work":{"arxiv_id":"2505.23379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23379","snapshot_observed_at":"2026-08-07T12:50:36.461320Z","title":"Vision-Integrated High-Quality Neural Speech Coding","venue":"eess.AS","work_id":"2877a45d-0c90-445a-a452-69fe2577c2d3","year":2025},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.692524Z"},"links":{"cited_paper":"/paper/2505.23379","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:2fdd9659182641ba15cb207d4257cddde2417e91e3adfc5a0b66a10c10b28f48","observation_id":"4fbb2ba6-3512-4f00-9f03-ff89b0e0c602","resolution":{"observed_at":"2026-08-07T12:50:36.534950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23379/citation-record","integrity":"/paper/2505.23379/integrity","json":"/paper/2505.23379/citation-record.json","paper":"/paper/2505.23379"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"cited_work":{"arxiv_id":"2505.23379","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23379","snapshot_observed_at":"2026-08-07T12:50:36.461320Z","title":"Vision-Integrated High-Quality Neural Speech Coding","venue":"eess.AS","work_id":"2877a45d-0c90-445a-a452-69fe2577c2d3","year":2025},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.692524Z"},"links":{"cited_paper":"/paper/2505.23379","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:2fdd9659182641ba15cb207d4257cddde2417e91e3adfc5a0b66a10c10b28f48","observation_id":"4fbb2ba6-3512-4f00-9f03-ff89b0e0c602","resolution":{"observed_at":"2026-08-07T12:50:36.534950Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:40.187402Z","title":"Overview As shown in Figure 1, VNSC consists of a speech coding mod- ule, an image analysis-synthesis module and a feature fusion module","venue":null,"work_id":"8f39e0e7-ccbc-4945-ab74-2b65fad333b4","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.772725Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:7bd176b460824c4834406393c4dac57b8e9fd246ba2c547ec35d574a2d39fe83","observation_id":"d6a41dc8-bbb7-4387-8cf5-a2c5edfb9303","resolution":{"observed_at":"2026-08-07T12:50:40.297099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.998037Z","title":null,"venue":null,"work_id":"2138ba9b-7909-4815-a7f8-f4ceeea241f1","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.838446Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:f72ff99ee3705f0a5fd4509827fbe7eae649a84b2484933d197517e00a2cfdcf","observation_id":"25c20d15-83cc-4562-a600-fb73f8e5d5a4","resolution":{"observed_at":"2026-08-07T12:50:40.079579Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.825853Z","title":null,"venue":null,"work_id":"f7709663-1140-4b39-9d7d-7a1ce484d0b4","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:33.954738Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:b32ecfee1f209548f494508eef08c59236f721f268d2aa2c01c79f8c05c23eb8","observation_id":"98a283bd-3523-440a-b593-dedb784c6c8a","resolution":{"observed_at":"2026-08-07T12:50:39.938610Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.617963Z","title":"VNSC is built upon the speech-modal MDCTCodec, with visual information extracted from lip images flowing into the speech coding process","venue":null,"work_id":"ecab8e2c-eef7-411b-9e50-203ff4dfbb24","year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.058108Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:c8154da70bd8ea6e29ddeb2ac4924fd8c83e886611dd37f7cb4dbc72a1fc6edc","observation_id":"250044a9-f627-49dd-a427-5d32286a1307","resolution":{"observed_at":"2026-08-07T12:50:39.716689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.436306Z","title":"Recommendation G.711: Pulse code modulation (PCM) of voice frequencies,","venue":null,"work_id":"c2ed2bbe-5744-4335-90c7-479d9c09159b","year":1988},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.158951Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:7853f8cedcd94951f82696bfc9e17b250cab792a582c67852b1cdc1ee8bdfe3e","observation_id":"b63097c6-e681-49e1-87d4-7735c2a88809","resolution":{"observed_at":"2026-08-07T12:50:39.517538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.203775Z","title":"Recommendation G.723: Speech coders for multimedia communications: dual-rate coder (5.3/6.3 kbps),","venue":null,"work_id":"c68e4cdc-bff9-4c09-8033-a91cbce25624","year":1996},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.228261Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:a2bbf4077099d669698dfa9e0c1fe538ba2885682c7f9c830fa72f73ede96e61","observation_id":"09ef0972-0153-4e21-96e7-9c8649d87c8c","resolution":{"observed_at":"2026-08-07T12:50:39.303607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:39.045481Z","title":"Recommendation g.726: 40, 32, 24, and 16 kbps adap- tive differential pulse code modulation (ADPCM),","venue":null,"work_id":"db608c80-bc4e-4098-a24f-0f9e49e7d2da","year":1990},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.314412Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:226e60058a97ce88328eee8decfd046600c0621b65a2d322e6629d124836fb68","observation_id":"511bda03-b79d-4c90-acbf-19c4e09ddf7c","resolution":{"observed_at":"2026-08-07T12:50:39.132658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.923813Z","title":"Recommendation G.729: Coding of speech at 8 kbps using conjugate-structure algebraic-code-excited linear prediction (CS-ACELP),","venue":null,"work_id":"5e73fba0-b161-4bac-aca4-0555bdb0d343","year":1996},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.388617Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:24f4bf03126e498d8a498b89f19cf0d175fdc32dcc2b4c68552d63e0ce630fe2","observation_id":"deecb13e-b03e-47be-aa0d-0ddfc3c2cb34","resolution":{"observed_at":"2026-08-07T12:50:38.977607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:34.461142Z","title":"SoundStream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.461142Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:eb1973d289abb209c43032cd7d31c3d16019c8c6f7a6d8c94df10955b9cb1c59","observation_id":"31808cef-cef9-4d63-beca-2c361bb3c11d","resolution":{"observed_at":"2026-08-07T12:50:34.461142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.753538Z","title":"A review of vector quantization tech- niques,","venue":null,"work_id":"8c5081ee-ac12-4ff2-88cd-3b6ee11a7fbb","year":2006},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.548372Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:ed97cb1faf2abdeba24ccd1e5157c2c5212f48c54cd09f7c2444796fc2da5f42","observation_id":"5091cf6c-f157-4820-8046-c2724f6058c4","resolution":{"observed_at":"2026-08-07T12:50:38.841316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:34.631712Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.631712Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:9f4d08f1a747d4078da4d3a2f69dd404821765869e5272910fb006d09eddd482","observation_id":"52c5127c-ac04-4d30-9de3-ce38584d7de3","resolution":{"observed_at":"2026-08-07T12:50:34.631712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02765","last_updated":"2023-05-07T09:22:04Z","snapshot_observed_at":"2026-08-13T11:49:24.433450Z","submitted_at":"2023-05-04T12:11:13Z","title":"HiFi-Codec: Group-residual Vector quantization for High Fidelity Audio Codec","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02765","snapshot_observed_at":"2026-08-07T12:50:34.712516Z","title":"HiFi- Codec: Group-residual vector quantization for high fidelity audio codec,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.712516Z"},"links":{"cited_paper":"/paper/2305.02765","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:004b8fc1eaa9f0d2f93e8a32e88ffcf2d7c9faaafad38d779f5e3a3eada2a149","observation_id":"cb3a9791-83df-42c5-b990-e4fc8f7d12cd","resolution":{"observed_at":"2026-08-07T12:50:34.712516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:34.799104Z","title":"APCodec: A neural audio codec with parallel amplitude and phase spec- trum encoding and decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.799104Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:9f4fa59568485625aa003f38567df189a2fb9b53bd0d332b24d1c740e817b419","observation_id":"8551fd59-4311-4472-a9fa-9bd0a5ed5f46","resolution":{"observed_at":"2026-08-07T12:50:34.799104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.522142Z","title":"Mdctcodec: A lightweight mdct-based neural audio codec towards high sampling rate and low bitrate scenarios,","venue":null,"work_id":"fe9fc15f-cb33-405c-af13-619fac63ada5","year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:34.902677Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:7d326a831f6159b8ae8ca2b80deca34c65480fdd2e9255b6863131dff120cfc5","observation_id":"aa39616b-e0e7-4ed1-827d-2321e6f97fc5","resolution":{"observed_at":"2026-08-07T12:50:38.627209Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:35.013098Z","title":"DM-Codec: Distilling multimodal representations for speech tokenization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.013098Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:43d3fb9a684a9328fe137efe77cac3747382084414df2b66958f241576c9684a","observation_id":"f84ec758-6146-4190-922d-4311a50b54c1","resolution":{"observed_at":"2026-08-07T12:50:35.013098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.355550Z","title":"The conversation: Deep audio-visual speech enhancement,","venue":null,"work_id":"31888bb9-0fc6-40cb-ae33-b900c5a8ced4","year":2018},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.070455Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:95af28960efd349b909f0d4a81e001a44d154280c6c4256d865f1fa1cd2d8caa","observation_id":"cf1d0463-7a56-4f46-87d5-20177b1622bf","resolution":{"observed_at":"2026-08-07T12:50:38.440004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:38.144100Z","title":"Vsegan: Visual speech enhancement generative adversarial net- work,","venue":null,"work_id":"05b71144-a2d2-470d-bc1d-e51e69019db8","year":2022},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.180640Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:22654d31b656347ba1a00fdc5d71ad5d31854a04435744fd87bb26653f557f3b","observation_id":"2c7aecbf-bb65-4c15-890d-12399e068b1e","resolution":{"observed_at":"2026-08-07T12:50:38.250109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.993126Z","title":"Incorporating ultra- sound tongue images for audio-visual speech enhancement,","venue":null,"work_id":"a9bc37a3-1f16-4037-b6f2-df7dea247cac","year":2024},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.288448Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:4b1c3490ce4043153d6d3bcb0b7d448a80240aef10a2b620e3022861f85d643a","observation_id":"56d598f4-c43e-4b42-8d91-b09d2cb635e2","resolution":{"observed_at":"2026-08-07T12:50:38.053040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.803952Z","title":"Improving visual speech enhancement network by learning audio-visual affinity with multi-head attention,","venue":null,"work_id":"d06e8a59-70be-4f5b-a10e-00bca9139f6a","year":2022},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.366485Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:41072cc9d7dcbfd5b178f15de28da2b25c89f4409bfc252107f669e6863c0e69","observation_id":"a31dba6f-16c4-422e-b95e-deba50925826","resolution":{"observed_at":"2026-08-07T12:50:37.910741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.639410Z","title":"TaL: a synchronised multi-speaker corpus of ultrasound tongue imaging, audio, and lip videos,","venue":null,"work_id":"1bdd0e84-a069-49a7-ba38-fedc713f1a07","year":2021},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.413134Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:904f797e3f44d8d7f8aba7997541d9fd2ce11facf63eb1cbd9d164a84a12dfb6","observation_id":"fd840dd6-135b-4e53-a130-f89dff2afe3d","resolution":{"observed_at":"2026-08-07T12:50:37.731528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.459313Z","title":"Deep audio-visual speech recognition,","venue":null,"work_id":"342cad3e-a810-409d-a382-11caebc465c3","year":2018},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.521183Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:1b3985dbfea451175d3163fbd9198bcd3684147841a6e09aa4317cc246c2f1e5","observation_id":"5e24414c-2326-4c23-9d60-a652e68831ae","resolution":{"observed_at":"2026-08-07T12:50:37.563871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:35.615922Z","title":"ConvNeXt v2: Co-designing and scaling convnets with masked autoencoders,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.615922Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:02cdd05bc1e9206847161c84175529bb5b2b8bec1736cc52bd54088f6c3ad73b","observation_id":"da2cc957-4803-4b3f-b84b-4bd11fc504d5","resolution":{"observed_at":"2026-08-07T12:50:35.615922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-07T12:50:35.712227Z","title":"Gaussian error linear units (gelus),","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.712227Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:63ade4f87c0390badc977d987f6875b21980683800bcba99bf69f2962bc2a9ea","observation_id":"1ae59075-736a-471a-88ad-726a3c42d508","resolution":{"observed_at":"2026-08-07T12:50:35.712227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.245067Z","title":"Converting video formats with ffmpeg,","venue":null,"work_id":"d562e9fb-622b-4c26-966e-cf3db4bef467","year":2006},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.835330Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:04e14ce7355b1c706634507f099cda3289a94b5401562b1221b6ac1d6a66fb02","observation_id":"53a7abad-c408-4b81-b797-fbde56d063a0","resolution":{"observed_at":"2026-08-07T12:50:37.330103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:37.009023Z","title":"Decoupled weight decay regulariza- tion,","venue":null,"work_id":"59192a43-fddd-4cb7-bdf8-1243f097cbb4","year":2018},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:35.961443Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:456a12cac827083f6e8a53ac39e2ad3814ee5bb3e302b23ca8ae6e889721c0c2","observation_id":"b4f915c7-eaa2-4678-bab0-e134a6df0b8c","resolution":{"observed_at":"2026-08-07T12:50:37.107644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:36.813850Z","title":"P. 862.2: Wideband extension to recom- mendation P. 862 for the assessment of wideband telephone networks and speech codecs,","venue":null,"work_id":"a5b91674-9f95-417a-a716-ac22b81794f5","year":2007},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:36.014763Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:d41d6b59c1b7f12e8beb9f4668df6096c7ccc68fed8dc2451b1e4572ccb4a3d5","observation_id":"2b135383-6ef9-4d95-9d66-31f8f24ec55b","resolution":{"observed_at":"2026-08-07T12:50:36.921223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:36.646104Z","title":"Evaluation of objective measures for speech enhancement,","venue":null,"work_id":"729785ad-bde0-476d-9fdf-517bd1da2d0e","year":2008},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:36.121916Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:1aa03adb61b87df2c64737aae4b80ee3f0d9e9d7de9fba0664b2d89f3af580ae","observation_id":"42100a44-3988-456e-b4d4-04bc84b8c6f0","resolution":{"observed_at":"2026-08-07T12:50:36.696296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:50:36.199609Z","title":"A short- time objective intelligibility measure for time-frequency weighted noisy speech,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:36.199609Z"},"links":{"citing_paper":"/paper/2505.23379"},"observation_digest":"sha256:92e303e06c1c3f2f38f367edb7898c6fafc1983e42d0b9b1c1e81f9600d7621d","observation_id":"66c807d6-df42-4ff4-870e-d991b8c967a8","resolution":{"observed_at":"2026-08-07T12:50:36.199609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23379","last_updated":"2025-05-29T12:00:00Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T12:44:34.894201Z","submitted_at":"2025-05-29T12:00:00Z","title":"Vision-Integrated High-Quality Neural Speech Coding"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 1 inbound Pith citation observation for arXiv:2505.23379."}