{"as_of":"2026-08-22T00:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b5706b885186905477efe3d36b67b1a6753c44f12345b008eeaff4efecfb009e","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:07:25.359745Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:49:29.529419Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T23:49:29.628563Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"cited_work":{"arxiv_id":"2411.14642","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.14642","snapshot_observed_at":"2026-08-06T23:49:29.628563Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","venue":"cs.LG","work_id":"2d82e0d3-cff6-416c-b001-c26bace6f9fb","year":2024},"citing_paper":{"arxiv_id":"2506.16310","last_updated":"2025-06-19T13:35:05Z","snapshot_observed_at":"2026-08-17T22:25:43.063259Z","submitted_at":"2025-06-19T13:35:05Z","title":"Optimizing Multilingual Text-To-Speech with Accents & Emotions","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:49:29.529419Z"},"links":{"cited_paper":"/paper/2411.14642","citing_paper":"/paper/2506.16310"},"observation_digest":"sha256:e4940c87c8c262db06dbba56580f52f105a55808be32c1a9d88a178b83cf5804","observation_id":"efab0454-8e62-4597-848d-b261c2b3ca66","resolution":{"observed_at":"2026-08-06T23:49:29.632522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14642/citation-record","integrity":"/paper/2411.14642/integrity","json":"/paper/2411.14642/citation-record.json","paper":"/paper/2411.14642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.635488Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":"f9c7cd89-8c25-4997-9bcd-33517a986957","year":2022},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.269828Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:c7f2ae98c19934ebcc69fb91611344a8eccbd50d3e946bdc9c61531b191d9502","observation_id":"e8ca39d7-937b-494e-b3b3-4b1e24f84394","resolution":{"observed_at":"2026-08-12T15:07:25.640547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.03499","last_updated":"2016-09-19T18:04:35Z","snapshot_observed_at":"2026-08-16T05:39:41.727705Z","submitted_at":"2016-09-12T17:29:40Z","title":"WaveNet: A Generative Model for Raw Audio","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.03499","snapshot_observed_at":"2026-08-12T15:07:25.275090Z","title":"Wavenet: A gener- ative model for raw audio,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.275090Z"},"links":{"cited_paper":"/paper/1609.03499","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:a54856d944938d29b3a6438517c465c616a75a2ea3237a6e1908723684a22f4e","observation_id":"0b87d536-ad02-4d34-8103-156ec6d0bcc2","resolution":{"observed_at":"2026-08-12T15:07:25.275090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.283207Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.283207Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:993afc4e98a8feb1d19fe216eb8207d58711bdb8c81cd056b7e6e1e7e1165888","observation_id":"860d31c5-aae8-45d4-b2df-a2ec257493ca","resolution":{"observed_at":"2026-08-12T15:07:25.283207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13236","last_updated":"2024-02-20T18:50:25Z","snapshot_observed_at":"2026-08-20T12:20:52.955680Z","submitted_at":"2024-02-20T18:50:25Z","title":"Towards audio language modeling -- an overview","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13236","snapshot_observed_at":"2026-08-12T15:07:25.289453Z","title":"Towards audio language modeling-an overview,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.289453Z"},"links":{"cited_paper":"/paper/2402.13236","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:6a32cc85a463347d25af6702e4a3812a5ec9c83356bfce034f4af8f9c14403df","observation_id":"d96ee46e-b350-479c-9a5f-8937746cff16","resolution":{"observed_at":"2026-08-12T15:07:25.289453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.614386Z","title":"Pretraining techniques for sequence-to- sequence voice conversion,","venue":null,"work_id":"7b553039-4bc0-40eb-a0a4-4dbf1f3a538f","year":2021},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.294242Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:f1dfdcea79119580de64bd7945cb2920329fcb877feee2b853356055e7befacf","observation_id":"a2de7675-15ae-44d9-bd04-58649a3c7500","resolution":{"observed_at":"2026-08-12T15:07:25.619087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-12T15:07:25.298131Z","title":"High fidelity neural audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.298131Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:dd184b0444f47bf856f4976fcbe3438fdcddfbee22f1f0bbfe8e15e3249c6978","observation_id":"abea2563-36e4-4d05-98d7-5cafd9a72134","resolution":{"observed_at":"2026-08-12T15:07:25.298131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.601135Z","title":"Vall-e 2: Neural codec language models are human parity zero-shot text to speech synthesizers,","venue":null,"work_id":"770edcfa-2946-434c-9917-ec0202f01b60","year":2024},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.302455Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:63189dcb4613472613bc64fa1c14c753a7fdc01edda782695108626a4f53af6e","observation_id":"7e125370-c10e-4330-849f-0c194e8ddb58","resolution":{"observed_at":"2026-08-12T15:07:25.605037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.04208","last_updated":"2019-02-09T00:51:18Z","snapshot_observed_at":"2026-08-21T19:11:43.623363Z","submitted_at":"2018-02-12T17:50:43Z","title":"Adversarial Audio Synthesis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.04208","snapshot_observed_at":"2026-08-12T15:07:25.306884Z","title":"Adversarial audio synthe- sis,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.306884Z"},"links":{"cited_paper":"/paper/1802.04208","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:eda3b5268859abcff429130e1c220273fd7f43f93f93b1da3d18e62ac273a0d3","observation_id":"57e88b69-f6ef-45e3-85dd-020f8247370f","resolution":{"observed_at":"2026-08-12T15:07:25.306884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.583711Z","title":"Signal estimation from modified short-time fourier transform,","venue":null,"work_id":"18870f39-ee7d-4bf8-9e7b-75b8d906a700","year":1984},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.312719Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:b580fe9cf9fbbca5372dfc814cf13a640cd72042bbd431cff372135a6ed4c079","observation_id":"af171f11-bc90-4e99-a141-b92a093ec152","resolution":{"observed_at":"2026-08-12T15:07:25.589700Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.316756Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.316756Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:7a10e20eb2b95f4e77d6f14f59680c000969d0a68769acc5148ab63ea3cb23dc","observation_id":"9ebb383a-e30b-4bf1-8666-fca0c48d1dff","resolution":{"observed_at":"2026-08-12T15:07:25.316756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.321911Z","title":"Neural discrete representation learning,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.321911Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:e23352cff04008332aefa2d8b0ef602025b1c2ab89fa015300bd5c6f45b4b5c1","observation_id":"d3ed8945-72a4-488b-a59c-73745c979841","resolution":{"observed_at":"2026-08-12T15:07:25.321911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00341","last_updated":"2020-04-30T09:02:45Z","snapshot_observed_at":"2026-08-16T07:26:47.621702Z","submitted_at":"2020-04-30T09:02:45Z","title":"Jukebox: A Generative Model for Music","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00341","snapshot_observed_at":"2026-08-12T15:07:25.326657Z","title":"Jukebox: A generative model for music,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.326657Z"},"links":{"cited_paper":"/paper/2005.00341","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:6df5370d01d9a713b55f30e3645b26ef7441bd43f19c09c33efd3a2f1a4dd186","observation_id":"50d615a6-79f2-4993-86f0-273741aa5a4d","resolution":{"observed_at":"2026-08-12T15:07:25.326657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.333213Z","title":"Continuous Relaxation Training of Discrete Latent Variable Image Models,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.333213Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:e994b4a304981e346ee1576639aeef79eb504edfc443f98d12b453c07e96a243","observation_id":"c5b34f60-53ab-4032-8a30-def684b8dfa7","resolution":{"observed_at":"2026-08-12T15:07:25.333213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.337161Z","title":"Generating diverse high- fidelity images with VQ-V AE-2,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.337161Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:e32786f15b8e6018440b34ba23c043349a18a672955bc075d0ade202997b5263","observation_id":"42424a42-5347-4475-afad-e782f2cd4a2a","resolution":{"observed_at":"2026-08-12T15:07:25.337161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.341169Z","title":"Improving language understanding by generative pre-training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.341169Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:40bdb0196ba9c65908c87f234bf4c93ccdbca2b926b6437c94f25d8c95486f1f","observation_id":"2ffc2985-709c-4249-9016-a2425c1e88c3","resolution":{"observed_at":"2026-08-12T15:07:25.341169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.345039Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.345039Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:51fdda15ccb8c278d8df7e90febde5011466f14d66d128f2dfb2921e7e472508","observation_id":"d11c043d-3a31-41cb-a03a-23b4e8cde505","resolution":{"observed_at":"2026-08-12T15:07:25.345039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.510296Z","title":"AudioMNIST: Exploring Explainable Artificial Intelli- gence for audio analysis on a simple benchmark,","venue":null,"work_id":"b9e172ec-ed80-404e-8d8e-f9056ef4248b","year":2024},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.348730Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:0ade7750da47480f0602de81f004d6719cba5078cd5ca1d60c6d54517d7c43c5","observation_id":"3a8e6d7b-3baa-4d70-8535-dd2691c1453d","resolution":{"observed_at":"2026-08-12T15:07:25.515160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15208","last_updated":"2023-07-27T21:58:26Z","snapshot_observed_at":"2026-08-16T15:12:40.664812Z","submitted_at":"2023-07-27T21:58:26Z","title":"Generative AI for Medical Imaging: extending the MONAI Framework","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15208","snapshot_observed_at":"2026-08-12T15:07:25.352336Z","title":"Generative AI for Medical Imaging: extending the MONAI Framework,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.352336Z"},"links":{"cited_paper":"/paper/2307.15208","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:4dcf377f099e45dc6aa967e7b149af5a6d05fb41e834c554520d4774754aa288","observation_id":"da898603-4c01-4e02-bfd9-51e8ebed0f57","resolution":{"observed_at":"2026-08-12T15:07:25.352336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:07:25.490783Z","title":"Assessing generative models via precision and recall,","venue":null,"work_id":"a3648c70-c3fd-4e45-bbb4-7e4a0640cf28","year":2018},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.356156Z"},"links":{"citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:3bc9aa7a64fda6b9b25f7d09a772d8a9c6ed4960dd436ee16ef7f9742b899a0c","observation_id":"331f44c1-565f-488e-8cdd-5e5439795088","resolution":{"observed_at":"2026-08-12T15:07:25.499635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.08013","last_updated":"2024-01-24T07:48:34Z","snapshot_observed_at":"2026-08-16T15:24:19.453573Z","submitted_at":"2023-06-13T11:46:00Z","title":"TopP&R: Robust Support Estimation Approach for Evaluating Fidelity and Diversity in Generative Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.08013","snapshot_observed_at":"2026-08-12T15:07:25.359745Z","title":"Toppr: Robust support estimation approach for evaluating fidelity and diversity in generative models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:07:25.359745Z"},"links":{"cited_paper":"/paper/2306.08013","citing_paper":"/paper/2411.14642"},"observation_digest":"sha256:5c92718534fec4c1bf99efdb4ad42774ee4dcff257858e65399f8b9482764c5f","observation_id":"b47a5d7e-faf0-40dd-b9c9-4ef4e771077d","resolution":{"observed_at":"2026-08-12T15:07:25.359745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.14642","last_updated":"2024-11-22T00:21:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T12:21:34.553829Z","submitted_at":"2024-11-22T00:21:39Z","title":"VQalAttent: a Transparent Speech Generation Pipeline based on Transformer-learned VQ-VAE Latent Space"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 1 inbound Pith citation observation for arXiv:2411.14642."}