{"as_of":"2026-08-14T13:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8da6dc4f66eab6ce0bcb38983ce46068799d882075117eeb626ce1466855fe0e","coverage":[{"denominator":15,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":15,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T07:01:04.631071Z","state":"measured"},{"denominator":15,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":15,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2309.12802/citation-record","integrity":"/paper/2309.12802/integrity","json":"/paper/2309.12802/citation-record.json","paper":"/paper/2309.12802"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Top 11 speech recognition applications in 2022","venue":null,"work_id":"2f349ca3-ca85-4c07-b707-216802e23b51","year":2022},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:a364cb2bdb093457b9aa600a5df92d3a6e0aff0eaf5a349d7cdd3e44f9b10579","observation_id":"610feace-f92d-4548-9371-d9df8e596095","resolution":{"observed_at":"2026-05-24T07:04:04.303017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08779","last_updated":"2019-12-03T18:19:07Z","snapshot_observed_at":"2026-08-13T21:03:38.210392Z","submitted_at":"2019-04-18T17:53:38Z","title":"SpecAugment: A Simple Data Augmentation Method for Automatic Speech Recognition","version":3},"cited_work":{"arxiv_id":"1904.08779","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.08779","snapshot_observed_at":"2026-07-08T01:44:25.918448Z","title":"Specaugment: A simple data augmentation method for automatic speech recognition","venue":"eess.AS","work_id":"85ab3db6-965f-4a9a-b1de-5b099126c87b","year":2019},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"cited_paper":"/paper/1904.08779","citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:71aa8c658920477a5a8b00876eab37fb22a6da92420f8ad83331c8ea0335f75a","observation_id":"c703f176-8d9f-438c-b1fd-f5906d419a7a","resolution":{"observed_at":"2026-05-24T07:04:03.132657Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Specswap: A simple data augmentation method for end-to-end speech recognition","venue":null,"work_id":"151ee836-64b5-407d-a086-bbf5ccb9d2a6","year":2020},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:f46041af23911d3fbd1e917923e6a6ee07a72c10534a28eec33c03236cd04e9d","observation_id":"9e4bd63a-b0ed-4836-a6fd-0e673fe45443","resolution":{"observed_at":"2026-05-24T07:04:04.299270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Audio augmentation for speech recognition","venue":null,"work_id":"7e60bbb4-594c-4df8-bb8f-8ca85978dc48","year":2015},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:f2c1e0f2cdb91f9422060f3b1c965fe4e1bdd2a0b9537e5394fa8f8a7cd0a493","observation_id":"bbd3b0c7-f9fc-44ae-9c20-cef2e7a55537","resolution":{"observed_at":"2026-05-24T07:04:04.329426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00291","last_updated":"2022-04-01T08:53:44Z","snapshot_observed_at":"2026-08-13T16:10:24.405093Z","submitted_at":"2022-04-01T08:53:44Z","title":"Text-To-Speech Data Augmentation for Low Resource Speech Recognition","version":1},"cited_work":{"arxiv_id":"2204.00291","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.00291","snapshot_observed_at":"2026-07-10T11:27:03.148558Z","title":"Text-to-speech data augmentation for low resource speech recognition","venue":"cs.CL","work_id":"05c09ab1-fe69-401d-b8fa-9934bfe159ff","year":2022},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"cited_paper":"/paper/2204.00291","citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:0f310b47580885da24883bb6309d357d6dfc3a5fc2e52be2449f7f734ea37a6c","observation_id":"543840c4-cc7c-4ae1-a5fc-f988fb6dd499","resolution":{"observed_at":"2026-05-24T07:04:03.127247Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Real-time voice cloning","venue":null,"work_id":"a0d45adc-8a41-4827-a563-c8035fa25164","year":2022},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:1aea2dc5c765c925e0de44ae164abbc633a200a73a54c9b1b7002cef919118ae","observation_id":"59ff394e-077d-493d-9612-6239e20fb179","resolution":{"observed_at":"2026-05-24T07:04:04.325933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transfer learning from speaker verification to multispeaker text-to-speech synthesis","venue":null,"work_id":"00966e26-6a84-407e-8578-20b294cec958","year":2018},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:b306fd913b43e87380a0cdd48d67f606d07d3dfb2ba4399e88ef764e21f6af56","observation_id":"0297bd79-7308-4a16-bcfc-edba285e2bb4","resolution":{"observed_at":"2026-05-24T07:04:04.322547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural tts synthesis by conditioning wavenet on mel spectrogram predictions","venue":null,"work_id":"4609dbfb-5f90-4771-a53d-f11e1da42c84","year":2018},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:ff7b754b35a39e4b52da0b421a6934cef1bc3365db1462b0ecc7d15a0a9d9f1a","observation_id":"d246a49d-029a-4992-9dfc-2c206e01ea9f","resolution":{"observed_at":"2026-05-24T07:04:04.339821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient neural audio synthesis","venue":null,"work_id":"83a72f7b-a824-45e1-967c-6b9cf793acb6","year":2018},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:ac8a43d447ec2f05b5dffab499d72dcced7645b087313601301c626abf446d0a","observation_id":"ae0adcf1-d9e7-4671-b1d1-2d49eabdc2ab","resolution":{"observed_at":"2026-05-24T07:04:04.318782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-07-06T04:03:56.251710Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":"1412.5567","doi":"10.48550/arxiv.1412.5567","metadata_source":"pith","pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Deep Speech: Scaling up end-to-end speech recognition","venue":"cs.CL","work_id":"eb57b6c8-18a7-4e51-b90a-2add68d4ee9e","year":2014},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:7a5cbbfd186ff102795785f4df6bf8dbd0e0eedce69574faac695c385bbe619a","observation_id":"82ec4563-a7b2-428f-8d6f-ab4c8f21d13c","resolution":{"observed_at":"2026-05-24T07:04:03.119378Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Indian accents- just another version of british english?","venue":null,"work_id":"a5390835-c032-46f6-ac09-3000b7b27154","year":2017},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:b7f285de1834649c484eb1cc46ca292d233408ca8ae7ba67efa5262e9adb52da","observation_id":"51b2231d-1ce8-4c35-9f44-00cd3c6a6bd6","resolution":{"observed_at":"2026-05-24T07:04:04.336376Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nptel2020 - indian english speech dataset","venue":null,"work_id":"09e7d079-14c1-4be1-b9d6-3849ab0474e6","year":2020},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:a3ecf9dd47014529b8c657a755222e47327f839b787949b9efe92c016bb6108b","observation_id":"90ac3478-5be7-43bd-a3a9-c6365828dbc7","resolution":{"observed_at":"2026-05-24T07:04:04.332854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Librispeech: An asr corpus based on public domain audio books","venue":null,"work_id":"7c96565b-006a-4c4f-a509-135d7a7e5b26","year":2015},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:944683d6db674981d3f672d41266b3b0c91e19e4bb99e9364278235bba06b06c","observation_id":"13ce744e-dab2-47c1-a8e3-feb069e6927e","resolution":{"observed_at":"2026-05-24T07:04:04.314566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ffmpeg-normalize: Audio normalization for python/ffmpeg","venue":null,"work_id":"84357c78-30e5-4d36-bdcd-58b484e743e1","year":2022},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:53c120883ce57e88fe23e9611fef65405cd00c204d9c904d5a0fef5e1c5ca055","observation_id":"8b80633c-00ed-4694-bef2-2f23c0bd2f2a","resolution":{"observed_at":"2026-05-24T07:04:04.310492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Word error rate","venue":null,"work_id":"f6fae029-c372-41eb-bb23-446247ceaa66","year":2020},"citing_paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T07:01:04.631071Z"},"links":{"citing_paper":"/paper/2309.12802"},"observation_digest":"sha256:928b9364e5c98daf218d19e3716c27e3c81ea504602b76cd8d4f1a6abb7094bc","observation_id":"03d92529-b7a0-4b5e-aac1-91c498b94b68","resolution":{"observed_at":"2026-05-24T07:04:04.306448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2309.12802","last_updated":"2023-09-22T11:33:03Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-07-06T16:22:21.746857Z","submitted_at":"2023-09-22T11:33:03Z","title":"Deepfake audio as a data augmentation technique for training automatic speech to text transcription models"},"reference_resolution":{"displayed":15,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":3,"verified_fuzzy":12},"total_outbound_references":15},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 15 of 15 outbound references and 0 inbound Pith citation observations for arXiv:2309.12802."}