{"as_of":"2026-08-09T22:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f4d9d6cbd67abefa940bf8aeb75fb84e388ab6d216d98ea06b022088d5d1cbd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:16:45.044605Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T01:57:52.037436Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-07T15:16:45.044605Z","title":"A fine-tuned Wav2vec 2.0/HuBERT benchmark for speech emotion recognition, speaker verification and spoken language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15667","last_updated":"2025-05-21T15:44:32Z","snapshot_observed_at":"2026-08-09T08:48:10.997537Z","submitted_at":"2025-05-21T15:44:32Z","title":"Segmentation-Variant Codebooks for Preservation of Paralinguistic and Prosodic Information","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:16:45.044605Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2505.15667"},"observation_digest":"sha256:955e7bea2582f76d2f69da21898acb9eba5821090c28d63e999e6307bec5a335","observation_id":"e54207ef-db25-4e0b-9637-4f8ba3a6ea1d","resolution":{"observed_at":"2026-08-07T15:16:45.044605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2506.14148","last_updated":"2026-05-19T04:05:49Z","snapshot_observed_at":"2026-08-01T18:19:07.739909Z","submitted_at":"2025-06-17T03:25:38Z","title":"Acoustic scattering AI for non-invasive object classifications: A case study on hair assessment","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-22T00:18:57.564840Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2506.14148"},"observation_digest":"sha256:acda1929bbf25a45f0d54e3f18945faba25d7d2d4eccbd63135dec26663b7c1b","observation_id":"3064ba90-d203-4f60-9c64-601241a5492f","resolution":{"observed_at":"2026-05-22T00:20:49.211984Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-06T22:25:28.434258Z","title":"A fine-tuned wav2vec 2.0/HuBERT benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.21712","last_updated":"2025-06-26T18:54:26Z","snapshot_observed_at":"2026-08-06T22:18:18.856525Z","submitted_at":"2025-06-26T18:54:26Z","title":"Identifying Speaker Information in Feed-Forward Layers of Self-Supervised Speech Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:25:28.434258Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2506.21712"},"observation_digest":"sha256:434c3d4e247cb2c11b7f076ffa545ce852ef94851aa1a9cfaf62076f2810ca69","observation_id":"8d87a066-029c-4c5f-908a-7b80a81e2f22","resolution":{"observed_at":"2026-08-06T22:25:28.434258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-06T20:46:26.543744Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recogni- tion, speaker verification and spoken language understanding,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01805","last_updated":"2025-07-02T15:24:47Z","snapshot_observed_at":"2026-08-06T20:40:04.050505Z","submitted_at":"2025-07-02T15:24:47Z","title":"A Dataset for Automatic Assessment of TTS Quality in Spanish","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T20:46:26.543744Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2507.01805"},"observation_digest":"sha256:158f198ab57014ad812daeacbc9ae25d47d68c2a8c6c6e5da5e5b5d20ea89998","observation_id":"899ee35a-95c7-4794-ad69-431a93b98030","resolution":{"observed_at":"2026-08-06T20:46:26.543744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-06T16:48:56.065305Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12580","last_updated":"2025-07-16T18:52:55Z","snapshot_observed_at":"2026-08-09T04:41:54.854659Z","submitted_at":"2025-07-16T18:52:55Z","title":"\"How to Explore Biases in Speech Emotion AI with Users?\" A Speech-Emotion-Acting Study Exploring Age and Language Biases","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T16:48:56.065305Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2507.12580"},"observation_digest":"sha256:266bb0249db677fed0d0ccbf5626d3b50b1af6d0d9223813b7c39d0860cc610b","observation_id":"e1be3bd1-be96-4ce8-886e-db345248959c","resolution":{"observed_at":"2026-08-06T16:48:56.065305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-06T14:36:34.000510Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22934","last_updated":"2025-07-24T17:12:01Z","snapshot_observed_at":"2026-08-08T23:55:18.602991Z","submitted_at":"2025-07-24T17:12:01Z","title":"Deep Learning Approaches for Multimodal Intent Recognition: A Survey","version":1},"reference_index":137,"source":"pdf_text","source_observed_at":"2026-08-06T14:36:34.000510Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2507.22934"},"observation_digest":"sha256:4d96b6842360c98aefc4e2d107013e7332c85692299a166115c7a03c68b3918e","observation_id":"8ca5be82-cb43-4ad0-b3cf-8df346c28fc9","resolution":{"observed_at":"2026-08-06T14:36:34.000510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-05T19:07:40.648163Z","title":"A fine-tuned wav2vec 2.0/hu- bert benchmark for speech emotion recognition, speaker verification and spoken language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.13442","last_updated":"2025-08-19T01:55:25Z","snapshot_observed_at":"2026-08-07T21:53:25.249431Z","submitted_at":"2025-08-19T01:55:25Z","title":"EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-05T19:07:40.648163Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2508.13442"},"observation_digest":"sha256:9c7206f3d00dc4a7df60ee6f4dfe8b58471019b8aaf5e12313a88734deb91310","observation_id":"20f435b3-9089-4f31-b9c2-5defe4d5ecfd","resolution":{"observed_at":"2026-08-05T19:07:40.648163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-05T19:01:24.191393Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.14130","last_updated":"2025-08-19T06:58:16Z","snapshot_observed_at":"2026-08-09T19:23:14.500136Z","submitted_at":"2025-08-19T06:58:16Z","title":"EmoSLLM: Parameter-Efficient Adaptation of LLMs for Speech Emotion Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T19:01:24.191393Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2508.14130"},"observation_digest":"sha256:44b8fd17d8ea8eb5bea6e662781e97d8bd082be1c28210cb2ae90effc0f55df9","observation_id":"e093735d-c928-47c2-a74d-e3511988e94b","resolution":{"observed_at":"2026-08-05T19:01:24.191393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2509.08470","last_updated":"2026-04-28T12:49:51Z","snapshot_observed_at":"2026-07-31T07:42:25.034469Z","submitted_at":"2025-09-10T10:18:56Z","title":"Joint Learning using Mixture-of-Expert-Based Representation for Speech Enhancement and Robust Emotion Recognition","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-18T18:07:34.965356Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2509.08470"},"observation_digest":"sha256:1b3df4ceb60ad74229d273a694cd576f55f62b9c536231609d4c4976845c74f2","observation_id":"1e3e4584-8631-45dc-bd6b-8fad767f7957","resolution":{"observed_at":"2026-05-18T18:11:42.905106Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-08-02T18:22:53.721498Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2603.11845","last_updated":"2026-07-22T16:59:57Z","snapshot_observed_at":"2026-08-07T02:41:18.008375Z","submitted_at":"2026-03-12T12:09:22Z","title":"Acoustic-to-Articulatory Inversion of Clean Speech Using an MRI-Trained Model","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T18:22:53.721498Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2603.11845"},"observation_digest":"sha256:e0d93f5faee49e50d1a5ccea9548132c8612aaff228c2f2f40081ca4753f3241","observation_id":"c17e9a26-d61c-41d8-b06f-acc2587c7b15","resolution":{"observed_at":"2026-08-02T18:22:53.721498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2605.19630","last_updated":"2026-05-19T10:11:10Z","snapshot_observed_at":"2026-07-06T23:30:21.283826Z","submitted_at":"2026-05-19T10:11:10Z","title":"EMO-BOOST: Emotion-Augmented Audio-Visual Features for Improved Generalization in Deepfake Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-20T05:47:45.259359Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2605.19630"},"observation_digest":"sha256:796a0dd5d4af03831d83101195aa461acda8201cc6df1c8c7a93f2affe648d9c","observation_id":"f0ef815e-bd07-4ce5-b522-f86c01704c4e","resolution":{"observed_at":"2026-05-20T05:48:04.330890Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2606.24063","last_updated":"2026-06-23T02:13:00Z","snapshot_observed_at":"2026-08-07T19:01:26.496095Z","submitted_at":"2026-06-23T02:13:00Z","title":"Selective Capability Unlearning in End-to-End Spoken Language Understanding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T00:54:46.225878Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2606.24063"},"observation_digest":"sha256:1ede67288617b3ada5c50701530c139b3af88afee78660c82bc73e62dd857a7b","observation_id":"b8aecfa9-82b3-4b4e-a113-30e3e51a9ede","resolution":{"observed_at":"2026-07-04T16:09:57.102746Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2606.30356","last_updated":"2026-06-29T14:24:19Z","snapshot_observed_at":"2026-08-07T17:24:10.002925Z","submitted_at":"2026-06-29T14:24:19Z","title":"OLIVE: View-Augmented Latent Prediction with Waveform Reconstruction for Speech SSL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T06:17:41.860360Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2606.30356"},"observation_digest":"sha256:88d3efb9957d7e78c4b18142c9aff153ab201f260130a6b0940d35a9a55fbd7b","observation_id":"2df84290-3037-4920-8856-03cad9dd6cfc","resolution":{"observed_at":"2026-06-30T06:24:19.502926Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2606.30550","last_updated":"2026-06-29T16:48:21Z","snapshot_observed_at":"2026-08-05T08:13:09.099537Z","submitted_at":"2026-06-29T16:48:21Z","title":"SIGMA: Saliency-Guided Sparse Mask Attacks for Speech Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T04:44:59.279562Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2606.30550"},"observation_digest":"sha256:25d1404dd3e124ae05a607f574f606caa3f467156f46e717d535495adc09095e","observation_id":"95228737-b994-48b2-968a-b13813d00a89","resolution":{"observed_at":"2026-06-30T16:24:57.565737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2607.06392","last_updated":"2026-07-07T15:25:47Z","snapshot_observed_at":"2026-08-05T23:10:43.933121Z","submitted_at":"2026-07-07T15:25:47Z","title":"InsideSSL: Understanding Self-Supervised Speech Representations using a Model-Centric Perspective","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T07:33:22.898615Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2607.06392"},"observation_digest":"sha256:6aa37f2584442818ad1f756a5cbceea1fdb0c3b065a8a1530f3103f04ab59e5d","observation_id":"5890da5e-07d5-4cb0-a070-6e64d930fa15","resolution":{"observed_at":"2026-07-08T07:34:43.128546Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:ccaa2be92fae47982d6add7efbf603d32ef6e4d9c2323d4809930ade943618fa","observation_id":"2b030a15-2b87-45b2-8590-d35b6fbd9979","resolution":{"observed_at":"2026-07-11T01:57:52.061776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2111.02735/citation-record","integrity":"/paper/2111.02735/integrity","json":"/paper/2111.02735/citation-record.json","paper":"/paper/2111.02735"},"outbound":[],"paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2111.02735."}