{"as_of":"2026-08-16T01:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab5d1b1cf691e011d61d170f44fdfe7c5fbfbecfcba139376d4fa6a9e6c3bef4","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:54:17.535098Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.20796/citation-record","integrity":"/paper/2508.20796/integrity","json":"/paper/2508.20796/citation-record.json","paper":"/paper/2508.20796"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:18.102645Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"93ca98b8-ed9f-479f-a258-665ad11faf92","year":2008},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.385053Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:966fc5fc9c3d91d419b4f0c402abde72c3d251168632dbe15d394c760b23305a","observation_id":"0b3f890c-1f78-4c47-b514-ed28def712ab","resolution":{"observed_at":"2026-08-05T14:54:18.108004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:18.081357Z","title":"Multimodal emotion recognition based on deep temporal features using cross-modal trans- former and self-attention,","venue":null,"work_id":"42fe4dcb-039c-4399-b068-daf8e0757917","year":2023},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.390825Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:859894d21e23026359f7b9510d85879c1da31bde9601b65b6974a9d840ba2871","observation_id":"a0e37626-ff4b-4bcd-8d39-046d7e6948a1","resolution":{"observed_at":"2026-08-05T14:54:18.087884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:18.062322Z","title":"A first look into a convolutional neural network for speech emotion detection,","venue":null,"work_id":"715fd964-13f2-4df4-943a-09f8fbcae01b","year":2017},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.396671Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:d3bc32230de7f5324a52df9ba5e50dd5f4a8ff70b5c89e3f2e6ef11a88f65ec2","observation_id":"0853cba1-65e0-4c1e-ab22-ebc69e1ca466","resolution":{"observed_at":"2026-08-05T14:54:18.067743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:18.044111Z","title":"Speech emotion recognition using deep learning techniques: A review,","venue":null,"work_id":"f59232ec-b4bb-4e03-b719-cccb52fe8f33","year":2019},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.402232Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:99ce5bd3eab38a92e5ec849e3ff0cf4a1617582fe094dd5e6bc86f7adb731fe5","observation_id":"4d766f41-f700-4032-832c-0ff302c84417","resolution":{"observed_at":"2026-08-05T14:54:18.049727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.407856Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.407856Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:61a0e24fc549afd859aaab800f5282be2091946e59973e861f5e9d2e553c0f5c","observation_id":"dc906b9a-7fc0-43b5-bccb-25535a29bcfb","resolution":{"observed_at":"2026-08-05T14:54:17.407856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:18.002571Z","title":"Hubert: How much can a bad teacher benefit asr pre-training?","venue":null,"work_id":"f850fc66-fff2-4b23-a104-3629f3aff1e1","year":2021},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.413840Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:44ce9e8fe55bdd5b78ce2dc6ab18c40eae0cbeaf016964410194d8359d96fd2a","observation_id":"1fc03c80-ae80-4340-8866-0aa5ceb308b1","resolution":{"observed_at":"2026-08-05T14:54:18.009528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.420197Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.420197Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:6a83136a195cdb503fdaa23934bb4a8f32310c5be78c3c1f31b2b4296f1b3acd","observation_id":"42647d03-93db-4651-bdb3-63ef01ff74f2","resolution":{"observed_at":"2026-08-05T14:54:17.420197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.968027Z","title":"Emotion recognition in conversation: Research challenges, datasets, and recent advances,","venue":null,"work_id":"58639d31-2c74-46ac-b468-0bc8dbb7a0b7","year":2019},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.425090Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:c9617104c2bde71013ffa4fad21e5c94fc9bf4743db6f97a60a27c4cece3e938","observation_id":"340e58b2-aba5-41a8-9779-9ecc02759d7c","resolution":{"observed_at":"2026-08-05T14:54:17.974561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.949034Z","title":"Multimodal machine learning: A survey and taxonomy,","venue":null,"work_id":"5741404c-b0c5-4ddb-b1f2-589aa35fb1bd","year":2018},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.431627Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:3254e3acf64c3f180b40db777da2954eddbb9c04c2e1747905c98f32ac3f6f2c","observation_id":"786cd38c-8369-4f76-977c-770d66c46cd8","resolution":{"observed_at":"2026-08-05T14:54:17.955131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.930551Z","title":"Multimodal sentiment analysis: Addressing key issues and setting up the baselines,","venue":null,"work_id":"87cc76fd-1cdf-4a15-811c-4dd623600879","year":2018},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.437898Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:ca67255ddf655ed7e628d0be91e8fa5d4e71f79e3abed35d328eb004a8acf887","observation_id":"1eceb949-e1fc-43f5-82f5-47bd8322d91a","resolution":{"observed_at":"2026-08-05T14:54:17.936087Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.07250","last_updated":"2017-07-23T05:54:20Z","snapshot_observed_at":"2026-08-14T20:45:55.731918Z","submitted_at":"2017-07-23T05:54:20Z","title":"Tensor Fusion Network for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.07250","snapshot_observed_at":"2026-08-05T14:54:17.443069Z","title":"Ten- sor fusion network for multimodal sentiment analysis,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.443069Z"},"links":{"cited_paper":"/paper/1707.07250","citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:1f6ad9381877d301f7fda67eebfbb0d413e91c643037c5c61fde760b143c9b71","observation_id":"389a3048-d1fc-479a-8f61-8f2e89f686b8","resolution":{"observed_at":"2026-08-05T14:54:17.443069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.909312Z","title":"Speech sentiment analysis via pre-trained features from end-to-end asr models,","venue":null,"work_id":"64c50261-5f23-471e-8fee-c96bf70d2328","year":2020},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.456483Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:84cbc69dcf43116d269edb67dfa4b3b0b3ccf35276df7eb241ab7741522c703e","observation_id":"4d269478-61c0-4c2a-8aab-62da25aa26ae","resolution":{"observed_at":"2026-08-05T14:54:17.916705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.462219Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.462219Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:d9bdcdc75417dff24237835741ad903f28f87986cd48ac5466be052a17821b11","observation_id":"1f3ce878-23da-4098-80cd-e930137fbb4b","resolution":{"observed_at":"2026-08-05T14:54:17.462219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-05T14:54:17.467691Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.467691Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:58e33b445b6e6b6e883be5632e1a4fe806239a17c36ab52e6f80e3c9a9658d68","observation_id":"6aba427b-3978-4d72-a5e8-fe674d99fff0","resolution":{"observed_at":"2026-08-05T14:54:17.467691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.872466Z","title":"Audiovisual fusion: Challenges and new approaches,","venue":null,"work_id":"aebc2bc7-8980-4a06-baaa-1b065f5b75f3","year":2015},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.473824Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:a4c141e589fcc4311a8fe6571e0b174b18d93f7d2ee9cb0ba88e928c7ebec884","observation_id":"467d68c7-bebb-4982-8d97-f5e2c57b2023","resolution":{"observed_at":"2026-08-05T14:54:17.879772Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.851156Z","title":"Modality-collaborative transformer with hybrid feature reconstruction for robust emotion recognition,","venue":null,"work_id":"43a73494-9996-489a-969a-d69275eeb61e","year":2024},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.480582Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:20d9d197aeea21dfcf7bf538f46435ae2344dc1b0db24d4648d7bdac7a229a69","observation_id":"d08e0ac3-e61e-409f-857f-78bd57714069","resolution":{"observed_at":"2026-08-05T14:54:17.857347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.829845Z","title":"Exploring fusion tech- niques for multimodal emotion recognition,","venue":null,"work_id":"030c78ca-0ee0-4b7b-84c7-a25806275fdb","year":2024},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.487320Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:11486f1650abfdc5e65c8dfb7d2fbf4b90ecbab61a6738e8717003b9e2b387ac","observation_id":"1678542b-8498-4233-92e3-906bc387af8d","resolution":{"observed_at":"2026-08-05T14:54:17.836199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.810855Z","title":"Decision-level fusion method for emotion recognition using multimodal emotion recognition information,","venue":null,"work_id":"82b059fa-ad3c-4756-9a4a-bb1832929c0c","year":2018},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.493185Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:29c055e5dbd2dd307a42bcfc91c58300edc2163771832aef9a2f35ac974af5b0","observation_id":"5728b906-10ee-4dd3-96a1-12b65cc948ef","resolution":{"observed_at":"2026-08-05T14:54:17.816654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.791752Z","title":"Msp-improv: An acted corpus of dyadic interactions to study emotion perception,","venue":null,"work_id":"75ec299f-b02b-4c13-aaf8-a7eb1b746512","year":2016},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.498178Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:cd9b95d4dd06359d9e4935e75b787b5cf445e1a0b5592d9b11fc8db3938f887f","observation_id":"3c48cca9-0ac8-47b8-8793-4650850f24a0","resolution":{"observed_at":"2026-08-05T14:54:17.798065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01780","last_updated":"2018-08-23T10:05:33Z","snapshot_observed_at":"2026-08-14T20:49:19.423230Z","submitted_at":"2017-07-06T13:31:13Z","title":"On the Role of Text Preprocessing in Neural Network Architectures: An Evaluation Study on Text Categorization and Sentiment Analysis","version":3},"cited_work":{"arxiv_id":"1707.01780","doi":null,"metadata_source":"pith","pith_arxiv_id":"1707.01780","snapshot_observed_at":"2026-08-05T14:54:17.698294Z","title":"On the Role of Text Preprocessing in Neural Network Architectures: An Evaluation Study on Text Categorization and Sentiment Analysis","venue":"cs.CL","work_id":"903179d6-2677-41a7-9ee9-f533e7723f36","year":2017},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.502925Z"},"links":{"cited_paper":"/paper/1707.01780","citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:a5683e42fd2489a88eba133880095c774b6dc82f4d757edf366db23d79806dd9","observation_id":"7f094a71-ca5b-4c9c-a240-ec761c3cef54","resolution":{"observed_at":"2026-08-05T14:54:17.703860Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.508476Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.508476Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:ed43fad87bba76d57608989873deaad03ddcc59cf21469e24eeb39e59830179f","observation_id":"354fadde-c5da-4f08-9afd-5799ccf2ba32","resolution":{"observed_at":"2026-08-05T14:54:17.508476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12250","last_updated":"2022-05-11T08:06:39Z","snapshot_observed_at":"2026-08-13T19:34:02.120028Z","submitted_at":"2021-04-25T20:28:53Z","title":"XLM-T: Multilingual Language Models in Twitter for Sentiment Analysis and Beyond","version":2},"cited_work":{"arxiv_id":"2104.12250","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.12250","snapshot_observed_at":"2026-08-05T14:54:17.659731Z","title":"XLM-T: Multilingual Language Models in Twitter for Sentiment Analysis and Beyond","venue":"cs.CL","work_id":"d8329113-4506-4fc2-835c-ad4f09dcc564","year":2021},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.513720Z"},"links":{"cited_paper":"/paper/2104.12250","citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:e606e1252883fe8b3468b7a5717c7dbb3275cb47f88f746153e67f2bf2a0402f","observation_id":"09989cf1-3f19-4d66-b543-00040bb44b13","resolution":{"observed_at":"2026-08-05T14:54:17.669263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04356","last_updated":"2022-12-06T18:46:04Z","snapshot_observed_at":"2026-08-15T12:11:16.120794Z","submitted_at":"2022-12-06T18:46:04Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04356","snapshot_observed_at":"2026-08-05T14:54:17.518789Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.518789Z"},"links":{"cited_paper":"/paper/2212.04356","citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:6a0fc219ccfa5d3f71da7cb2950d55186dafb7cd079f43e9b38795afc8394583","observation_id":"bbe871e8-4012-4c69-b2a3-b752409ae992","resolution":{"observed_at":"2026-08-05T14:54:17.518789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-07T19:07:36.327251Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-08-05T14:54:17.524335Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.524335Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:84188c733a3d543727006467d814e09ceed65383a85db6ea8fa0402914a6b7d1","observation_id":"81f8d7ef-f632-45ca-98ea-b504a872ab60","resolution":{"observed_at":"2026-08-05T14:54:17.524335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:54:17.757411Z","title":"Comparative analyses of bert, roberta, distilbert, and xlnet for text-based emotion recognition,","venue":null,"work_id":"6a12dd38-7fc1-4d73-bd52-0a170c4211b3","year":2020},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.530014Z"},"links":{"citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:9ef85091dc60dcffc35c861f6871ef7da1f711e741214eb7d644afb922d13ad8","observation_id":"8f9a5fb8-b120-4473-a234-c8f4df5a2f16","resolution":{"observed_at":"2026-08-05T14:54:17.764326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02116","last_updated":"2020-04-08T01:02:17Z","snapshot_observed_at":"2026-08-02T09:09:10.011185Z","submitted_at":"2019-11-05T22:42:00Z","title":"Unsupervised Cross-lingual Representation Learning at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02116","snapshot_observed_at":"2026-08-05T14:54:17.535098Z","title":"Un- supervised cross-lingual representation learning at scale,","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:54:17.535098Z"},"links":{"cited_paper":"/paper/1911.02116","citing_paper":"/paper/2508.20796"},"observation_digest":"sha256:a2e7220d02974acbf0cf852776c8acc268993d269cec827a188ae364b80d767c","observation_id":"840638f8-ece8-44e8-bf30-87ac0c3a3fa0","resolution":{"observed_at":"2026-08-05T14:54:17.535098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.20796","last_updated":"2025-08-28T13:58:09Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-13T01:45:11.574214Z","submitted_at":"2025-08-28T13:58:09Z","title":"Speech Emotion Recognition via Entropy-Aware Score Selection"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":2,"verified_fuzzy":15},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2508.20796."}