{"as_of":"2026-08-21T03:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:977fd443ad1d18fdcc0b85933d8058c20f3e6bf7b5ed194797943d63ae7f608e","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T19:55:18.061325Z","state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16803/citation-record","integrity":"/paper/2607.16803/integrity","json":"/paper/2607.16803/citation-record.json","paper":"/paper/2607.16803"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.132185Z","title":"Speech emotion recognition in mental health: Systematic review of voice-based applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.132185Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:5c8cb1fb68143d01e1cdfc7c7ff6d4a92da89ed2165b4d6bd6e26c2ad6d8c36e","observation_id":"e2fb2689-45d8-42d4-aaf6-31396e32b81d","resolution":{"observed_at":"2026-08-01T19:55:15.132185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.167347Z","title":"Speech emotion recognition using supervised deep recurrent system for mental health monitoring,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.167347Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:f933caa87f9cef04b40e3ba7a960580f4ce7826501ed61dfd69b7695d3fb8eac","observation_id":"126f975b-0878-4c9c-8e6e-4cdf2761252a","resolution":{"observed_at":"2026-08-01T19:55:15.167347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.246690Z","title":"Speech databases, speech features, and classifiers in speech emotion recognition: A review,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.246690Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:a0bff6cefb878ce6ca96ddd1781bccb712ce2603b05a8baa693fcb01cdc6d6d6","observation_id":"ee45029f-86bd-4734-bbbd-3d725f5d458b","resolution":{"observed_at":"2026-08-01T19:55:15.246690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.338720Z","title":"Survey of deep representation learning for speech emotion recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.338720Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:6d56665d7da6886279a987c7a98139124a2621e857ec32ad3ebfb74b7313b9a7","observation_id":"3bd0ab30-ae6b-4711-987f-bccea50bcfe6","resolution":{"observed_at":"2026-08-01T19:55:15.338720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.421480Z","title":"Convolution neural network based automatic speech emotion recognition using mel-frequency cepstrum coefficients,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.421480Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:f35458f4dfd8c7b6c55655b7b4402dd64f8992acb97d9cd7819b47573be31d54","observation_id":"d45d8506-d6e0-4b25-9f34-0ae34ead3588","resolution":{"observed_at":"2026-08-01T19:55:15.421480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.538334Z","title":"Empirical evaluation of deep recurrent deep neural net- works models for speech emotion recognition for real time applications,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.538334Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:f86757086fb8b93175fbc9f77255af815a3ca6a1ab18db3ff9579a967947ac09","observation_id":"034c70b3-dc67-4f25-a3ad-43b8000a67dd","resolution":{"observed_at":"2026-08-01T19:55:15.538334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.713373Z","title":"Vesper: A compact and effective pretrained model for speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.713373Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:b724d442a9a81976e803a76568abcf7d89120222d1c4295ab8d085f8c323e095","observation_id":"a47b5d70-8002-4f77-a443-fcc1dc054b1d","resolution":{"observed_at":"2026-08-01T19:55:15.713373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.815799Z","title":"Benchmarking pretrained models for speech emotion recognition: A focus on Xception,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.815799Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:dce70286e6cf9928b9b9fec6f3aeb5ad7ee9d9a92f460af3d340692385b0db85","observation_id":"ce2af0db-e678-4755-934d-b5ebccacbdf6","resolution":{"observed_at":"2026-08-01T19:55:15.815799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:15.964076Z","title":"Pre- trained deep convolution neural network model with attention for speech emotion recognition,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:15.964076Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:c0457e497b178cca89bf74f4a1211a4a6d7a7d4dee4d8e445aa5feb871051e53","observation_id":"b1dc981c-718e-46f5-b34c-2b1ff992e427","resolution":{"observed_at":"2026-08-01T19:55:15.964076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.129378Z","title":"Tc-net: A modest & lightweight emotion recognition system using temporal convolution network.,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.129378Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:eb8dc0be429c421b2172a6ccf0ab24c04ffe1b5a8afab1e48cc903222ca1038f","observation_id":"422948e7-16ff-4bb2-9eda-c1bbe80c89d9","resolution":{"observed_at":"2026-08-01T19:55:16.129378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.276537Z","title":"LiteLSTM architecture based on weights sharing for recurrent neural networks,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.276537Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:dcd29ac91e3dba68680c1bd6f49b606d1b1d554137e0297f2cdbf21ea2444d0b","observation_id":"1c5e5ce3-b981-40b4-b361-9bd0b7833bfc","resolution":{"observed_at":"2026-08-01T19:55:16.276537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.05630","last_updated":"2018-09-11T18:05:16Z","snapshot_observed_at":"2026-08-14T19:45:30.853949Z","submitted_at":"2018-02-15T16:05:02Z","title":"CNN+LSTM Architecture for Speech Emotion Recognition with Data Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.05630","snapshot_observed_at":"2026-08-01T19:55:16.329557Z","title":"Cnn+ lstm architecture for speech emotion recognition with data augmentation,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.329557Z"},"links":{"cited_paper":"/paper/1802.05630","citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:a0f6e2647fbe99e2037cdcf7396c6e32b5ffd9d1d8ddce4206a2f5f11a2b0032","observation_id":"46a5a2d6-964a-4e20-bac8-14d57085f611","resolution":{"observed_at":"2026-08-01T19:55:16.329557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.385918Z","title":"Speech emotion recognition using deep 1D & 2D CNN LSTM networks,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.385918Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:0f41b2785c6827adde8500f77edab158f6d7c11ae2890832ca7e8b80692640aa","observation_id":"3f31fa8b-53e0-4aa1-b023-cdcc98380ff8","resolution":{"observed_at":"2026-08-01T19:55:16.385918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.455679Z","title":"Robust speech emotion recog- nition using cnn+ lstm based on stochastic fractal search optimization algorithm,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.455679Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:30efba5b8f963be6f0803492b5db8abd9eb338b8eb3c4b24f931028203064048","observation_id":"3e5f3748-ce59-4ac2-bb9b-a916cb0cd2f1","resolution":{"observed_at":"2026-08-01T19:55:16.455679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.516904Z","title":"Speech emotion recognition using deep convolutional neural network and discriminant temporal pyramid matching,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.516904Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:0112b4985f1c45b5a392f658e87b71293cda3d53641bae3e40794a9a8518c4c1","observation_id":"a64f7701-1950-4fde-9e63-7e861ef8a769","resolution":{"observed_at":"2026-08-01T19:55:16.516904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.685671Z","title":"Speech emotion recognition: Two decades in a nutshell, benchmarks, and ongoing trends,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.685671Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:53d2ac003ce13d8d2381efe83e1c6c01b5a1cf468cb04c7d3fa25ac5ec501de2","observation_id":"e0fa6ad4-3220-4c17-9906-15feb4c9526a","resolution":{"observed_at":"2026-08-01T19:55:16.685671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.761965Z","title":"Lightweight deep learning framework for speech emotion recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.761965Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:f4e434d851050cd04c582e2487309fa3fb1bdbb92b77eade56b237f0e9d5eb06","observation_id":"a44ed362-3ea6-4cdd-82f3-8d51b7636143","resolution":{"observed_at":"2026-08-01T19:55:16.761965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.834528Z","title":"Speech emotion recognition on mobile devices based on modulation spectral feature pooling and deep neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.834528Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:b89027ed48573497bfc2748fa37efb8a7f525ad58d99d9b9126e738c8d5e2659","observation_id":"89e1dfd3-fb8d-4f85-b4b0-ba0fa66b1998","resolution":{"observed_at":"2026-08-01T19:55:16.834528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:16.984015Z","title":"A systematic re- view of interpretability and explainability for speech emotion features in automatic speech emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:16.984015Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:06f8fd48d7b46486fcdb22e17e5d6775b2eb2f157c057490f287542355adffd9","observation_id":"e646d0a4-68b9-4e88-bce3-b81131eeea7a","resolution":{"observed_at":"2026-08-01T19:55:16.984015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23437","last_updated":"2025-06-30T00:21:07Z","snapshot_observed_at":"2026-08-17T21:16:09.510719Z","submitted_at":"2025-06-30T00:21:07Z","title":"From Large-scale Audio Tagging to Real-Time Explainable Emergency Vehicle Sirens Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23437","snapshot_observed_at":"2026-08-01T19:55:17.069432Z","title":"From large- scale audio tagging to real-time explainable emergency vehicle sirens detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.069432Z"},"links":{"cited_paper":"/paper/2506.23437","citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:6274adbd693d8c951e556962244a6b1b38bb2ada83f5892a1b0f3772d934d4bb","observation_id":"130b39d2-963d-48e0-8b00-9211cf7d7743","resolution":{"observed_at":"2026-08-01T19:55:17.069432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.161487Z","title":"Grad-cam: Visual explanations from deep networks via gradient-based localization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.161487Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:0970a78569d771986b9b9d703193dbfbaebd25278045779caa51eb5ea06079e7","observation_id":"2e652d45-0a4d-4863-a6f4-d97e252aed99","resolution":{"observed_at":"2026-08-01T19:55:17.161487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.294713Z","title":"Socio-technical risks of clinical speech-to-text systems: Transparency, privacy, and reliability challenges in ai-driven documen- tation,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.294713Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:84ff366fdbf8d2d2ef0100979021c0ba31c1e8521fe4fdb9699601ecb8cc9f49","observation_id":"124f356c-fbdd-4aaf-99e5-fca7bb8e7f3b","resolution":{"observed_at":"2026-08-01T19:55:17.294713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.439760Z","title":"Fusion of log-mel spectrogram and acoustic features for driver speech emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.439760Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:aaa666949afec48533818a0880f4d0db355ecc73ce2fc475de4453620470cc70","observation_id":"881b3a08-9c43-44d1-bee0-057fb0240f64","resolution":{"observed_at":"2026-08-01T19:55:17.439760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.506914Z","title":"Combining frame and turn-level information for robust recognition of emotions within speech,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.506914Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:d56e75cdeca05eeadcbb70fca496b51d2502ed78d1c45c26c045f720ad361094","observation_id":"7778bbaf-292c-4ea2-8870-c41c229e78d9","resolution":{"observed_at":"2026-08-01T19:55:17.506914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.579051Z","title":"Audio-visual feature selection and reduction for emotion classification,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.579051Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:10669a51fa99804689cfa4d5f94d1faae471794d1e6ec37d934932c8f7c94d01","observation_id":"7210a7cd-c667-4558-baa5-1a56a5804b26","resolution":{"observed_at":"2026-08-01T19:55:17.579051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.647710Z","title":"Speech emotion recognition using convolutional neural networks with attention mecha- nism,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.647710Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:25ddc96ad50d4f8b808a45f090d875dba1298cdcb36970f3e80b99be94a8c2d6","observation_id":"b264b867-d2fe-43e7-8aea-aa7501763ee7","resolution":{"observed_at":"2026-08-01T19:55:17.647710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.693481Z","title":"Speech emotion recognition based on adaptive feature fusion network,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.693481Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:32c32d1233c97789ddfc7300695b4a6a61759ce8533c2d52f736d8ea1673bbd2","observation_id":"e4ce8fbf-c489-4a1c-9c89-c09d0e514651","resolution":{"observed_at":"2026-08-01T19:55:17.693481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.744900Z","title":"Speech emotion recognition through hybrid features and convolutional neural network,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.744900Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:37650b3f6c216872abcc94d5fb292a2b48e813eb3e46c4a9f9f6b076efcff695","observation_id":"56dc4ed1-1955-478e-a713-c52e5753b16b","resolution":{"observed_at":"2026-08-01T19:55:17.744900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.782052Z","title":"Speech emotion recognition and classification using hybrid deep cnn and bilstm model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.782052Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:d92a2aacc9d33be65953715b1ee3165420b438d0aa63e7ea1cd5e73745c1aa57","observation_id":"e9b88f8c-e861-47ad-910a-2fd763d4b581","resolution":{"observed_at":"2026-08-01T19:55:17.782052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.789503Z","title":"Recognition of emotion behind speech using deep learning RESNET algorithm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.789503Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:b47e990cbeb87c8200476ac5df028c3ffe820b243fb0a4b75ac3836034386f11","observation_id":"b87afb48-2d78-416d-991f-3e7ee1f18d0e","resolution":{"observed_at":"2026-08-01T19:55:17.789503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.864835Z","title":"A deep learning approach for speech emotion recognition optimization using meta-learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.864835Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:a9bf491770b58832e310ff02405e12847b5bd2bdbac02c05075b6430327f7a03","observation_id":"193d198d-8a49-4384-a46d-98128db85c5d","resolution":{"observed_at":"2026-08-01T19:55:17.864835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:17.961201Z","title":"Speech emotion recognition using deep learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:17.961201Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:2f455deba523c5fd418e57e540b41b3b8e72a6aac23af921ad8237f0efa9be7a","observation_id":"84283575-78ca-4a86-a04a-08e4087bdc4e","resolution":{"observed_at":"2026-08-01T19:55:17.961201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T19:55:18.001403Z","title":"Speech emotion recognition using machine learning: A comparative analysis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:18.001403Z"},"links":{"citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:055e363e6bfdd8be034e173efe9f2458b34d9d3a10505fe2fd1efda447db0b87","observation_id":"155148c2-8af5-4133-a3e9-e8f452b4a92a","resolution":{"observed_at":"2026-08-01T19:55:18.001403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.10666","last_updated":"2025-01-18T06:15:54Z","snapshot_observed_at":"2026-08-13T23:14:53.674755Z","submitted_at":"2025-01-18T06:15:54Z","title":"Speech Emotion Detection Based on MFCC and CNN-LSTM Architecture","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.10666","snapshot_observed_at":"2026-08-01T19:55:18.061325Z","title":"Speech emotion detection based on MFCC and CNN- LSTM architecture,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T19:55:18.061325Z"},"links":{"cited_paper":"/paper/2501.10666","citing_paper":"/paper/2607.16803"},"observation_digest":"sha256:7a631006a629f970c954697acf701a45aef9738c2c20df59d2673d08cc3bfce3","observation_id":"9e87df13-b8c2-4bf1-a5e3-5575ff89b164","resolution":{"observed_at":"2026-08-01T19:55:18.061325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16803","last_updated":"2026-07-18T12:50:33Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T18:29:51.458353Z","submitted_at":"2026-07-18T12:50:33Z","title":"Explainable Lightweight Compact Deep Models for Speech Emotion Recognition"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 0 inbound Pith citation observations for arXiv:2607.16803."}