{"as_of":"2026-08-18T23:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:172b1a824dffe6299484686e2f7464713cd48dd2e1b97007f8cf6a7fef037030","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:03:46.423506Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.10408/citation-record","integrity":"/paper/2501.10408/integrity","json":"/paper/2501.10408/citation-record.json","paper":"/paper/2501.10408"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.158505Z","title":"Survey on speech emotion recognition: Features, classification schemes, and databases,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.158505Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:c52c626dc4cb577d00eaec18ec997e7f7afae995c610cd92d38906a309817f45","observation_id":"5d9f458a-2b9d-42e0-97c9-c9e1efbf47d0","resolution":{"observed_at":"2026-08-10T22:03:46.158505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.230590Z","title":"Automated screening for distress: A perspective for the future,","venue":null,"work_id":"93ed2fe1-2762-4aad-a97f-c95c9d560333","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.163148Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:ff6a190e70fe4ffb3b69269847bb2029fb0275802678cb525e1ffa58afd40be9","observation_id":"7fcfe993-29b8-4819-9a9d-b516735e2180","resolution":{"observed_at":"2026-08-10T22:03:47.235024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.217450Z","title":"A comprehensive review of speech emotion recognition systems,","venue":null,"work_id":"5fcb75fc-6fb2-4374-a2ff-68eb3a05ca95","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.167285Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:529b5bd0b1d8bf9ceabd2355f40f62f4c8fdefbe4ce9c32cd9a2e5aefe779ad0","observation_id":"2136bb00-d04d-4c7c-8408-55edfd3d2f94","resolution":{"observed_at":"2026-08-10T22:03:47.222037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.204397Z","title":"A systematic review on affective computing: Emotion models, databases, and recent advances,","venue":null,"work_id":"621a9948-7ccd-4c29-b34b-4c0837e49db7","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.171506Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:1198e4ad6e3494a75ba34aa594ed66c52c2c1bb192861508549622acbfd6e141","observation_id":"6bfd99bb-f33e-4e79-b448-8ddcb0ce83e9","resolution":{"observed_at":"2026-08-10T22:03:47.208815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.191896Z","title":"Speech emotion recognition based on hmm and svm,","venue":null,"work_id":"455ae75d-8316-4a7e-89ec-c0bdc5e2cb15","year":2005},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.175572Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:3613bf774271c911e2dc79e38b6501ef2a157a2682b79d7b41d927b40c6812a7","observation_id":"f4bdc4c7-2d10-403c-aced-091b912dd74e","resolution":{"observed_at":"2026-08-10T22:03:47.196125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.179442Z","title":"Speech emotion recognition using fourier parameters,","venue":null,"work_id":"8c360479-34d4-40f0-b13a-d19b2be040cf","year":2015},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.179384Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:16ce01ff2f37c9313de795a4aa8125b861ccb89e13440fa2a65af7a3d1458d54","observation_id":"8e9a929a-100d-4543-a310-aea698f690b2","resolution":{"observed_at":"2026-08-10T22:03:47.183388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.167514Z","title":"Implementation and comparison of speech emotion recognition system using gaussian mix- ture model (gmm) and k-nearest neighbor K-NN techniques,","venue":null,"work_id":"d89e7aa9-cf5d-44db-953a-7089cf1b717a","year":2015},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.183781Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:8910a47221e698d16faa25fe7e835e6a07eb23e608302c214607fab5ff5053f1","observation_id":"cafb2ea4-c30f-4b5d-804b-71580730622a","resolution":{"observed_at":"2026-08-10T22:03:47.171983Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.187538Z","title":"Speech emotion recognition using deep learning techniques: A review,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.187538Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e8fc4839117d3251207eb416974fa41f7fe968fc10463ba467862a87593ba6c1","observation_id":"53bd97bb-f986-429d-bb1e-b3e633253f65","resolution":{"observed_at":"2026-08-10T22:03:46.187538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.147746Z","title":"Deep learning approaches for speech emotion recognition: State of the art and research challenges,","venue":null,"work_id":"b381e4bc-b165-49eb-92d6-433f564f43d2","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.191149Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:be9ef80d107b960c9ea55eb9c86c82624653e4c9abc017e20cd1b99e83b280d8","observation_id":"eba3a012-aedf-4141-aac3-2c045f8600fa","resolution":{"observed_at":"2026-08-10T22:03:47.151911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.136141Z","title":"Speech emotion recognition: A review,","venue":null,"work_id":"43ec71ef-32a8-4ff8-a1fd-949458b27602","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.194664Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:1cf463325d82bf50abe991c9ebc2564f6e34c2b96aebb05e46bbbc51dd3f5ec5","observation_id":"10111b15-b7e0-4516-a1bb-3847a9d1bf30","resolution":{"observed_at":"2026-08-10T22:03:47.140142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.125401Z","title":"Self-supervised speech representation learning: A review,","venue":null,"work_id":"c9577b2c-f5cd-48e1-a86b-8425ba16951a","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.198403Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:dcf9a7a3a0e85236157ffeab33b909f6fe7383c0ef40133cb89b8f6d4df8c6a8","observation_id":"7ca597b3-62f9-495e-a587-5efba9288d31","resolution":{"observed_at":"2026-08-10T22:03:47.129132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.114316Z","title":"Cross-corpus speech emotion recognition using semi-supervised transfer non-negative matrix factorization with adapta- tion regularization","venue":null,"work_id":"cd738f8d-718a-47e8-9619-15a5a38ec8b7","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.202037Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:f947475ce45dfae07593019807f8bc591892812688a61d501f2f420ce8c2b30b","observation_id":"54ea93b7-b461-4e08-ac93-dcf46326a465","resolution":{"observed_at":"2026-08-10T22:03:47.117859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.104060Z","title":"Multisource i-vectors domain adaptation using maximum mean discrepancy based autoencoders,","venue":null,"work_id":"94d6b43e-36f5-44fb-a819-c39bc0d70343","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.205681Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:0aefed555a9d44eb9b0c7248cb25bea7b026b966a317bfdf46b696e69f7f80e0","observation_id":"5aafa406-d37a-4a45-b8ff-02121f1d7764","resolution":{"observed_at":"2026-08-10T22:03:47.107450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.209137Z","title":"Self-supervised learning for multimedia recommendation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.209137Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:460f5c135fd340f2f0662cf4fda8a555a9059bceb99f09d88db489dbbfe73030","observation_id":"6004547b-3651-4129-b6c9-89687eefa887","resolution":{"observed_at":"2026-08-10T22:03:46.209137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.085354Z","title":"V oicepm: A robust privacy measurement on voice anonymity,","venue":null,"work_id":"f607f866-4e36-46b2-a9e0-15c2304880d1","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.212888Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:fc96b11d40538541e0e8d7164ca8de37cc9458c3b37d486ac6475b6a835ca910","observation_id":"f35da031-9485-42b1-8e35-3962b573b406","resolution":{"observed_at":"2026-08-10T22:03:47.089422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07162","last_updated":"2024-06-11T11:12:51Z","snapshot_observed_at":"2026-08-16T13:44:13.132375Z","submitted_at":"2024-06-11T11:12:51Z","title":"EmoBox: Multilingual Multi-corpus Speech Emotion Recognition Toolkit and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07162","snapshot_observed_at":"2026-08-10T22:03:46.216697Z","title":"Emobox: Multilingual multi-corpus speech emotion recog- nition toolkit and benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.216697Z"},"links":{"cited_paper":"/paper/2406.07162","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e9a01b1ec6255f175b5d1a80068e6f74ef28473300f030246a689187c625fb0d","observation_id":"9b40a672-56f6-44db-bbc9-79e3aa93cda2","resolution":{"observed_at":"2026-08-10T22:03:46.216697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.073908Z","title":"Distilhubert: Speech rep- resentation learning by layer-wise distillation of hidden-unit bert,","venue":null,"work_id":"beae2a32-4fc5-48a0-bb61-46e560b988dd","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.221057Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:549a3c8c72fd525a885b16ffcfd51cdc8702b9b301cad4a2317e580a21fbab56","observation_id":"93248707-0b57-4517-b528-d7068f787745","resolution":{"observed_at":"2026-08-10T22:03:47.078403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.050897Z","title":"Cross- corpus speech emotion recognition with hubert self-supervised represen- tation,","venue":null,"work_id":"d65c8916-9931-49cf-8fd2-f0298f377231","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.228550Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:40ff068ec84628049b846918c8c42098119f4fcd37e56f5a6f49a3b91c6498cc","observation_id":"400e1269-1d19-4870-beeb-31daa841da73","resolution":{"observed_at":"2026-08-10T22:03:47.054835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.028195Z","title":"Representation learning through cross-modal conditional teacher-student training for speech emotion recognition,","venue":null,"work_id":"707de1df-1939-45c4-93d9-f89dc8c2d930","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.236144Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:35b4a79887082ff8e4f126eebb1742065bc51370eeaa95eea76d23a6c291d0ca","observation_id":"9ca3722d-d12f-4a91-a515-6e85776180bb","resolution":{"observed_at":"2026-08-10T22:03:47.032530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.039740Z","title":"Multi-lingual multi-task speech emotion recognition using wav2vec 2.0,","venue":null,"work_id":"cb90ca2d-fcef-402f-a1c9-7405ee604d3f","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.239811Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:d7f6075e022167c3da7b5d9756d90b747ad76f40d7583977222591dad8fe8034","observation_id":"e9528ff4-ea07-44b5-8e2c-e783a2cdc060","resolution":{"observed_at":"2026-08-10T22:03:47.043852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.016626Z","title":"A systematic literature review of speech emotion recognition approaches,","venue":null,"work_id":"e9b7b8b0-efcb-4889-998b-a23faf14f692","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.243277Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:6a9dd227266ce28a91305144e897c87a2d91ec0e5e5a1403e81b5b660b0db000","observation_id":"97025186-4438-4199-ab80-91f3e70e8bf6","resolution":{"observed_at":"2026-08-10T22:03:47.020648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.004463Z","title":"Speech emotion recognition using sequential capsule net- works,","venue":null,"work_id":"d360f91f-be0e-4055-ac85-3721c0bf2dd1","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.246846Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:c0108bec08bc75cc5a1ab42dab8a26458698e650cf3b3d98d0ff5e409a5e1e6b","observation_id":"43f0ceff-e65e-4675-806d-ec65f6e7d3bf","resolution":{"observed_at":"2026-08-10T22:03:47.008668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.992974Z","title":"Transformer based unsupervised pre-training for acoustic representation learning,","venue":null,"work_id":"7ff715de-6007-4b77-a3e7-5bea470c812b","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.250373Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:7fb8e4dcd6b30c12d82644dd3e58e4e3dbe96f9848d640898e02173a96642406","observation_id":"f0550e3e-0284-4f9e-958b-b921ddc39129","resolution":{"observed_at":"2026-08-10T22:03:46.996977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.980635Z","title":"Contrastive unsupervised learning for speech emotion recognition,","venue":null,"work_id":"e9ee8c51-dfdf-4ff3-847f-1bc115d007c8","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.253761Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:bbf782353f8ee76765168398c8cf249798d2e1af5a618e391622e54803d3b680","observation_id":"4b49e13e-484d-49cb-9b74-d3734ff4ceff","resolution":{"observed_at":"2026-08-10T22:03:46.985001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.968787Z","title":"Cross-corpus classification of realistic emotions–some pilot experiments,","venue":null,"work_id":"323def08-0c1a-4af9-bbb1-5f80e8e93562","year":2010},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.256684Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:2b29204fd435e3143219dfc19460e27a60ef27c72ae489989408a250510855b1","observation_id":"343226f7-59e1-4756-ace0-0a571e0216ac","resolution":{"observed_at":"2026-08-10T22:03:46.972663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.958164Z","title":"Using multiple databases for training in emotion recognition: To unite or to vote?","venue":null,"work_id":"63e10901-bcd0-48af-91f9-1724cbb90e2f","year":2011},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.259863Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:4eaa399b17701de2a91b6b16aba9d061f1a5088c16cb6f4b3dc474ec1242fbc6","observation_id":"90c716c7-c6bf-4905-94a4-07fe633321bb","resolution":{"observed_at":"2026-08-10T22:03:46.962020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.932767Z","title":"Cross lingual speech emotion recognition: Urdu vs. western languages,","venue":null,"work_id":"3c4a3670-d34e-4659-a724-6bdf8de7e91e","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.265679Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:f916e9c3a1f699a912e54046fc46d7e6f4965815ec0a834a693836f6a1cfe22d","observation_id":"e89833ab-4ca0-44a7-984c-3b6c2cf0ecf0","resolution":{"observed_at":"2026-08-10T22:03:46.937417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.919073Z","title":"A study on cross-corpus speech emotion recognition and data augmenta- tion,","venue":null,"work_id":"371f4ab9-1089-431d-a160-3379b3ce31b6","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.268532Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:bdedd9af0fdb91c9cd4a7844eb7fba18f21f6fb2a34fcc8631a424460b112926","observation_id":"0b3c17dd-5112-46e6-a076-36c1360e710b","resolution":{"observed_at":"2026-08-10T22:03:46.923837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.271286Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.271286Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:8d6aa6345911ad8956ed9629a737dc97bb8f12babcc8ec1f728e5f18cad90389","observation_id":"f14ac591-040d-4b74-b210-26fa306e9e72","resolution":{"observed_at":"2026-08-10T22:03:46.271286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03502","last_updated":"2021-04-08T04:31:58Z","snapshot_observed_at":"2026-08-16T18:33:07.507126Z","submitted_at":"2021-04-08T04:31:58Z","title":"Emotion Recognition from Speech Using Wav2vec 2.0 Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03502","snapshot_observed_at":"2026-08-10T22:03:46.274112Z","title":"Emotion recognition from speech using wav2vec 2.0 embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.274112Z"},"links":{"cited_paper":"/paper/2104.03502","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:476b6031a8575d4520ca3a42da44ce42d9cdf7bd21d3b4f3ecbd35bdb1aacb0b","observation_id":"fa02346d-452d-47ac-91a8-54bdf61fe6c4","resolution":{"observed_at":"2026-08-10T22:03:46.274112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.277544Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.277544Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:5dd5cdf53f54907152a017e83e941cf7473fb2038bf710211bbe2fb536045cb9","observation_id":"1a3dadf8-57c4-421f-9ee0-4d15698724f0","resolution":{"observed_at":"2026-08-10T22:03:46.277544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T22:03:46.280610Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.280610Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:6c1196d77ed4b5f62028d76b4cd7c7b0b2717d71c60393adbb942d7bc2e6422f","observation_id":"c68edca5-7a1a-426c-a7ff-02e20c3b098d","resolution":{"observed_at":"2026-08-10T22:03:46.280610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.889787Z","title":"Unveiling em- bedded features in wav2vec2 and hubert msodels for speech emotion recognition,","venue":null,"work_id":"8e1f1abe-a687-4cc8-a95a-16446b07feaa","year":2024},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.284910Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:6b7a1a8d5f1549706ab1bb37dd2859e1fd1b17adbc05b1cf1a251c76958ceb48","observation_id":"037f3f20-ed5d-4395-84af-fe1224603bdc","resolution":{"observed_at":"2026-08-10T22:03:46.894905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.875860Z","title":"Layer-wise analysis of a self- supervised speech representation model,","venue":null,"work_id":"61dc8238-3f2c-430d-8c5b-b631a406da31","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.288780Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:bf8af7df2e2f537436be8fa62ddc938b1fd51631e534c7dd26e552552c0e4b3f","observation_id":"338da2a7-2f0a-4d57-b961-6368ccf41018","resolution":{"observed_at":"2026-08-10T22:03:46.879795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.863020Z","title":"Multiple acoustic features speech emotion recognition using cross-attention transformer,","venue":null,"work_id":"4ee75979-8948-4598-9fd5-994da84275fc","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.292238Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:fbbd6244a64269d1f522e51d22a963c2fbfa92269e6acda325a335fd96eb7851","observation_id":"1fa10ff4-f3f1-48d7-ba42-7b07a6951420","resolution":{"observed_at":"2026-08-10T22:03:46.867830Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.849357Z","title":"Speech emotion recognition using local and global features,","venue":null,"work_id":"60755de1-758c-4dcf-aa9f-bd0189e6432d","year":2017},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.295572Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:eb17d7098e0278068faea42e4a85521edaed3badc3469933d7fc1fc9df39a09b","observation_id":"f685dcdd-657d-4155-84ac-8a6c61275ade","resolution":{"observed_at":"2026-08-10T22:03:46.854580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.299358Z","title":"Modeling prosodic features with joint factor analysis for speaker verification,","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.299358Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:a948f9824e13e2deb095cea5accb49260b7e7a8a4f9ba7bd041a12317f904ea3","observation_id":"cb2f5bd9-4d17-4cab-8f74-c2793d99fdaf","resolution":{"observed_at":"2026-08-10T22:03:46.299358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.828730Z","title":"A novel feature selection method for speech emotion recognition,","venue":null,"work_id":"b91d104d-6a56-477b-9810-916486e0cddf","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.302957Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:aa4f6d558494cb3a4fb82bd5bd17bf297cddfe3bf2183e7c35cb68737cf78cc0","observation_id":"d292971c-9eb5-4d50-bf3c-69d234cad1e6","resolution":{"observed_at":"2026-08-10T22:03:46.833622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.815342Z","title":"Analysis of linguistic and prosodic features of bilingual arabic–english speakers for speech emotion recognition,","venue":null,"work_id":"151ac4ff-953e-402e-ba70-d5733c7bb3c4","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.306418Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:48b56676ade3a959907dec194e42c0110d425f559038bc024e0ffa85b5474486","observation_id":"dfc004f2-7f58-48e6-89a4-2625872800b5","resolution":{"observed_at":"2026-08-10T22:03:46.819871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.310892Z","title":"Towards an automatic evaluation of the dysarthria level of patients with parkinson’s disease,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.310892Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:ddf754ffb82cab53dae85da3d8b781647fad662953b06d14f4fb82e9ff0c1b08","observation_id":"8af5c4ff-fc55-4de5-b71d-676536114824","resolution":{"observed_at":"2026-08-10T22:03:46.310892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.795094Z","title":"Speech emotion recognition based on multiple acoustic features and deep convolutional neural network,","venue":null,"work_id":"b0760c64-5817-4ef2-9c0a-0706af614493","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.314890Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:7766a82de79b62c7c2fdf155ec3ef787a1255fbbf1b851c266bbd6e1a4c0657c","observation_id":"5337d1f6-a749-4037-a1d9-b67e06b47cbd","resolution":{"observed_at":"2026-08-10T22:03:46.799357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.785045Z","title":"Speech emotion recognition using mel frequency log spectrogram and deep convolutional neural network,","venue":null,"work_id":"ddd44a0f-29e0-4551-bcf7-45f49d5833e8","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.318695Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:de8cce6780e158e5a8bf7cf75729ad6a5444669d08367df31e6898918faafe09","observation_id":"c56a6026-5de0-47d0-b64f-14c5bcbfcb22","resolution":{"observed_at":"2026-08-10T22:03:46.788227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.775033Z","title":"Learning deep features to recognise speech emotion using merged deep CNN,","venue":null,"work_id":"46bae244-0070-44e8-b5be-b04624dc8c51","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.323360Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e4f2db2bed118d94275f2d7a13e136fec24ad80ff049aec23156fccc8d9453df","observation_id":"2e3501cb-d60e-466a-8c92-4c2ec6c94b6a","resolution":{"observed_at":"2026-08-10T22:03:46.778509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11625","last_updated":"2022-09-23T14:51:55Z","snapshot_observed_at":"2026-08-17T03:04:55.131773Z","submitted_at":"2022-09-23T14:51:55Z","title":"The SpeakIn Speaker Verification System for Far-Field Speaker Verification Challenge 2022","version":1},"cited_work":{"arxiv_id":"2209.11625","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.11625","snapshot_observed_at":"2026-08-10T22:03:46.483815Z","title":"The SpeakIn Speaker Verification System for Far-Field Speaker Verification Challenge 2022","venue":"cs.SD","work_id":"366c1aa7-aad1-47e0-901a-f543a3d7e924","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.327790Z"},"links":{"cited_paper":"/paper/2209.11625","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:76c9a46a8f02c458f2546eb1685012a89eea478000e14e3a4a71ac00a9979d5d","observation_id":"aaa42b2d-2d11-4800-a419-be10441767e2","resolution":{"observed_at":"2026-08-10T22:03:46.491560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.764233Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"1caf253b-53d1-40bd-8596-6d66a7a57192","year":2008},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.332005Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:f941705f8ddcf540345cf6bc6dfc9017a49fb048a3e06575269e9aaec20efd79","observation_id":"1adcb3af-0096-48bd-982d-03183cda01fb","resolution":{"observed_at":"2026-08-10T22:03:46.768265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.750428Z","title":"The ryerson audio-visual database of emotional speech and song RA VDESS: A dynamic, multimodal set of facial and vocal expressions in north american english,","venue":null,"work_id":"bb347841-a270-4610-9287-e8c66731f616","year":2018},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.335878Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:4b01e97244745c98d8b567f35749e28862dda13e3e588766f380cbf88469fd2d","observation_id":"10d4eb0b-110f-4a64-8e1b-463a04f36d52","resolution":{"observed_at":"2026-08-10T22:03:46.755318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.738376Z","title":"Real- time end-to-end speech emotion recognition with cross-domain adapta- tion,","venue":null,"work_id":"ca1259a6-29d5-444b-96c8-d7cb1740201b","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.339578Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:9bedd1cc123372d1950dd85d2d87e691691496a4d0fcfc33153962ceee3503b6","observation_id":"bc1a721e-f373-4eb8-9588-e8a26d4e8a97","resolution":{"observed_at":"2026-08-10T22:03:46.742387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.724617Z","title":"A database of german emotional speech","venue":null,"work_id":"82d4b387-969b-440b-bc2e-a76609fb7d6d","year":2005},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.343453Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:eab7ad4b8c1bc9fa5ecfe6acc8aebb40f5de694793aa8ef7aac16e46095b311c","observation_id":"caa75239-bb26-49a2-a7f8-401f5e1cd636","resolution":{"observed_at":"2026-08-10T22:03:46.729141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.712379Z","title":"Emovo corpus: an italian emotional speech database,","venue":null,"work_id":"62c9f585-fccd-4cf1-9e02-667e57eb9ed0","year":2014},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.347276Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:5399fc9d2bf63d3516b3b9b163c8285f5b2d8622f044015c6b7efa38864f2504","observation_id":"b185e9a2-5251-4935-9818-eec808a3723e","resolution":{"observed_at":"2026-08-10T22:03:46.716831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.698666Z","title":"The mexican emotional speech database (mesd): elaboration and assessment based on machine learning,","venue":null,"work_id":"ded914a8-7b27-4e11-b4c0-28f13a44dbae","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.351021Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:925e5d0bc0097d0dc77f0c36e3590d86d988ff7feaf583a225425da51c5e1a94","observation_id":"7db1f795-113e-4958-87b5-8f0d9812ddd4","resolution":{"observed_at":"2026-08-10T22:03:46.703398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.354658Z","title":"Emotional voice conversion: Theory, databases and esd,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.354658Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:c5d2741617555e416434fce92a25fbf17136a97f7e9c100642e3809eaa0bc922","observation_id":"2b29674c-226a-49af-92e2-a3054f1ea25a","resolution":{"observed_at":"2026-08-10T22:03:46.354658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.677357Z","title":"Towards discriminative representations and unbiased predictions: Class-specific angular softmax for speech emotion recognition","venue":null,"work_id":"32a0aa97-7bf3-430e-9842-cee3375c1765","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.358869Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:ff0ca637649aea6c2a79df1d838d33c2a7dd7c220509dbbb25afb2e3b259b69c","observation_id":"b28167ab-7754-40e5-bda5-81796de291b3","resolution":{"observed_at":"2026-08-10T22:03:46.681547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.665166Z","title":"Improving speech emotion recognition using graph attentive bi-directional gated recurrent unit network,","venue":null,"work_id":"b0c2afad-d4cb-4325-9bb8-2796ec89ccc2","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.362435Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:4bb89e1f1118288bdee27bd7de39e985fd77a3624919ab36720d63e93eef6288","observation_id":"f877a1a3-1829-47ba-af7a-88ba5f563faf","resolution":{"observed_at":"2026-08-10T22:03:46.669951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.654462Z","title":"Hgfm: A hierarchical grained and feature model for acoustic emotion recognition,","venue":null,"work_id":"c5d73649-996d-4c04-b9f7-a6967657122d","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.366274Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:4570b19d2d6e22c60d46e6fd16c4ce0f3cc222b07f4d7444ae0755988a1e1f28","observation_id":"910aa210-3996-44b8-a6af-1394c5706a06","resolution":{"observed_at":"2026-08-10T22:03:46.657924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.643201Z","title":"Cross- corpus speech emotion recognition with hubert self-supervised represen- tation,","venue":null,"work_id":"b09788ff-a99c-44a0-ba6f-0646f196c980","year":2022},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.370150Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:c5179a90b7ddfda3075ad962130858f6ef583daf891b61e35ffe8e92ceebacef","observation_id":"a9dcfab3-f59b-4bc0-a18a-3285263b20b0","resolution":{"observed_at":"2026-08-10T22:03:46.646773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.631957Z","title":"Temporal modeling matters: A novel temporal emotional modeling approach for speech emotion recognition,","venue":null,"work_id":"f4b61348-f83b-48a6-9a8c-aaef933662a2","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.374518Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:38ae3df3616a6a0497e00b433e98e9835016c4dd995b11abb1c112e0cd1e57a5","observation_id":"b319171d-682a-4f14-bbf7-d215ffdd5c9b","resolution":{"observed_at":"2026-08-10T22:03:46.635793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.618706Z","title":"Learning multi-scale features for speech emotion recognition with connection attention mechanism,","venue":null,"work_id":"8092dfcf-42ec-4967-a8bf-6b745de3e601","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.378567Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:eb104bac2d34be04a84cbbb4a9666244032f3e18636ee5841cbc6d7801ee127d","observation_id":"12670868-5e41-4cfc-ba70-eaa9de08a6bb","resolution":{"observed_at":"2026-08-10T22:03:46.622964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:47.061920Z","title":"Exploring wav2vec 2.0 fine tuning for improved speech emotion recognition,","venue":null,"work_id":"945fb242-0110-4695-bbb1-f1d958e0319e","year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.382309Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:113000d6a7f4f58ebe0518c25bf847422e858786a4ec7f93356004cda031b77b","observation_id":"9b089bd3-6681-4a5b-bdf6-203a974d190d","resolution":{"observed_at":"2026-08-10T22:03:47.065910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.606067Z","title":"Unsupervised adversarial domain adaptation for cross-lingual speech emotion recognition,","venue":null,"work_id":"e4e0acc8-8c11-4daf-b562-a4c8d05acb91","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.385929Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:173aa4796c1ed8f022b6ec0cf6c7931c5555fff443bd0e629ab2b3074f18ee1f","observation_id":"ef116f2c-77f8-4266-ba98-430ea4343ea2","resolution":{"observed_at":"2026-08-10T22:03:46.610408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.592225Z","title":"Speech emotion recognition from 3D log-mel spectrograms with deep learning network,","venue":null,"work_id":"f7fe17ce-e27c-457f-98e2-485716f79f45","year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.390039Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:39bef47b1d187ce69faab9a77cece521048493d169c469650fd33274107a717c","observation_id":"66fd3c04-cf38-4ab0-897b-42ef636f72b9","resolution":{"observed_at":"2026-08-10T22:03:46.597142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.579402Z","title":"Fusing visual attention CNN and bag of visual words for cross-corpus speech emotion recognition,","venue":null,"work_id":"f3e92361-f5a6-4440-9a2a-35d6e52a3704","year":2020},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.393861Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:93300ffb541ee10cd42987d7dbfedaf8a8a3ece6f27850be04257bfae1de8ddb","observation_id":"1a243e78-a50c-4836-b71b-d274313efb63","resolution":{"observed_at":"2026-08-10T22:03:46.583333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.945462Z","title":"Cross corpus multi-lingual speech emotion recognition using ensemble learning,","venue":null,"work_id":"e3cf4fdd-079b-486f-beb2-7397cbfcbc98","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.397391Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:e44f7aff479e9bc1bb1cb05cf7111f8da2e7587fcda3250c1e93c675d11c285f","observation_id":"0dd1f7e1-74d4-475d-8937-b7ce804bb2bf","resolution":{"observed_at":"2026-08-10T22:03:46.949879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.567419Z","title":"Cross-corpus speech emotion recognition based on few-shot learning and domain adaptation,","venue":null,"work_id":"8884569b-b327-4e80-8965-309877ee2318","year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.400427Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:a46fa5b29d48f829b91ceb23a75ce6125f4d0a14fbc00061116ac6db3935f12c","observation_id":"7fe177a5-5e7c-4965-8f01-0b397131db6e","resolution":{"observed_at":"2026-08-10T22:03:46.572085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.404732Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.404732Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:38ec28b66a3ae17dc3dd6fbf777258d2ea4f2611c0540dbd223fcea6c68297a2","observation_id":"01a88162-f488-419d-9c08-11aa484af918","resolution":{"observed_at":"2026-08-10T22:03:46.404732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.546637Z","title":"Enhancing cross-language multimodal emotion recognition with dual attention transformers,","venue":null,"work_id":"48caa6d8-b9bd-4939-87c3-f6ced76d8aec","year":2024},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.409923Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:ffde788d673ab07ecd32064ecaf6957f89f1f0ce88288b562747d143ad991342","observation_id":"e771e516-c8f7-4423-9b4d-68f39fb96eb9","resolution":{"observed_at":"2026-08-10T22:03:46.550903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-08-16T14:33:50.657682Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T22:03:46.414254Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.414254Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:17b05c7a30712399b24900fe035382c371656f659e55325cf75ab72abb62b3a6","observation_id":"76638cb0-65de-4f8a-8bdc-db5c787a6d3e","resolution":{"observed_at":"2026-08-10T22:03:46.414254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09296","last_updated":"2021-12-16T18:29:22Z","snapshot_observed_at":"2026-08-16T17:41:05.963766Z","submitted_at":"2021-11-17T18:49:42Z","title":"XLS-R: Self-supervised Cross-lingual Speech Representation Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09296","snapshot_observed_at":"2026-08-10T22:03:46.418497Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.418497Z"},"links":{"cited_paper":"/paper/2111.09296","citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:2df289c1b4f94b61f3869abd6c8cdb755e9120a1cb866288598ac2fb7b09fa4b","observation_id":"438ddb48-b1ce-4bc2-871a-c440909606d6","resolution":{"observed_at":"2026-08-10T22:03:46.418497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:03:46.423506Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-10T22:03:46.423506Z"},"links":{"citing_paper":"/paper/2501.10408"},"observation_digest":"sha256:2eee6b5718e717751ec6473ca65f0c9f732fbd5e5a8731f1acf57a5f816171ad","observation_id":"f224eeb2-635a-4306-8855-a694e17bbd5d","resolution":{"observed_at":"2026-08-10T22:03:46.423506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.10408","last_updated":"2025-01-06T14:31:25Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-18T08:52:18.090750Z","submitted_at":"2025-01-06T14:31:25Z","title":"Leveraging Cross-Attention Transformer and Multi-Feature Fusion for Cross-Linguistic Speech Emotion Recognition"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":52},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2501.10408."}