{"as_of":"2026-08-21T22:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5638a1dc6bc201feb8226b7f5918e0f42d1a9fbb008c2da6f3af64bf2f33b7d9","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T06:05:02.400801Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:02:30.423708Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-09T13:02:30.482021Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2412.16904","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.16904","snapshot_observed_at":"2026-08-09T13:02:30.482021Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","venue":"cs.SD","work_id":"663b38b5-10bd-4911-8011-e1e51f228d0a","year":2024},"citing_paper":{"arxiv_id":"2502.02196","last_updated":"2025-02-04T10:21:28Z","snapshot_observed_at":"2026-08-18T17:36:00.889474Z","submitted_at":"2025-02-04T10:21:28Z","title":"Exploiting Ensemble Learning for Cross-View Isolated Sign Language Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-09T13:02:30.423708Z"},"links":{"cited_paper":"/paper/2412.16904","citing_paper":"/paper/2502.02196"},"observation_digest":"sha256:c6ec0c63804afe32eae9ab91de5471652d478aa0a61298a74aea1d4f76f15c07","observation_id":"57f34549-ab8b-4030-b1b5-c6da317c987c","resolution":{"observed_at":"2026-08-09T13:02:30.485666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.16904/citation-record","integrity":"/paper/2412.16904/integrity","json":"/paper/2412.16904/citation-record.json","paper":"/paper/2412.16904"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:03.047133Z","title":"Emotion neural transducer for fine-grained speech emotion recog- nition,","venue":null,"work_id":"84d8b1b9-a42c-46af-b411-3679027557ed","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.220581Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:823a0300f4f6e6a1040b8bddc5e0b7fee361cb75c00821d5573e7c8346c45a41","observation_id":"ffc219a4-1d9d-433d-b3d5-a308b19bad9f","resolution":{"observed_at":"2026-08-11T06:05:03.052648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:03.027842Z","title":"Dwformer: Dynamic window transformer for speech emotion recognition,","venue":null,"work_id":"db09b620-3127-4382-a348-3d0635528cb1","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.227454Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:e14382bd1bf44bffe6006fcde2b81a7d27916bc1656e15264a9df2943a4dadf8","observation_id":"d0ed6db6-bb36-4ae1-95da-1637ff1ee4a3","resolution":{"observed_at":"2026-08-11T06:05:03.035193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:03.005309Z","title":"Dst: Deformable speech transformer for emotion recognition,","venue":null,"work_id":"a99f1622-5b45-4bb2-9fa9-2b2a2bc3d105","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.232046Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:c333502d58d7846275207893099acca68c6a6e4ea388a2069534cbf48e60f72e","observation_id":"c5f4eae9-6b9c-4ebc-bbb7-cbcc85d85087","resolution":{"observed_at":"2026-08-11T06:05:03.013534Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.984731Z","title":"Speechformer++: A hierarchical efficient framework for paralinguistic speech processing,","venue":null,"work_id":"e7206b2f-ff19-4022-bcc4-5ee2c89b9ec1","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.237753Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:246b67b7eb35d005ef97cf66a81fd4ebb6790b24d4dd4c5141961b38a5a6f479","observation_id":"b7d27a64-c95a-4d0f-a528-a53856c91a82","resolution":{"observed_at":"2026-08-11T06:05:02.990418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.966733Z","title":"Audio-visual segmentation with semantics,","venue":null,"work_id":"66b3aae4-278f-4a09-921c-59a90f47452b","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.243932Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:9f8162ddd7693aea4284798a3466374211fa465a05e96e393950b18349fc114e","observation_id":"6652a36c-6654-497f-9add-745d5212cf99","resolution":{"observed_at":"2026-08-11T06:05:02.972061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03097","last_updated":"2024-08-06T10:56:53Z","snapshot_observed_at":"2026-08-16T13:28:14.086422Z","submitted_at":"2024-08-06T10:56:53Z","title":"Prototype Learning for Micro-gesture Classification","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03097","snapshot_observed_at":"2026-08-11T06:05:02.248844Z","title":"Prototype learning for micro-gesture classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.248844Z"},"links":{"cited_paper":"/paper/2408.03097","citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:1a43df29e97c234118a124334df0cd4dd9678c688f9c147d0c76c4ea3162904d","observation_id":"85a554be-e995-4e86-b556-f7ce22bd2627","resolution":{"observed_at":"2026-08-11T06:05:02.248844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.948940Z","title":"Data augmentation for human behavior analysis in multi-person conversa- tions,","venue":null,"work_id":"b275a74e-56dc-4cda-a477-bc3dc354b4e3","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.256070Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:ef30fe695fc25629d79940345693475d0c80e4dca57519e1c0da159578c55cd7","observation_id":"c8e25e53-ad64-43e8-ac8b-d2344ec02699","resolution":{"observed_at":"2026-08-11T06:05:02.954013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10749","last_updated":"2024-12-14T08:34:44Z","snapshot_observed_at":"2026-08-19T14:37:49.629651Z","submitted_at":"2024-12-14T08:34:44Z","title":"Patch-level Sounding Object Tracking for Audio-Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10749","snapshot_observed_at":"2026-08-11T06:05:02.260879Z","title":"Patch-level sounding object tracking for audio-visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.260879Z"},"links":{"cited_paper":"/paper/2412.10749","citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:1ddb1af4f30893248de87dbfe7ed35b66e04619dbb69900d6875aefe9a34f564","observation_id":"a3e56950-e7cc-4896-84e2-f034a8d47ce7","resolution":{"observed_at":"2026-08-11T06:05:02.260879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.931355Z","title":"Cluster-phys: Facial clues clustering towards efficient remote physiological measure- ment,","venue":null,"work_id":"e0c056aa-e844-42a1-91ef-c130a88dc026","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.266268Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:23b75c77de23649d769c2323d441d2c5cbf4b66f4b110f170ea24dd77603bbc0","observation_id":"3c34c73b-b367-4613-b0a3-3c4d841031d7","resolution":{"observed_at":"2026-08-11T06:05:02.937145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.914401Z","title":"Speech emotion recognition with co-attention based multi- level acoustic information,","venue":null,"work_id":"b8617272-904f-45af-9c64-48b60da120a8","year":2022},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.272417Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:843ab63c7e755df7174752817755d92d8b6bccbad185e3736a60934057020fe9","observation_id":"b282cc2c-19c8-4deb-97cd-99815dfa91a5","resolution":{"observed_at":"2026-08-11T06:05:02.919402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.276991Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.276991Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:bf6f0d0efd42be1a288fc23db5cc68e0eef48f875a73a8d6eb9d332321e07fb8","observation_id":"1a0927a9-6d01-43b0-b899-c3977fc14b15","resolution":{"observed_at":"2026-08-11T06:05:02.276991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.282597Z","title":"Graph- based multimodal sequential embedding for sign language translation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.282597Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:42f50950bd1661d4b47ba089103295145c574f96e6aebc41fc316be8996dbaac","observation_id":"a5dbde79-197f-496a-a4b2-e058eaa81e60","resolution":{"observed_at":"2026-08-11T06:05:02.282597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.876163Z","title":"Gloss-driven conditional diffusion models for sign language produc- tion,","venue":null,"work_id":"a20c466a-5e11-43ca-89eb-639a13d20e0f","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.287496Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:faeb91b50df61cf19b3adaa44c32ebdaff078a5519f1ff765bd8c7bdf3c483e3","observation_id":"2c784a95-6273-4fa1-b58c-7e21300a76bd","resolution":{"observed_at":"2026-08-11T06:05:02.881637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03812","last_updated":"2022-03-10T01:43:15Z","snapshot_observed_at":"2026-08-16T18:10:20.716360Z","submitted_at":"2022-03-08T02:22:28Z","title":"SpeechFormer: A Hierarchical Efficient Framework Incorporating the Characteristics of Speech","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03812","snapshot_observed_at":"2026-08-11T06:05:02.292886Z","title":"Speechformer: A hierarchical efficient framework incorporating the characteristics of speech,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.292886Z"},"links":{"cited_paper":"/paper/2203.03812","citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:0daf2fb345a3ee87c03cff992cfd18fc9af2ad4a35541a67e2b81316ad48d023","observation_id":"b0593542-c58c-44a0-9456-e94402f46ee4","resolution":{"observed_at":"2026-08-11T06:05:02.292886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.861044Z","title":"Mingling or misalignment? temporal shift for speech emotion recognition with pre-trained repre- sentations,","venue":null,"work_id":"3a33a895-328c-4fe9-9fdd-e56ba729855f","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.298612Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:389920a0580a9fe2f311578f6f6068a8edca830d2e9312e99a62f87e607a145c","observation_id":"bd58bcc4-d65e-4feb-a5df-eda1cdee5028","resolution":{"observed_at":"2026-08-11T06:05:02.866055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.844475Z","title":"Adaptive dynamic filtering network for image denoising,","venue":null,"work_id":"8b160662-bf51-412b-b272-4b66591675b6","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.303287Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:334bd7d9db24cbcd618fc9e75e85279062a01ba3283b970ea89bc3d70ec44944","observation_id":"a43cacc2-1923-4c9e-80e9-ded48db46990","resolution":{"observed_at":"2026-08-11T06:05:02.849595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.827289Z","title":"Mutual information-driven triple interaction network for efficient image dehaz- ing,","venue":null,"work_id":"df75ea93-f6c3-4db7-9b5a-6af0659b1a26","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.307889Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:9111ae18707f0e1f98fc9c964de7ac0c6ebd6de05520910678a87276ce08c3c1","observation_id":"7452d28b-54f3-417f-8893-e255d4ab3707","resolution":{"observed_at":"2026-08-11T06:05:02.832490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.812172Z","title":"Deraincyclegan: Rain attentive cyclegan for single image deraining and rainmaking,","venue":null,"work_id":"94eb862e-31df-4250-870e-36f95956f22f","year":2021},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.312621Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:bcb75555ec7d872877f6b611a2ee38c179355a1c3f88475f423191f0e6be21f9","observation_id":"8f9b3941-6aa7-41eb-9467-28555ccba2d5","resolution":{"observed_at":"2026-08-11T06:05:02.817164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.793947Z","title":"Low-light wheat image enhancement using an explicit inter-channel sparse transformer,","venue":null,"work_id":"e3c19283-1fef-44c9-85ba-5738fe6325d3","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.317384Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:440bff814729ee856b22d25e2e60062ad61da6410d6b6447e09f41b545eab18b","observation_id":"65fa8c31-b4dc-49d0-af11-eaa0b4dc8bc3","resolution":{"observed_at":"2026-08-11T06:05:02.800343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.771739Z","title":"Iemocap: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"1e14bc9f-e9bb-4c41-be9f-e8be5927512d","year":2008},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.321965Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:7ea045ca4ef45f797902351f14435000845a1c8808e86ac935ad84b0d3070567","observation_id":"e36a06cb-6fa9-4cf6-9868-45b947677d0f","resolution":{"observed_at":"2026-08-11T06:05:02.780233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.751217Z","title":"Spice: Self-supervised pitch estimation,","venue":null,"work_id":"73963af6-a500-4439-b54a-5eb4fa25fb61","year":2020},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.326393Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:0252dbb7d1a699adf1ac7f2a75714cfb7cc98f8686a7cb77dad2ffff69a2e238","observation_id":"76ff1be0-5477-4d98-973c-991b40c11bd2","resolution":{"observed_at":"2026-08-11T06:05:02.756370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-11T06:05:02.331559Z","title":"Mamba: Linear-time sequence modeling with selective state spaces,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.331559Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:aa7f8e13c579531ef4e5511fb0c65763c528ff98470a4c56377569575adb5947","observation_id":"621f5f6e-15f2-4f0f-96e3-e2756a6626d6","resolution":{"observed_at":"2026-08-11T06:05:02.331559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.735103Z","title":"Transformers are SSMs: Generalized models and efficient algorithms through structured state space duality,","venue":null,"work_id":"6d8135e5-b9c0-40d2-b124-7085f9f44095","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.336398Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:b3f7f683751fc05ca1dfa15d2c6648d1fe4c4acb90fcd0d958fd9a4f2330c7bb","observation_id":"e4d573b6-2565-4154-9c74-c8ff441e5da7","resolution":{"observed_at":"2026-08-11T06:05:02.740883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04490","last_updated":"2024-07-05T13:25:32Z","snapshot_observed_at":"2026-08-16T13:36:47.488035Z","submitted_at":"2024-07-05T13:25:32Z","title":"Micro-gesture Online Recognition using Learnable Query Points","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04490","snapshot_observed_at":"2026-08-11T06:05:02.341115Z","title":"Micro-gesture online recognition using learnable query points,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.341115Z"},"links":{"cited_paper":"/paper/2407.04490","citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:98f9df4e5c64aab1d6eefae26f42f78aed611a4df9c8189c12c05ae68daa1359","observation_id":"3f31342c-bc80-4344-b3f6-2f3a5d107ea5","resolution":{"observed_at":"2026-08-11T06:05:02.341115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.719306Z","title":"Eulermormer: Robust eulerian motion magnification via dynamic filtering within transformer,","venue":null,"work_id":"ea037095-50f4-4c02-b5b7-2ecb6f8efcbb","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.345727Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:9f8ea431094317fd8fe884dffc5c6221b7267f3726a309452bc6fc956c1550a4","observation_id":"7a49ebe5-07bc-4f3c-9b04-64824abf1840","resolution":{"observed_at":"2026-08-11T06:05:02.724322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.702620Z","title":"Maskable retentive network for video moment retrieval,","venue":null,"work_id":"291ecffc-fcb5-46a4-9dfd-2eac89cab8aa","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.350365Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:bf99c48ae687cf968882f6d4f909939deba93bd8c429947ae4090c58dc04d64d","observation_id":"2fa5fbcc-9170-4b57-a074-d55bad517fc8","resolution":{"observed_at":"2026-08-11T06:05:02.708169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.687439Z","title":"Multi-scale temporal transformer for speech emotion recognition,","venue":null,"work_id":"dd49ef7d-035a-4f18-a329-663e83eaadff","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.354468Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:252e7fb8ba7aaa6d7965fe5642f7b775d9d5e1b8ddebd56cb136d2bf01cd21a7","observation_id":"7b500cd5-2b8a-42ab-bdc8-801bcf545a3f","resolution":{"observed_at":"2026-08-11T06:05:02.692461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.671191Z","title":"Global filter networks for image classification,","venue":null,"work_id":"6efaafce-5f82-48aa-8fe1-a7e94e27e7b5","year":2021},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.359082Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:33c2a4fe4ec47983e88fda5657530ce35b89a7cde7e0ef20fdb77bd560db2d91","observation_id":"ca389b92-95aa-4c8f-a8df-45a555f081e0","resolution":{"observed_at":"2026-08-11T06:05:02.676505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.654299Z","title":"Non-linear fre- quency warping using constant-q transformation for speech emotion recognition,","venue":null,"work_id":"62f41b3e-4cba-4e0a-9d86-8e4957c8f030","year":2021},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.363358Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:8b1e72a4b6371c9d3ce0e515d40b4d210f8b58346ed4e3282fc0806d6734069b","observation_id":"719f89ad-39f6-496c-87d4-71b0897c04d9","resolution":{"observed_at":"2026-08-11T06:05:02.660378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.636248Z","title":"Speech emotion recognition based on optimized deep features of dual-channel complementary spectrogram,","venue":null,"work_id":"50f7f4be-f82d-4af5-97de-2961135187d9","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.367870Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:427cacab76147008e03b429876ba019399d53b93e2a2336226ad4d43e69f8727","observation_id":"6f197af4-d7fb-4c77-84b3-1a9809c45310","resolution":{"observed_at":"2026-08-11T06:05:02.641178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.620240Z","title":"Proposal-free video grounding with contextual pyramid network,","venue":null,"work_id":"7b74f5b5-abbc-4b4c-88f5-f1b8f56a4fbd","year":2021},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.372519Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:ead39ababdd6a503e9005d25c89bb5f6d338554f4b035b262d38c3dcb280e53a","observation_id":"a16f859b-a336-49f9-ad40-1f4e6f5a7c4b","resolution":{"observed_at":"2026-08-11T06:05:02.625541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.604819Z","title":"Fre- quency decoupling for motion magnification via multi-level isomorphic architecture,","venue":null,"work_id":"a967089a-b43c-4e56-bb80-26ee4d9493e2","year":2024},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.376958Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:bbc6b702554101ea51af32a1bc1bcb50ce19636a29dbbaab64a29eb25c25fa89","observation_id":"54b900ad-dee5-466e-a915-c542370250f7","resolution":{"observed_at":"2026-08-11T06:05:02.609952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.588433Z","title":"Contrastive positive sample propagation along the audio-visual event line,","venue":null,"work_id":"2495e2cd-9611-498f-ba85-682f77d07931","year":2022},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.381670Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:361f8a65c304e6ad11c799ad3894afe1062ce0e7fc807a7ed164208000aa81c8","observation_id":"eaa6e69b-f96e-4a72-9d2d-a7c103eb1e6e","resolution":{"observed_at":"2026-08-11T06:05:02.593331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.571950Z","title":"MELD: A multimodal multi- party dataset for emotion recognition in conversations,","venue":null,"work_id":"ac666201-19c2-43a8-b978-36ad69a1488b","year":2019},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.386395Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:7e0bbe05e24401bc5fd8dcaf2d4ef4336c46365212540baa4b03b62b701f99d4","observation_id":"8762e5b9-eb68-4442-a8e8-b8212a59b4a1","resolution":{"observed_at":"2026-08-11T06:05:02.577246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.391431Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.391431Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:46526cb53ffd4a6732c1f66b1ec31821a30f8530c895a8b5d106859d3bac4d91","observation_id":"846183c0-cf65-4bd9-a583-17f75ffcb3ff","resolution":{"observed_at":"2026-08-11T06:05:02.391431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.396360Z","title":"Hubert: Self- supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.396360Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:20ce76dc3774372e7b69256968581a49c8f497b6b334f32fdfe45a6b2f3c6a5a","observation_id":"5002ea9f-3e72-45d5-8aa9-07765beaad85","resolution":{"observed_at":"2026-08-11T06:05:02.396360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:05:02.531980Z","title":"Robust speech recognition via large- scale weak supervision,","venue":null,"work_id":"5c3c0d37-0e6c-4a18-8ef4-3b5c628fa8de","year":2023},"citing_paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T06:05:02.400801Z"},"links":{"citing_paper":"/paper/2412.16904"},"observation_digest":"sha256:7cf50800912bd6db154ecad1ccb71820d920cb5dc8b170c22e10106f48906f6b","observation_id":"62e6eb86-cab9-48d8-8f7a-442bf4005f5f","resolution":{"observed_at":"2026-08-11T06:05:02.540934Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.16904","last_updated":"2024-12-22T07:37:13Z","latest_version":1,"primary_category":"cs.SD","snapshot_observed_at":"2026-08-18T17:36:59.605603Z","submitted_at":"2024-12-22T07:37:13Z","title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":0,"verified_fuzzy":28},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2412.16904."}