{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:V3VYM6ILVRDQ45M6EQ3YA3SBHF","short_pith_number":"pith:V3VYM6IL","schema_version":"1.0","canonical_sha256":"aeeb86790bac470e759e2437806e413945d3fb22d2438f60bb81cda5ba8f4fcf","source":{"kind":"arxiv","id":"2412.16904","version":1},"attestation_state":"computed","paper":{"title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Fei Wang, Jiaqi Zhao, Kun Li, Shengeng Tang, Shu Zhao, Xiao Sun, Yanyan Wei","submitted_at":"2024-12-22T07:37:13Z","abstract_excerpt":"Speech Emotion Recognition (SER) plays a critical role in enhancing user experience within human-computer interaction. However, existing methods are overwhelmed by temporal domain analysis, overlooking the valuable envelope structures of the frequency domain that are equally important for robust emotion recognition. To overcome this limitation, we propose TF-Mamba, a novel multi-domain framework that captures emotional expressions in both temporal and frequency dimensions.Concretely, we propose a temporal-frequency mamba block to extract temporal- and frequency-aware emotional features, achiev"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.16904","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.SD","submitted_at":"2024-12-22T07:37:13Z","cross_cats_sorted":["eess.AS"],"title_canon_sha256":"3b190b939518d6e7f8ead479df7c2e8cec68a4e39640bdf88dd28e08ce0cba00","abstract_canon_sha256":"6deeec82bc7267c3e7685a40f97b9040e3d4f1d6ab9596096ebc1786778825cd"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:53:14.467873Z","signature_b64":"5bCXlfKapK7X53X1OHroB+UiAudYm/tQITWb9a6uERhhHeAEPCPgcKeZz3+bVCSNUoqtV56sNKE36XzJq8W8Dw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"aeeb86790bac470e759e2437806e413945d3fb22d2438f60bb81cda5ba8f4fcf","last_reissued_at":"2026-07-05T09:53:14.467369Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:53:14.467369Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Temporal-Frequency State Space Duality: An Efficient Paradigm for Speech Emotion Recognition","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["eess.AS"],"primary_cat":"cs.SD","authors_text":"Fei Wang, Jiaqi Zhao, Kun Li, Shengeng Tang, Shu Zhao, Xiao Sun, Yanyan Wei","submitted_at":"2024-12-22T07:37:13Z","abstract_excerpt":"Speech Emotion Recognition (SER) plays a critical role in enhancing user experience within human-computer interaction. However, existing methods are overwhelmed by temporal domain analysis, overlooking the valuable envelope structures of the frequency domain that are equally important for robust emotion recognition. To overcome this limitation, we propose TF-Mamba, a novel multi-domain framework that captures emotional expressions in both temporal and frequency dimensions.Concretely, we propose a temporal-frequency mamba block to extract temporal- and frequency-aware emotional features, achiev"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.16904","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.16904/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.16904","created_at":"2026-07-05T09:53:14.467420+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.16904v1","created_at":"2026-07-05T09:53:14.467420+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.16904","created_at":"2026-07-05T09:53:14.467420+00:00"},{"alias_kind":"pith_short_12","alias_value":"V3VYM6ILVRDQ","created_at":"2026-07-05T09:53:14.467420+00:00"},{"alias_kind":"pith_short_16","alias_value":"V3VYM6ILVRDQ45M6","created_at":"2026-07-05T09:53:14.467420+00:00"},{"alias_kind":"pith_short_8","alias_value":"V3VYM6IL","created_at":"2026-07-05T09:53:14.467420+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2502.02196","citing_title":"Exploiting Ensemble Learning for Cross-View Isolated Sign Language Recognition","ref_index":42,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF","json":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF.json","graph_json":"https://pith.science/api/pith-number/V3VYM6ILVRDQ45M6EQ3YA3SBHF/graph.json","events_json":"https://pith.science/api/pith-number/V3VYM6ILVRDQ45M6EQ3YA3SBHF/events.json","paper":"https://pith.science/paper/V3VYM6IL"},"agent_actions":{"view_html":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF","download_json":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF.json","view_paper":"https://pith.science/paper/V3VYM6IL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.16904&json=true","fetch_graph":"https://pith.science/api/pith-number/V3VYM6ILVRDQ45M6EQ3YA3SBHF/graph.json","fetch_events":"https://pith.science/api/pith-number/V3VYM6ILVRDQ45M6EQ3YA3SBHF/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF/action/timestamp_anchor","attest_storage":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF/action/storage_attestation","attest_author":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF/action/author_attestation","sign_citation":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF/action/citation_signature","submit_replication":"https://pith.science/pith/V3VYM6ILVRDQ45M6EQ3YA3SBHF/action/replication_record"}},"created_at":"2026-07-05T09:53:14.467420+00:00","updated_at":"2026-07-05T09:53:14.467420+00:00"}