{"as_of":"2026-08-10T01:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c96c7c8c66709801ff3eb3117a6a10b02dbdf9b31a3f2ea878b56d3bf8433429","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:29:54.084398Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.02258/citation-record","integrity":"/paper/2506.02258/integrity","json":"/paper/2506.02258/citation-record.json","paper":"/paper/2506.02258"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.212211Z","title":"Speech emotion recognition based on hmm and svm,","venue":null,"work_id":"e4d0843e-ead4-451c-b3b8-7612b8ee179a","year":2005},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.141074Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:cd7edc47bf2acd15586c87a7cac3ecd65ee515f16b0c02b111b1ef80b4d35eb0","observation_id":"fc71a14e-b9b5-4e86-b62e-1eccbc0621ee","resolution":{"observed_at":"2026-08-07T11:29:55.216794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.197939Z","title":"Emotion recognition in speech using mfcc and wavelet features,","venue":null,"work_id":"cb2b8d7f-3080-452f-8c2b-dba178b86e6a","year":2013},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.180343Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:be6e906f7c894a88ec00f3a378d7751b85293b818f73a68a27e76df7e1f8abf1","observation_id":"c9b6b090-75e2-4ef8-97e9-15441a19ba65","resolution":{"observed_at":"2026-08-07T11:29:55.203011Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.185279Z","title":"Speech emotion recognition based on feature selection and extreme learning machine decision tree,","venue":null,"work_id":"4452ae96-f8bb-4486-92fb-c3aa61b4b3b6","year":2018},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.236085Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:4f65a6b93cc472cf11e70aaccd4e78270a5fab3c6d625ac9231a03d382a05dc7","observation_id":"1b912b5f-c264-4fae-b6e5-828260b43db7","resolution":{"observed_at":"2026-08-07T11:29:55.190003Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.167624Z","title":"Speech emotion recognition with dual-sequence lstm architecture,","venue":null,"work_id":"6a7d3396-fc3b-4089-9447-2a9a5888eabd","year":2020},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.283010Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:2cc5daceb4babdb340985aa8ea8ee2fd75491c9bcb7a605890950be9e25b823e","observation_id":"05cb934a-48bf-4892-b403-97ca842b7208","resolution":{"observed_at":"2026-08-07T11:29:55.173025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.153663Z","title":"Convolution neural network based automatic speech emotion recognition using mel-frequency cepstrum coefficients,","venue":null,"work_id":"855213ca-1211-468d-ac03-571a3d708d10","year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.344930Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:e627d0e8237a03f7807d7536bf034b5bb425ef36191078dab77aa57bd228c073","observation_id":"1f062ee6-db11-4b59-8db9-c7498806e1c2","resolution":{"observed_at":"2026-08-07T11:29:55.158322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.142701Z","title":"Ctnet: Conversational transformer network for emotion recognition,","venue":null,"work_id":"763b9304-a98b-4917-a1c6-dab2b44a67cf","year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.398994Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:3bd237057fd4de5d1432b58625dc2855a94ffe12c85f7544fceb657ae4f56e13","observation_id":"8b4d47a9-4339-41fe-9960-235e3d22a499","resolution":{"observed_at":"2026-08-07T11:29:55.146277Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.03502","last_updated":"2021-04-08T04:31:58Z","snapshot_observed_at":"2026-07-06T10:57:30.968546Z","submitted_at":"2021-04-08T04:31:58Z","title":"Emotion Recognition from Speech Using Wav2vec 2.0 Embeddings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.03502","snapshot_observed_at":"2026-08-07T11:29:52.459509Z","title":"Emotion recognition from speech using wav2vec 2.0 embeddings,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.459509Z"},"links":{"cited_paper":"/paper/2104.03502","citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:745196c30531acd166f467f469ee87081d7b985ba83343c797b783a27a5454a8","observation_id":"f15749ac-0c24-496d-aae4-a5f7766a748f","resolution":{"observed_at":"2026-08-07T11:29:52.459509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18640","last_updated":"2023-05-29T22:27:48Z","snapshot_observed_at":"2026-07-06T15:35:07.850568Z","submitted_at":"2023-05-29T22:27:48Z","title":"Transforming the Embeddings: A Lightweight Technique for Speech Emotion Recognition Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18640","snapshot_observed_at":"2026-08-07T11:29:52.540223Z","title":"Transforming the embeddings: A lightweight technique for speech emotion recognition tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.540223Z"},"links":{"cited_paper":"/paper/2305.18640","citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b51cc0bf84d098e208a28cc9603a21315ff0215dd1dab034a89ac48fc65348fd","observation_id":"1228f4ed-326d-4082-b7cf-063425fb9bbd","resolution":{"observed_at":"2026-08-07T11:29:52.540223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.130769Z","title":"Adapting wavlm for speech emotion recognition,","venue":null,"work_id":"b86f7770-8cd2-4c9f-b863-825fc3aa590f","year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.604361Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:7b617c698db659fa00c80e5dfe6958d43af2f35c5c9f7a0b808bdbb5ed129b0f","observation_id":"c2055c74-ac05-47b6-b767-cc3b7bec6d69","resolution":{"observed_at":"2026-08-07T11:29:55.135147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:55.054751Z","title":"Audio mamba: Selective state spaces for self-supervised audio representations,","venue":null,"work_id":"d182c6ce-7bc7-49b7-9a67-16e986e53f1f","year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.691205Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:2900633e7412a2486f9e0b72baa04b5f3edcdce0e97e0a6b9645297b487c5bb8","observation_id":"dcf272e4-ab17-47b4-bd5d-66874f4c8801","resolution":{"observed_at":"2026-08-07T11:29:55.104324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.885914Z","title":"Speech emotion recognition considering nonverbal vocalization in affective conver- sations,","venue":null,"work_id":"8d380378-89e4-42af-93d8-2a0f3f402e80","year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.700086Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:615574ad1328d15724dc718f1dd3a572acffd3775d2b15582cb7c85d402a62d5","observation_id":"a954a949-eb11-4c71-91e0-39eab3549663","resolution":{"observed_at":"2026-08-07T11:29:54.977226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:52.780585Z","title":"Jvnv: A corpus of japanese emotional speech with verbal content and nonverbal expressions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.780585Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:ff03627913bdf4c364358ddce5f7ac76cee2df130e9bb403a0c2cc08ac914dbe","observation_id":"3d6631ce-bc9b-4570-868c-032edd60a33a","resolution":{"observed_at":"2026-08-07T11:29:52.780585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.714071Z","title":"Large-scale nonverbal vocalization detection using transformers,","venue":null,"work_id":"82306350-4e9f-42cb-8319-ef4be78c24e4","year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:52.917984Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:7baba413c3311be5128531c1b6659d2fe15dd0f65acc80d551cbfb23303216b7","observation_id":"16b4b1d8-020d-4e38-8091-32195789b2fc","resolution":{"observed_at":"2026-08-07T11:29:54.797553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.597224Z","title":"Investigation of ensemble of self-supervised models for speech emotion recognition,","venue":null,"work_id":"6779b2c0-5fab-448c-9841-e39ebfc0d51e","year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.110719Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:92669c281f3c9486aad0e5a26b44b600f8f0c6665704e8e078a0e48c9b1cefa4","observation_id":"f3947231-5db5-4fc1-a000-36366dc4d0f7","resolution":{"observed_at":"2026-08-07T11:29:54.641425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.529194Z","title":"Heterogeneity over homogeneity: Investigating multilingual speech pre-trained models for detecting audio deepfake,","venue":null,"work_id":"5d259c1a-e84d-4d84-b6c0-7dbc3c7655f9","year":2024},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.269332Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:7420c5c8300a89b97e6498dea13e1c0bc98b18780d8c0d656a0e19e3f47081b5","observation_id":"ca4873d6-0c0d-4e6b-a43a-e65f13184559","resolution":{"observed_at":"2026-08-07T11:29:54.588877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:53.455978Z","title":"Wavlm: Large-scale self-supervised pre- training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.455978Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b7c45890dd1a13e836fa06b742c745cf41306c9b77e618b77a53933b27da4bf0","observation_id":"acfaa700-c80b-48a7-8cf7-14352455a022","resolution":{"observed_at":"2026-08-07T11:29:53.455978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.390585Z","title":"Unispeech-sat: Universal speech representation learning with speaker aware pre-training,","venue":null,"work_id":"aaafd5bc-fbca-466e-970d-991cb0ff35ee","year":2022},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.619048Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:1f1dd887039cfcbe5a6a505b357b98c97d889d1f9b73717e939b8f0e56c5232f","observation_id":"cb1e393d-8591-4161-be9a-ea9244a82828","resolution":{"observed_at":"2026-08-07T11:29:54.455841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:53.770157Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.770157Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b295508b2ceb85ad1b67954cf2a74ca5f375ecd9e6dfa7bf076315b8f9aeef26","observation_id":"f5cf2178-ceb3-4c9e-9b77-b447c2c7174a","resolution":{"observed_at":"2026-08-07T11:29:53.770157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:53.913426Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:53.913426Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:a7bad4bfef910a9e872abc4945ea139494a572beb87315cbb8c0ab81573d6512","observation_id":"a3d5bfc7-3246-4ca6-9c49-d8b336f159fc","resolution":{"observed_at":"2026-08-07T11:29:53.913426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.057247Z","title":"R ´enyi divergence and kullback-leibler divergence,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.057247Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:542f67e0d5ae405efb2f993a36211b1b38486fc05c07e6f454dbb6983228636d","observation_id":"36458d9a-1854-4b5c-8ab7-553d023f5c4e","resolution":{"observed_at":"2026-08-07T11:29:54.057247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.077393Z","title":"Asvp-esd: A dataset and its benchmark for emotion recognition using both speech and non-speech utterances,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.077393Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:b7102ef330fb54a4d0b78ce0929c9d72f1d672efc4bf75818d2232739446a0cb","observation_id":"5ff0ecd1-5f3b-40b7-9a2d-3b9b7d77c9a7","resolution":{"observed_at":"2026-08-07T11:29:54.077393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.243274Z","title":"Jnv corpus: A corpus of japanese nonverbal vocalizations with diverse phrases and emotions,","venue":null,"work_id":"2bbb9083-c00a-4c1f-91bc-a751c886344b","year":2023},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.080965Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:764378a0ee87429e36dc36a28bdb99c40c62aa6459827b381870190d4c737591","observation_id":"82c93a67-9c89-4e6a-995f-fb5e3a48f7f6","resolution":{"observed_at":"2026-08-07T11:29:54.319362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:29:54.129708Z","title":"The variably intense vocalizations of affect and emotion (vivae) corpus prompts new per- spective on nonspeech perception","venue":null,"work_id":"784c21f0-4b60-40ca-8a04-9e975e287a7c","year":2022},"citing_paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:29:54.084398Z"},"links":{"citing_paper":"/paper/2506.02258"},"observation_digest":"sha256:ada1ae6694bf04e0244b22b335698c57667dccd99af1ecc279c431fbdef4c88a","observation_id":"1b27c255-fff4-428e-a2a8-86c7ea9f4a45","resolution":{"observed_at":"2026-08-07T11:29:54.187393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.02258","last_updated":"2025-06-02T21:04:29Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-07T11:25:11.574871Z","submitted_at":"2025-06-02T21:04:29Z","title":"Are Mamba-based Audio Foundation Models the Best Fit for Non-Verbal Emotion Recognition?"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":0,"verified_fuzzy":15},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2506.02258."}