{"as_of":"2026-08-15T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e8621b8a6b1defe1fa6b83fb1567f381051d020bee8ce31a73d50e56ce6d0fb1","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:08:54.323131Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T19:15:44.054286Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T00:39:35.710522Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03403","snapshot_observed_at":"2026-08-07T11:08:50.315973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.315973Z"},"links":{"cited_paper":"/paper/2506.03403","citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:9d00649964502d235ac11ad16ad341f65ef236c22c5e3a983106a11383da36bc","observation_id":"77d64e47-bec1-4478-8209-7489b031d5c1","resolution":{"observed_at":"2026-08-07T11:08:50.315973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2506.03403","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03403","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hyfuse: Aligning heterogeneous speech pre-trained representations in hyperbolic space for speech emotion recognition","venue":null,"work_id":"7d669fae-26a7-41d8-8b0f-f05923d02284","year":2025},"citing_paper":{"arxiv_id":"2604.16377","last_updated":"2026-04-24T12:26:15Z","snapshot_observed_at":"2026-08-14T03:05:55.938066Z","submitted_at":"2026-03-24T17:48:40Z","title":"GoCoMA: Hyperbolic Multimodal Representation Fusion for Large Language Model-Generated Code Attribution","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:56.136232Z"},"links":{"cited_paper":"/paper/2506.03403","citing_paper":"/paper/2604.16377"},"observation_digest":"sha256:d7443d9adbde991d77671a4a19113d2a3a426f06c1e5486cf370a0730c259765","observation_id":"94dc2de1-0f2e-4fea-ae98-c1e835fbefd3","resolution":{"observed_at":"2026-05-15T00:39:35.712447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03403","snapshot_observed_at":"2026-08-08T19:15:44.054286Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.04351","last_updated":"2026-08-05T01:50:37Z","snapshot_observed_at":"2026-08-14T05:32:36.620784Z","submitted_at":"2026-08-05T01:50:37Z","title":"HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T19:15:44.054286Z"},"links":{"cited_paper":"/paper/2506.03403","citing_paper":"/paper/2608.04351"},"observation_digest":"sha256:cdd991a964ad08646441644a3c57b2af192f1f34903740ce78d988d0f42e508d","observation_id":"da310fb0-4075-4cd4-a172-5fd84d319b9d","resolution":{"observed_at":"2026-08-08T19:15:44.054286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03403/citation-record","integrity":"/paper/2506.03403/integrity","json":"/paper/2506.03403/citation-record.json","paper":"/paper/2506.03403"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:09:00.053850Z","title":"By analyzing vocal attributes such as pitch, tone, and rhythm, SER systems uncover the intricate nuances of human affect","venue":null,"work_id":"da5efc12-1176-459e-a5ec-dead52f8f8d1","year":null},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.218119Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:0f05a84d1cdf33a23b1c3896f9e6fc7322f8eceed575e38383429e8c946e0e92","observation_id":"f434d830-45bd-4214-ae3d-235176d34e17","resolution":{"observed_at":"2026-08-07T11:09:00.153494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:59.784156Z","title":null,"venue":null,"work_id":"afd52947-ff38-4752-a482-44918fd1db67","year":null},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.410903Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:7ac51ba4d7f7e8302587f5bda32ffcbde41ca56f23f8fc27c530bc25b96ea11c","observation_id":"eb04ee7e-4a9b-416f-94b4-af15370cdc12","resolution":{"observed_at":"2026-08-07T11:08:59.898836Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:59.477671Z","title":"For modeling indi- vidual representations, we use fully connected network (FCN) and CNN","venue":null,"work_id":"c58052c4-7c77-4301-a0b5-83be5431060b","year":null},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.516221Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:da8b8ad05f4a94366b36f0faab6d0b406ab41d9425c0f9740c82351a5ad91ea5","observation_id":"2632f3bc-d069-4cde-af6c-8ae1c295cc67","resolution":{"observed_at":"2026-08-07T11:08:59.673905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:59.251829Z","title":null,"venue":null,"work_id":"e42b1671-977b-4457-aa4e-988680126e81","year":null},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.668957Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:19bea2ca63bf3a30da2b49a4c059e22cd07d638326b2b0410ef623ad556df5b3","observation_id":"efb6f047-4113-4129-a479-ec99ea50dfac","resolution":{"observed_at":"2026-08-07T11:08:59.373042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:59.002040Z","title":"While CBRs such as EnCodec capture intricate acoustic features like pitch and timbre, RLRs from pre-trained models like WavLM en- code high-level prosodic information","venue":null,"work_id":"4e92472a-3d67-47f2-b873-ba23cafa2618","year":null},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.783410Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:449ff5dcb17e4e5ab74fe372db5a19563db5687c3b694c645cc90857bc98852f","observation_id":"33ef21f9-e80f-4dce-a1e8-1f8cd2cee9dd","resolution":{"observed_at":"2026-08-07T11:08:59.126544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:57.502833Z","title":"Speech emotion recognition with dual-sequence lstm architecture,","venue":null,"work_id":"23c6895e-bcad-43e7-97eb-32cf6f69ee49","year":2020},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.499112Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:4d3f306bd393fe94dbd9d7524cfcfa7c24bfc88c6131cce97e08d8fdfd204b7f","observation_id":"2448af0a-62a0-48f6-ae4f-2c0e7f8d25e0","resolution":{"observed_at":"2026-08-07T11:08:57.621722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:58.746714Z","title":"Towards a small set of robust acoustic features for emotion recognition: Challenges,","venue":null,"work_id":"d5560836-6109-4eb7-a8dd-df3792135cef","year":2016},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.888373Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:2d58a73b0c63fc035ff83206959d4dc4013c17119a6306176e04ac95a2ca1713","observation_id":"ff567166-0f50-4995-a6bf-002dfd7e3992","resolution":{"observed_at":"2026-08-07T11:08:58.844451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:58.542048Z","title":"Is everything fine, grandma? acoustic and linguistic modeling for robust elderly speech emotion recognition,","venue":null,"work_id":"531560ef-830d-431b-b749-a278b12d41c7","year":2020},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.008502Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:3341cc9f200d13a732692f6214f83e1a96bd954ef72d7cef65553cea8b8d2860","observation_id":"eff4668a-e79e-4088-81c5-7c8f5cbd3903","resolution":{"observed_at":"2026-08-07T11:08:58.642449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:58.298197Z","title":"Shoelace pattern-based speech emotion recognition of the lecturers in distance education: Shoepat23,","venue":null,"work_id":"dd5ed5fb-7bd1-450b-946b-511cbf76f44b","year":2022},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.153723Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:061c634f655afa3c13efbd26085c5aa9037c8210f68aeead110bcb80566739f2","observation_id":"2cb872e0-d2e2-4207-9171-6c4527ad37ef","resolution":{"observed_at":"2026-08-07T11:08:58.436422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:58.013942Z","title":"Emotion recognition in speech using mfcc and wavelet features,","venue":null,"work_id":"3afff60f-4ba9-4f9c-827f-4f0a1e06b937","year":2013},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.260435Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:93b189dfcd1a42c9b0db154128bc948b3e628b758ec05929293e3c1cf2331d26","observation_id":"ccbe7338-5f86-4682-bf62-b15641c0626d","resolution":{"observed_at":"2026-08-07T11:08:58.151785Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:57.729187Z","title":"Svm scheme for speech emotion recognition using mfcc feature,","venue":null,"work_id":"4c2e4e2a-61a5-47fe-93d3-a57a0caa6c78","year":2013},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.351610Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:357eb0e5eda839eca38a0342b6bc041cb4897999853ea51e56bdca6d22673458","observation_id":"44c5aea4-7fed-4cec-a9d0-60143cd9e7bf","resolution":{"observed_at":"2026-08-07T11:08:57.909691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:56.971840Z","title":"High-fidelity audio compression with improved rvqgan,","venue":null,"work_id":"575a3c1b-e050-4be9-bbb1-36cd0a24cc91","year":2024},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.216375Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:a17d870342c1f17b0e76f96930c28584793b49db94361a520755643da433cccd","observation_id":"e63be619-c52f-46fa-a207-9de8999b610d","resolution":{"observed_at":"2026-08-07T11:08:57.062093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:57.202625Z","title":"Emotion recognition of human speech using deep learning method and mfcc features,","venue":null,"work_id":"28e1b321-5e7b-4b80-ab11-d85d2a88dd71","year":2022},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.617446Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:79657c300c1862c42dbf0ca40c050842de5104eeca78a374871b5c786fbf1b7e","observation_id":"b0a4583f-3cdd-4ecc-914b-95278503f218","resolution":{"observed_at":"2026-08-07T11:08:57.308213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:51.732715Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.732715Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:11959a0be6e2580a5d966dd8a3e1bd25d392de10654ee4505db2e2054dc92543","observation_id":"63d9efaf-a6c6-4cf2-a2f6-bdd35066a24f","resolution":{"observed_at":"2026-08-07T11:08:51.732715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:51.837603Z","title":"Wavlm: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.837603Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:72bcf16b0e8547ad6eee8a351b5aacb8109826acb3b365e7de236b0155c94fcd","observation_id":"9e9f42a4-7bbf-4d52-8f70-a6c98a177267","resolution":{"observed_at":"2026-08-07T11:08:51.837603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:51.968915Z","title":"Xls-r: Self-supervised cross-lingual speech representation learning at scale,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:51.968915Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:f5254d8902ec10e833f01e792c983c0bcadc7dbca13eb47f42b5a5860e0e66a4","observation_id":"3b2ee697-bafe-4a5b-84c5-cdd19f0314e0","resolution":{"observed_at":"2026-08-07T11:08:51.968915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.13438","last_updated":"2022-10-24T17:52:02Z","snapshot_observed_at":"2026-08-15T04:43:16.361751Z","submitted_at":"2022-10-24T17:52:02Z","title":"High Fidelity Neural Audio Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.13438","snapshot_observed_at":"2026-08-07T11:08:52.079704Z","title":"High fidelity neu- ral audio compression,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.079704Z"},"links":{"cited_paper":"/paper/2210.13438","citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:5d6149d221f5642b8c74a667c496a9078888ceb7ee1b53cb68f334070b1a0ecc","observation_id":"1223b713-d4fe-4c5d-aa7d-e92a023d1cb6","resolution":{"observed_at":"2026-08-07T11:08:52.079704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03403","snapshot_observed_at":"2026-08-07T11:08:50.315973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:50.315973Z"},"links":{"cited_paper":"/paper/2506.03403","citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:9d00649964502d235ac11ad16ad341f65ef236c22c5e3a983106a11383da36bc","observation_id":"77d64e47-bec1-4478-8209-7489b031d5c1","resolution":{"observed_at":"2026-08-07T11:08:50.315973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:52.327891Z","title":"Soundstream: An end-to-end neural audio codec,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.327891Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:ee86f21e12b3af185c4b7fef4efb1341e3c0f3c601f669d23acb4b5b4ed97a76","observation_id":"9418e5b3-72bc-47d1-867d-4550f9967b1d","resolution":{"observed_at":"2026-08-07T11:08:52.327891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:56.738698Z","title":"Emotion recognition from speech using wav2vec 2.0 embeddings,","venue":null,"work_id":"006b6250-743f-4041-985b-e4add3058b91","year":2021},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.400381Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:ef8261276f96c0e9d4ea0fa19c8aa7375a536d236aad9ee6aec796e5941665c1","observation_id":"2cd0bafd-d508-4a53-b8f1-522996d11a5a","resolution":{"observed_at":"2026-08-07T11:08:56.842621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:56.459309Z","title":"Speech emotion recognition using self-supervised features,","venue":null,"work_id":"c047159a-a6eb-4b8c-bdfe-b6a9d7fa97df","year":2022},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.542100Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:75a39f3762b8289cb5596c8a45c21e9734233c3e2bd9417d81827fb12e35ebb5","observation_id":"c9cf1d17-6cec-4d72-a1e1-88f4208e196e","resolution":{"observed_at":"2026-08-07T11:08:56.612382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:56.139671Z","title":"Codec-SUPERB: An in-depth analysis of sound codec models,","venue":null,"work_id":"41304eda-7509-4e5e-9116-7b9a593b5a29","year":2024},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.680089Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:efe68f03adcd899c2f93f0b930c0d9640ca3b19ccede100f9d093777ef6a875f","observation_id":"be92ef58-a7b5-4c61-9a36-785c9c42d967","resolution":{"observed_at":"2026-08-07T11:08:56.298971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15458","last_updated":"2024-07-30T12:37:35Z","snapshot_observed_at":"2026-08-12T23:17:29.885700Z","submitted_at":"2024-07-22T08:14:16Z","title":"EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations","version":4},"cited_work":{"arxiv_id":"2407.15458","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.15458","snapshot_observed_at":"2026-08-07T11:08:54.506440Z","title":"EMO-Codec: An In-Depth Look at Emotion Preservation capacity of Legacy and Neural Codec Models With Subjective and Objective Evaluations","venue":"eess.AS","work_id":"03fe9211-524f-45d2-b2fd-da64d1750b4a","year":2024},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.827193Z"},"links":{"cited_paper":"/paper/2407.15458","citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:b9553aac9c3c880ccec99b4e0483b0965f98c1ca7307ece103d73e0329b054c9","observation_id":"2cc65780-2e3d-4bb1-b10d-0b221fc9ebce","resolution":{"observed_at":"2026-08-07T11:08:54.552570Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14294","last_updated":"2026-04-21T15:27:17Z","snapshot_observed_at":"2026-07-30T17:14:02.349402Z","submitted_at":"2024-06-20T13:23:27Z","title":"DASB - Discrete Audio and Speech Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14294","snapshot_observed_at":"2026-08-07T11:08:52.944215Z","title":"Dasb–discrete audio and speech benchmark,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:52.944215Z"},"links":{"cited_paper":"/paper/2406.14294","citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:e8902d7f4b11ba6d6f593ffe249d8acdcd52046619326dfad8b1489476181f27","observation_id":"c86d9a68-e6c6-4665-9895-8aa3f0d9fd62","resolution":{"observed_at":"2026-08-07T11:08:52.944215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:55.873937Z","title":"Investigation of ensemble of self-supervised models for speech emotion recognition,","venue":null,"work_id":"f639f6dc-8365-4674-ab57-357fa771bfec","year":2023},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.061315Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:361ab88e139a0a8fcc58ede21af7da150d34f62846dd93133c82335e0eee2cbc","observation_id":"8003c34b-b07c-4938-ac71-501a8a81c1aa","resolution":{"observed_at":"2026-08-07T11:08:55.986914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.187702Z","title":"Investi- gation of ensemble features of self-supervised pretrained models for automatic speech recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.187702Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:fafe724ce8de65eebe34c96d165992b31754cc1ebf65172741976f3f1111f7ff","observation_id":"8100aeaf-f521-43b5-9eca-e617e37e76de","resolution":{"observed_at":"2026-08-07T11:08:53.187702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07414","last_updated":"2024-08-14T09:43:35Z","snapshot_observed_at":"2026-08-12T23:03:50.351209Z","submitted_at":"2024-08-14T09:43:35Z","title":"WavLM model ensemble for audio deepfake detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07414","snapshot_observed_at":"2026-08-07T11:08:53.306405Z","title":"Wavlm model ensemble for audio deepfake detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.306405Z"},"links":{"cited_paper":"/paper/2408.07414","citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:f67f2b4e8fe99e94e1ad56936ef8b983262713a523c270d7655666ff76b2c9da","observation_id":"9da95ac2-a217-4bb4-a4d9-6e6fe9258e99","resolution":{"observed_at":"2026-08-07T11:08:53.306405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.440408Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.440408Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:b636ba72a9fe1fda161c4ef01de19b4ff14449dffbbcf21875eee78810cd6358","observation_id":"b42e2485-8775-4553-896a-763ee52e6fcc","resolution":{"observed_at":"2026-08-07T11:08:53.440408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.583587Z","title":"X-vectors: Robust dnn embeddings for speaker recognition,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.583587Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:aebadaf63bce81c557655548efda3631ddf50497af83a4e8d3af76e7274ba222","observation_id":"b0944658-3ffd-44c7-8049-6da694357b7c","resolution":{"observed_at":"2026-08-07T11:08:53.583587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:55.616914Z","title":"Transform- ing the embeddings: A lightweight technique for speech emotion recognition tasks,","venue":null,"work_id":"98484e51-0f5f-4cc6-a592-a7e645445cb7","year":2023},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.763860Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:9879c2d0f32d7d5e9ce5c0cc84959a68f54d7354767111f87fd4800b1f09b929","observation_id":"ff180359-b58c-4f41-823c-9f981c5a8b54","resolution":{"observed_at":"2026-08-07T11:08:55.748749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:55.346160Z","title":"Speechtokenizer: Unified speech tokenizer for speech language models,","venue":null,"work_id":"8b984f47-2550-47c0-a9d7-b8020449b86d","year":null},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.876921Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:5497654145f70ea50d27e1898f3ccf856c0a258391118698940a47fae5c3467b","observation_id":"0b73e602-bd9a-4eb8-a0a8-42846e27200d","resolution":{"observed_at":"2026-08-07T11:08:55.501589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:55.140193Z","title":"Crema-d: Crowd-sourced emotional multimodal actors dataset,","venue":null,"work_id":"441ab1e5-220b-43cd-b8d8-150e1322fe72","year":2014},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:54.104548Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:2d8d3d4f04933e129e7c7a802e62c408fded8144667d12615b2951e5aa14017d","observation_id":"76d23221-9348-4b24-894a-3c0a4c57f120","resolution":{"observed_at":"2026-08-07T11:08:55.234152Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:54.890034Z","title":"A database of german emotional speech","venue":null,"work_id":"b10fd7b7-69d9-46bd-8177-373b6b97e781","year":2005},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:54.211506Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:2cbc35dc4303753881e5e8279354eae071cb7bacce04968f443b3577e33769ff","observation_id":"f2833fc1-e469-4ed3-9faa-d3166bb7562f","resolution":{"observed_at":"2026-08-07T11:08:54.999720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:54.698567Z","title":"Superb: Speech pro- cessing universal performance benchmark,","venue":null,"work_id":"c6aa298c-ed32-4086-90a4-8362f2711492","year":2021},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:54.323131Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:6c36e213f9c606e9faab3410837213c850a0a99db5dfb08881c8d339fba2c9af","observation_id":"a77b9098-ac90-47e9-9949-096854b7cfeb","resolution":{"observed_at":"2026-08-07T11:08:54.769951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:08:53.983165Z","title":"Available: https://openreview.net/forum?id= AF9Q8Vip84","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:53.983165Z"},"links":{"citing_paper":"/paper/2506.03403"},"observation_digest":"sha256:10a53c354d6cf24f3af7065e49f641206477f1f760b6e742e4b37f6a06e6ec0f","observation_id":"39e74e91-b406-4f9a-8a53-0d444cff17cd","resolution":{"observed_at":"2026-08-07T11:08:53.983165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.03403","last_updated":"2025-06-03T21:26:24Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-14T00:21:05.234893Z","submitted_at":"2025-06-03T21:26:24Z","title":"HYFuse: Aligning Heterogeneous Speech Pre-Trained Representations in Hyperbolic Space for Speech Emotion Recognition"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":1,"verified_fuzzy":20},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 3 inbound Pith citation observations for arXiv:2506.03403."}