{"as_of":"2026-08-10T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b1f007672f1ffc42f77f1f252f81c3a8ad4b3c18fbbcb2c43cda9ca7c89b1064","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T01:53:00.127636Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.06611/citation-record","integrity":"/paper/2607.06611/integrity","json":"/paper/2607.06611/citation-record.json","paper":"/paper/2607.06611"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.916768Z","title":"The evolution of sentiment analysis and conversational AI: Techniques applications and future research directions","venue":null,"work_id":"60da4b85-7bde-4ec8-be7e-7741167102e5","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:aca9f323cc855770e271f30d271d2a1043c99aad9e78e6826bb4cc2e5a45e5a5","observation_id":"7f693040-bd69-46b8-ae57-62bf2b178b88","resolution":{"observed_at":"2026-07-11T02:07:48.942291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.857357Z","title":"Sentiment analysis and emotion recognition from speech using universal speech representations","venue":null,"work_id":"bd022174-cc95-4b41-bc18-0dc2c1cfd251","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:e8d56a1c2df8ab020a64d3e65bae5bd5b2c5e0410bf89c364a6e33c4baef68e4","observation_id":"c797137c-7de2-4edd-ae15-66f2ec2735aa","resolution":{"observed_at":"2026-07-11T02:07:48.881121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.672741Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations, in: Proceedings of NeurIPS, pp","venue":null,"work_id":"6ad395f7-4be6-497a-9dbb-85401558bcdb","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:e2053185fda2f13a5753087553ab751aaeab6399da110d98fe081cf7b200e7a1","observation_id":"f07b8f8e-8391-4d93-8498-6176ad613e87","resolution":{"observed_at":"2026-07-11T02:07:48.703203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.316867Z","title":"TweetEval: Unified benchmark and comparative evaluation for tweet classification, in: Findings of EMNLP, pp","venue":null,"work_id":"d2bbf640-9ec4-4981-8d5f-c8c28325620e","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:49ea8e410478f528def2f3ab916d3cd49375785880026ac5f018ebf9099b05de","observation_id":"d21193c9-b6e7-431c-bbec-bdcb507027ae","resolution":{"observed_at":"2026-07-11T02:07:48.341409Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.597874Z","title":"Sentiment Analysis of Customer Feedback and Reviews in E-Commerce Systems, in: Proceedings of ICTCS, pp","venue":null,"work_id":"3a22a352-4fc4-48c4-810a-7d017a1d6e72","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:8c355d09f25e9b94592d1a08e5c7485d9a6cfabb2b6da508622b684550872bcb","observation_id":"1e7a7188-cd28-45ff-9ddc-32c0a3f60164","resolution":{"observed_at":"2026-07-11T02:07:48.623963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.980826Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database","venue":null,"work_id":"40750a54-58a8-4f51-80fe-d524050331ce","year":2008},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:501c0fe614d57fef2bcfb8e993502492ec598c73a4b5b7fabe83b9bd5abd6de8","observation_id":"9f5f687a-49a2-4fcc-beff-cb3be8a79c5b","resolution":{"observed_at":"2026-07-11T02:07:49.008905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.09791","last_updated":"2025-09-11T18:51:58Z","snapshot_observed_at":"2026-08-08T06:22:12.517525Z","submitted_at":"2025-09-11T18:51:58Z","title":"The MSP-Podcast Corpus","version":1},"cited_work":{"arxiv_id":"2509.09791","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.09791","snapshot_observed_at":"2026-07-11T01:57:52.098079Z","title":"The msp-podcast corpus","venue":"eess.AS","work_id":"8f208ac9-5500-4c6f-bfdb-83056c337610","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2509.09791","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:ad6473761c3ea270ef87b0a1124eb47d7c8c97eb5b79f51804194f69bec637ca","observation_id":"6bf36bf0-23ef-4bd0-a977-ea0adbef5d99","resolution":{"observed_at":"2026-07-11T01:57:52.125343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.536547Z","title":"German’s next language model, in: Proceedings of COLING, pp","venue":null,"work_id":"4dae95b5-e2c3-4794-a960-6fd60b21c5fd","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:80fa504711af41ea5dd5acc4d33cec888ea983faf5e449efd383d350cba1ee59","observation_id":"5581cd06-56bc-48e7-a1d8-cc58f3a6080f","resolution":{"observed_at":"2026-07-11T02:07:48.561625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.511004Z","title":"WavLM: Large-Scale Self-Supervised Pre-Training for Full Stack Speech Processing","venue":null,"work_id":"4bc1c371-fde6-4430-b855-1e977f9ccd6c","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:b468c2ffac5c519a8c56ab99949847407ca46e7251d3797de5df8f5283ce3dea","observation_id":"639c29ce-3311-40e5-ac9e-dc5278c8b5b3","resolution":{"observed_at":"2026-07-11T02:07:49.538198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.542119Z","title":"BERT: Pre-training of deep bidirectional transformers for language understanding, in: Proceedings of NAACT-HLT, pp","venue":null,"work_id":"1bcfd91e-227b-461e-bbd9-4f2e785a5c98","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:40999e7ed635176dac455ce8f4c264e8e7b3a5bcc1ab283744cfefaa86170e36","observation_id":"b7b2eaf5-d8ad-4360-9fbb-d7fe89dfd425","resolution":{"observed_at":"2026-07-11T02:07:49.571023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.574803Z","title":"Optimized Sentiment Analysis in Tagalog Speech Using PCA and BRNN on Prosodic Suprasegmental and MFCC Features, in: Proceedings of ICTC, pp","venue":null,"work_id":"6bc0cb35-7db0-42a8-8cbf-65aa18929ca9","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:95f9485247d012045510ce7f90612fdbdf26386ae1ea7a824d3c4aebfdb5a712","observation_id":"0f7eca62-d1b6-4a2c-ab23-17fd0297fd19","resolution":{"observed_at":"2026-07-11T02:07:49.601183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.378329Z","title":"A review on speech emotion recognition: A survey, recent advances, challenges, and the influence of noise","venue":null,"work_id":"343986d8-3212-4448-b837-d5ef34c0ea07","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:45b9a4a817f6099ac128bc26aed4bc9715db82939f6f59da3543fd982a27f4cf","observation_id":"0f0b3717-bb94-4ffc-aecc-b9e4d329bfec","resolution":{"observed_at":"2026-07-11T02:07:48.404930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.700239Z","title":"Teacher-Student Training and Triplet Loss for Facial Expression Recognition under Occlusion, in: Proceedings of ICPR, pp","venue":null,"work_id":"989d293c-ef5e-4910-ada3-f892d4427797","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:e9f02dc189b9f37a0294bde4005d787f74c8004e2089c2f74d78c6b348ef0a19","observation_id":"cdeb7a1d-0ee1-46fa-9d83-315bb24b73f7","resolution":{"observed_at":"2026-07-11T02:07:49.726874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.918230Z","title":"AST: Audio Spectrogram Transformer, in: Proceedings of INTERSPEECH, pp","venue":null,"work_id":"08dad181-5f5b-4e80-99e2-aa9ffdf9f0ac","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:eedab527f2125a9a6587323b4d57c18b78b7201098185ffefe8618a6f5f09a45","observation_id":"7e0b00e8-8c0e-40c6-acd1-5426bd551698","resolution":{"observed_at":"2026-07-11T02:07:48.944100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:55076484d2ad61158a81d484cc06aed0a5409527618898e242eb04d3d2a562ea","observation_id":"173827fc-beb8-4ce7-b67f-01a05ee034c6","resolution":{"observed_at":"2026-07-11T01:57:52.151963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.326760Z","title":"HuBERT: Self-Supervised Speech Representation Learning by Masked Prediction of Hidden Units","venue":null,"work_id":"2b3f7efb-0bbf-42c5-bf90-0442e23e6ecf","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:67abf8308e3abc094c1dd9ee798c30707a17072a77ed73f4fd8820aea3a0268c","observation_id":"fc45812c-5ef5-406c-bc89-7e90096498fc","resolution":{"observed_at":"2026-07-11T02:07:49.352399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.356454Z","title":"LoRA: Low-Rank Adaptation of Large Language Models, in: Proceedings of ICLR","venue":null,"work_id":"f2f26e26-d3dc-45a0-9bbf-d8c23c15171e","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:2262fe416105a22608d2a1c3f6cb2220aa141ef3ccab29480470a9d0d2c558ee","observation_id":"c9ae9372-df68-4ce1-ac83-bdbdeda3aba4","resolution":{"observed_at":"2026-07-11T02:07:49.383973Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.446546Z","title":"Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech, in: Pro- ceedings of ICML, pp","venue":null,"work_id":"1a971fb8-40c8-48f5-9bef-18282fec95a9","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:6e6a37f5d62c00a5179acb6340e3873a5c7f9568ffc9397832de80bf9449ff4d","observation_id":"44ae0fd6-1df5-4da5-99f2-d10fdf2153b6","resolution":{"observed_at":"2026-07-11T02:07:49.474514Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.359852Z","title":"faster-whisper: Faster Whisper transcription with CTranslate2.https://github.com/SYSTRAN/faster-whisper","venue":null,"work_id":"682412ca-39bd-4541-aa9c-ecac9b9426f3","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:da0b389091375cdb924a411ab7e778670582390810d73ae1fde0290ecf494285","observation_id":"2daecc1d-f41f-4b82-973e-41c02b5f2660","resolution":{"observed_at":"2026-07-11T02:07:49.381658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.536176Z","title":"Incorporating end-to-end speech recognition models for sentiment analysis, in: Proceedings of ICRA, pp","venue":null,"work_id":"245a2902-9fb5-41b0-824f-63d19dbacf36","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:8f7557a769fe8a8781639f96e1f34605d931b8a728ce488f5b41cd1a9c8864f8","observation_id":"b98508a2-01cb-49c5-bd1f-3374212a27c6","resolution":{"observed_at":"2026-07-11T02:07:48.562121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.384730Z","title":"Unimodal-driven distillation in multimodal emotion recognition with dynamic fusion, in: Proceedings of ICME, pp","venue":null,"work_id":"62f25664-4fb2-4581-add2-d426b282befb","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:3da430afcc46ae0024ccf4745b38cb7d1a8123817657472116e59b8e0874df75","observation_id":"7a028ca4-f932-4d96-92e0-96691cde939e","resolution":{"observed_at":"2026-07-11T02:07:49.410591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.236265Z","title":"Speech Emotion Recognition With ASR Transcripts: a Comprehensive Study on Word Error Rate and Fusion Techniques, in: Proceedings of SLT, pp","venue":null,"work_id":"ebd1952f-5749-4261-a3f6-55ebf37052cd","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:7788372fbe5d10d9fb46a70842edfd4fb9a4b06598620672e7819d80ed3e17a7","observation_id":"5bd5a4c2-13a7-4ecd-ac3f-a003d5b00c58","resolution":{"observed_at":"2026-07-11T02:07:49.261230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.295213Z","title":"Decoupled multimodal distilling for emotion recognition, in: Proceedings of CVPR, pp","venue":null,"work_id":"e995e539-b087-4a35-a006-e30e1c52d1df","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:a3143d5c9416187467e4c8d8061e11723da8a26698e5518c70842d5238ccbc92","observation_id":"8ac18c4f-f752-4748-87f7-d42d163a878e","resolution":{"observed_at":"2026-07-11T02:07:49.322770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.480434Z","title":"A survey of deep learning-based multimodal emotion recognition: Speech, text, and face","venue":null,"work_id":"9813f4a9-bf2c-4720-b47c-7e6e1a124926","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:febc20a226eb53029f2bad55a8c788ff4397f5de0261825ce435acf9aac55a8f","observation_id":"3aea66e4-3850-4ebb-9bcd-e5852175771b","resolution":{"observed_at":"2026-07-11T02:07:49.507364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.413609Z","title":"Development of interactive English e-learning video entertainment teaching environment based on virtual reality and game teaching emotion analysis","venue":null,"work_id":"cfb2d034-be15-4279-807a-84580290bb1c","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:ede3f1a8ff2fffd8098a8d5378c2c03b8dfb3bc848e531e5323d45539b48b380","observation_id":"2ebb9d24-e0ba-4c28-9175-b8ad767de9a0","resolution":{"observed_at":"2026-07-11T02:07:49.435195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.700713Z","title":"Unifying distillation and privileged information, in: Proceedings of ICLR","venue":null,"work_id":"bba2722a-1e5d-4f51-a2ec-9efab6d8deea","year":2016},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:9d3eaba8a0bd798d221b6e1a1739630ef64750e391839d4b74a8c372cd7d7816","observation_id":"470f6a7e-e1b9-4267-a186-e558dc4a4df9","resolution":{"observed_at":"2026-07-11T02:07:48.727337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01368","last_updated":"2021-12-02T16:09:33Z","snapshot_observed_at":"2026-08-03T21:34:51.089550Z","submitted_at":"2021-12-02T16:09:33Z","title":"ScaleVLAD: Improving Multimodal Sentiment Analysis via Multi-Scale Fusion of Locally Descriptors","version":1},"cited_work":{"arxiv_id":"2112.01368","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.01368","snapshot_observed_at":"2026-07-11T01:57:52.086922Z","title":"Scalevlad: Improving multimodal sentiment analysis via multi-scale fusion of locally descriptors","venue":"cs.CL","work_id":"c959913a-ae0e-4026-b864-83a96f323037","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2112.01368","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:62e31bef594346c5d4aea812d6f610b2df4499225c8dbc0717856821c3ace7dd","observation_id":"ffdce282-5df0-4fcb-bfb4-1c1f1d883b29","resolution":{"observed_at":"2026-07-11T01:57:52.113290Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.067297Z","title":"Audio sentiment analysis by heterogeneous signal features learned from utterance-based parallel neural network, in: Proceedings of AffCon@AAAI, pp","venue":null,"work_id":"4866b481-5da6-4872-99f2-6addcd30bb8d","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:88844936e3af87e33add6272fa61ca788b366a1829b07ec29b93cbcff86223b1","observation_id":"becdda28-330f-4f03-83d9-c406ffb7824f","resolution":{"observed_at":"2026-07-11T02:07:49.096140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.332483Z","title":"CamemBERT: a tasty French language model, in: Proceedings of ACL, pp","venue":null,"work_id":"45e29cf2-6cfa-4bbc-b871-af0f14163cb4","year":2020},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:b50ad54b9dbe375d7b272d4a93cd3df622cd605633d792af79ebc2fef721ab78","observation_id":"ffef5c22-058d-4bc6-b934-a8361559a09d","resolution":{"observed_at":"2026-07-11T02:07:49.356234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.305898Z","title":"Learning using generated privileged information by text-to-image diffusion models, in: Proceedings of ICPR, pp","venue":null,"work_id":"0b0d6fb0-3ea6-47b8-91c2-74ae27e2e5c8","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f28cdbe7870c51a8eba10eb99147b5449c5a6d883a4a5f8f1a3cfde50b3785c1","observation_id":"b74604ae-6a73-4ab8-b296-85bad7aa1bed","resolution":{"observed_at":"2026-07-11T02:07:49.328815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.857472Z","title":"Verbal sentiment analysis and detection using recurrent neural network, in: Advanced Data Mining Tools and Methods for Social Computing","venue":null,"work_id":"e6abbe64-3d6d-49cc-951f-1887f62a6403","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:b23f1a747bd51269969964524f533386223dbeadff99379d72ea08364254f4b2","observation_id":"9d77120e-2752-4f43-a185-3bdf66a764c7","resolution":{"observed_at":"2026-07-11T02:07:48.882398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03000","last_updated":"2024-01-04T22:42:14Z","snapshot_observed_at":"2026-07-06T17:12:06.715778Z","submitted_at":"2024-01-04T22:42:14Z","title":"Bridging Modalities: Knowledge Distillation and Masked Training for Translating Multi-Modal Emotion Recognition to Uni-Modal, Speech-Only Emotion Recognition","version":1},"cited_work":{"arxiv_id":"2401.03000","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.03000","snapshot_observed_at":"2026-07-11T01:57:52.008800Z","title":"Bridging Modalities: Knowledge Distillation and Masked Training for Translating Multi-Modal Emotion Recognition to Uni-Modal, Speech-Only Emotion Recognition","venue":"cs.SD","work_id":"0118e0c6-52fb-4257-b793-1cafbbba7918","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2401.03000","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:70f0291489bfd966a61fccf60928a2b96447bac404a837d538a973371de388ab","observation_id":"5c34b6f5-2a3b-4f4d-af1c-0af8fd4e45ba","resolution":{"observed_at":"2026-07-11T01:57:52.031561Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.146180Z","title":null,"venue":null,"work_id":"d33c3ab4-e820-4c37-bfb7-5bf1824e122e","year":null},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:c61a3f2718d032460a073bba9095f840491ab1f0e7390d98e4d5242486f90eab","observation_id":"bfaf5578-4fc6-4d6f-8a12-8647fb491780","resolution":{"observed_at":"2026-07-11T02:07:49.174874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.409367Z","title":"4668–4672","venue":null,"work_id":"ba3d1c5b-ee09-43d9-90d6-fce398fb7d38","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:d2ceb90060057eaf9fb3edd49ded50fe38450743942174f1a121238de97b0c54","observation_id":"7fcf8860-9b95-48d0-8dcb-d715a2158b6e","resolution":{"observed_at":"2026-07-11T02:07:48.433904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":"2207.04672","doi":"10.18653/v1/w19-5207","metadata_source":"pith","pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","venue":"cs.CL","work_id":"68c8336c-d20e-40fa-ba9c-89459da6fc1a","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f2d9d14b02cdf1179e1f608d4a60f5db2475ef1ca9160c4a6fab8282a745cb07","observation_id":"8adb56cc-3895-4df3-8298-bf67eef50be9","resolution":{"observed_at":"2026-07-11T01:57:52.159386Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.010485Z","title":"RoBERTuito: a pre-trained language model for social media text in Spanish, in: Proceedings of LREC, pp","venue":null,"work_id":"fe33b0ad-221c-4ef8-9afe-0081cb9460f2","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:7588670ff1c90788425bd60fe83d5deb47add9f250f57b773888aed4c833f172","observation_id":"e3810431-9f63-4532-bbbb-7601d50ccc77","resolution":{"observed_at":"2026-07-11T02:07:49.034169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.100021Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations, in: Proceedings of ACL, pp","venue":null,"work_id":"de81e701-b5af-4e6a-86a6-99bbd4f1d40e","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:2c9b78ea39e567ecfdbb3ccf16bbd9899030c7f61adaefe412b5b6b37d861d1c","observation_id":"f4e197aa-3d68-4436-b2cc-caa9b2cea59c","resolution":{"observed_at":"2026-07-11T02:07:49.133028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.174748Z","title":"Scaling speech technology to 1,000+languages","venue":null,"work_id":"31981a1f-8a90-480e-bcf8-c9826b778ab3","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:765c74c98db5ed29c9d566349b3a6418fb08202bf6a6972f27d066ffa8135ebc","observation_id":"31401229-8535-41aa-abe5-79ab315dbe2a","resolution":{"observed_at":"2026-07-11T02:07:49.201643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.418844Z","title":"Robust Speech Recognition via Large-Scale Weak Supervision, in: Proceedings of ICML, pp","venue":null,"work_id":"14e8be83-14e7-429e-95be-0f9d4c1d472f","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:625449a2e287137a9719f9432c1f81bd0b4f1d7c2462a1fce6cdfd7b46910cea","observation_id":"2b27edf8-5f60-414a-839d-285db828943c","resolution":{"observed_at":"2026-07-11T02:07:49.443273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.668958Z","title":"Cascaded cross-modal transformer for audio-textual classification","venue":null,"work_id":"e223a0ae-9dbd-473d-9863-faaf74931e45","year":2024},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:16fefae8de2f0baae8e232b6b37c088849fcae69cbafc6794b38d77e7acf5d97","observation_id":"7687e83f-2f1a-478f-8084-fbcba3c8d3b2","resolution":{"observed_at":"2026-07-11T02:07:49.696578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.765679Z","title":"Cascaded cross-modal transformer for request and complaint detection, in: Proceedings of ACMMM, pp","venue":null,"work_id":"a81970fa-dfb7-44bb-a7f7-b5a30c1419e5","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:5c11b4d13ef28980cbf6137389fc8eb6aeffe6457615d43620f910b8f69349ee","observation_id":"17fe5ee7-83eb-411a-814d-bb49c472a88e","resolution":{"observed_at":"2026-07-11T02:07:48.792233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.730374Z","title":"SepTr: Separable Transformer for Audio Spectrogram Processing, in: Proceedings of INTER- SPEECH, pp","venue":null,"work_id":"cabc75f4-aa86-45db-a339-2c1c017596e2","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f070f413e6cbd1b19a06e8bbaec972b902198605c4c4b7eae09b1b1c28633649","observation_id":"f3cdb596-e0bf-4499-b398-13ab84f207f4","resolution":{"observed_at":"2026-07-11T02:07:49.758610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.634952Z","title":"An integrated approach for mental health assessment using emotion analysis and scales","venue":null,"work_id":"60c6e558-12df-45b4-a679-588aed2b43da","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:93963337f9cb3e4ac0295341e46658d8af07909858397b75f8e4427494d6a0cd","observation_id":"050246b2-a0f1-436a-8777-1513cb80f3a5","resolution":{"observed_at":"2026-07-11T02:07:48.665945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.249179Z","title":"Leveraging pre-trained language model for speech sentiment analysis, in: Proceedings of INTERSPEECH, pp","venue":null,"work_id":"63217d6f-cc94-44f8-812b-b5317379c7a4","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:7695229cf40b3741d5a150421a637f997e9011ae5629532fbacba4abc74c57d3","observation_id":"13152bb5-235f-490d-a9b3-8ff72df03477","resolution":{"observed_at":"2026-07-11T02:07:49.276886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.112719Z","title":"A comparative study on Bengali speech sentiment analysis based on audio data, in: Proceedings of BigComp, pp","venue":null,"work_id":"83469442-8965-4442-bbb9-719c5726f37d","year":2023},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:35b5f999fd7c64f5110403c177e7effc51fdb945c8057b29b02c553a7f8a0d71","observation_id":"9a154783-b248-45ab-9fcc-c64df45744a8","resolution":{"observed_at":"2026-07-11T02:07:49.142487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.076207Z","title":"Multimodal transformer for unaligned multimodal language sequences, in: Proceedings of ACL, pp","venue":null,"work_id":"00acaccb-e666-4f69-a0bf-86c9dcdda2c6","year":2019},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:ce878fdd45e36714fc65664a0d2c32fffc247fa94784c30df95d471c5669814e","observation_id":"3ad7cd62-36fd-4bd7-8197-18dbb4cbf17d","resolution":{"observed_at":"2026-07-11T02:07:49.106555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:48.885973Z","title":"Hierarchical cross-modal attention and dual audio pathways for enhanced multimodal sentiment analysis","venue":null,"work_id":"cc561afd-478d-48cc-9a26-09ebfb971967","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:9c8f57fd8375104d215cf87694c7bdbf9f0ad0d40f28307d2a6967e7d661ec32","observation_id":"d4331dbd-6328-40ab-8fa6-2c0ad0ab1bc1","resolution":{"observed_at":"2026-07-11T02:07:48.912555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.219045Z","title":"Learning using privileged information: Similarity control and knowledge transfer","venue":null,"work_id":"b50c4914-6cd0-44bc-bd7e-8e837e3dd0db","year":2015},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:2bf34688dead89ab78887425a2cf2204121047a2f2993aeceb3dc2450df44438","observation_id":"d41049fb-4d5a-4183-8be6-3675fee23ca4","resolution":{"observed_at":"2026-07-11T02:07:49.245218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02735","last_updated":"2022-10-03T20:50:54Z","snapshot_observed_at":"2026-07-06T12:05:22.076764Z","submitted_at":"2021-11-04T10:39:06Z","title":"A Fine-tuned Wav2vec 2.0/HuBERT Benchmark For Speech Emotion Recognition, Speaker Verification and Spoken Language Understanding","version":3},"cited_work":{"arxiv_id":"2111.02735","doi":null,"metadata_source":"pith","pith_arxiv_id":"2111.02735","snapshot_observed_at":"2026-07-11T01:57:52.037436Z","title":"A fine-tuned wav2vec 2.0/hubert benchmark for speech emotion recognition, speaker verification and spoken language understanding","venue":"cs.CL","work_id":"6bb9f860-e45b-4ceb-8ca3-17d38124e800","year":2021},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2111.02735","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:687948d6e2200dcef429aad5a080d10c599e94e9bc36f7194b81d926cee1b6ea","observation_id":"2b030a15-2b87-45b2-8590-d35b6fbd9979","resolution":{"observed_at":"2026-07-11T01:57:52.061776Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.636611Z","title":"Enriching multimodal sentiment analysis through textual emotional descriptions of visual-audio content, in: Proceedings of AAAI, pp","venue":null,"work_id":"d0620114-5bb5-4af0-81a4-4635f869e29f","year":2025},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f658b13c37044414e6915880c938b9a1e44cb86261a419197cd34fdcb965e7bb","observation_id":"55ee1f27-4db3-4afe-ac07-226c743311bf","resolution":{"observed_at":"2026-07-11T02:07:49.664775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.11772","last_updated":"2022-11-12T13:05:28Z","snapshot_observed_at":"2026-08-03T13:30:54.515603Z","submitted_at":"2022-11-12T13:05:28Z","title":"A Self-Adjusting Fusion Representation Learning Model for Unaligned Text-Audio Sequences","version":1},"cited_work":{"arxiv_id":"2212.11772","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.11772","snapshot_observed_at":"2026-07-11T01:57:52.068493Z","title":"A Self-Adjusting Fusion Representation Learning Model for Unaligned Text-Audio Sequences","venue":"cs.CL","work_id":"6ae9c2cd-7ca1-4085-904c-81e1d0c46703","year":2022},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"cited_paper":"/paper/2212.11772","citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:89fbbed18a18578aa979d79bced266a95c42888405d1232789ed879456ad3c35","observation_id":"53ca2bb2-41f4-4adb-9b3f-f91edeec52d4","resolution":{"observed_at":"2026-07-11T01:57:52.092558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.280832Z","title":"Multimodal speech emotion recognition using audio and text, in: Proceedings of SLT, pp","venue":null,"work_id":"297640ed-0a38-4558-8e95-60733ba1e457","year":2018},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:dbd8ad835d0274b822fbaf5686932174269039b821060d8f8023100d5f5eede2","observation_id":"d1bbf595-ef6c-43fa-a12b-4ec23e26d35b","resolution":{"observed_at":"2026-07-11T02:07:49.302756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T02:07:49.605953Z","title":"Personality-aware multimodal driver emotion recognition towards intelligent connected vehicles","venue":null,"work_id":"75bb25b6-c089-4b01-bb01-da97e693c1b1","year":2026},"citing_paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T01:53:00.127636Z"},"links":{"citing_paper":"/paper/2607.06611"},"observation_digest":"sha256:f366e22a14feeab038d49c4fa93a4f4a441d4b5a9063b53d042a5b9fb34472d5","observation_id":"7c0dee6f-1b7b-4c3b-971c-47b38a7c9102","resolution":{"observed_at":"2026-07-11T02:07:49.632327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06611","last_updated":"2026-07-07T06:48:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T05:20:23.340858Z","submitted_at":"2026-07-07T06:48:23Z","title":"Audio Sentiment Analysis via Distillation and Cross-Modal Integration of Generated Multilingual Transcripts"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":7,"verified_fuzzy":45},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2607.06611."}