{"as_of":"2026-08-11T13:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:16354cc32b247c4830d05be34dcdc8bd6a49dc23f3e4776c520d8460e4752fca","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:17:35.636796Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:47:55.530450Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11468","snapshot_observed_at":"2026-08-07T14:47:55.530450Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18217","last_updated":"2025-05-23T08:01:56Z","snapshot_observed_at":"2026-08-10T23:25:00.576907Z","submitted_at":"2025-05-23T08:01:56Z","title":"ABHINAYA -- A System for Speech Emotion Recognition In Naturalistic Conditions Challenge","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:47:55.530450Z"},"links":{"cited_paper":"/paper/2501.11468","citing_paper":"/paper/2505.18217"},"observation_digest":"sha256:ccdf5dc0cd696227f6e5d5ae4d6ef4de7ade3d27cb8e47165ed4c822cd80debf","observation_id":"2d189dd6-ead4-46ae-af79-a67e5ba7d5bf","resolution":{"observed_at":"2026-08-07T14:47:55.530450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11468","snapshot_observed_at":"2026-08-07T13:56:45.620948Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20511","last_updated":"2025-09-09T06:34:44Z","snapshot_observed_at":"2026-08-09T02:01:08.440026Z","submitted_at":"2025-05-26T20:23:24Z","title":"Multimodal Emotion Recognition in Conversations: A Survey of Methods, Trends, Challenges and Prospects","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T13:56:45.620948Z"},"links":{"cited_paper":"/paper/2501.11468","citing_paper":"/paper/2505.20511"},"observation_digest":"sha256:ea3704a48fa1527fc74ffd6de373d5d57112f9b2d15a08d9e72061b17580d69a","observation_id":"69c4f873-9993-4f4a-9f03-b79854db2ad6","resolution":{"observed_at":"2026-08-07T13:56:45.620948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11468","snapshot_observed_at":"2026-08-07T12:45:09.683582Z","title":"Llm supervised pre-training for mul- timodal emotion recognition in conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23732","last_updated":"2025-05-29T17:56:55Z","snapshot_observed_at":"2026-08-10T23:24:30.514690Z","submitted_at":"2025-05-29T17:56:55Z","title":"EmotionRankCLAP: Bridging Natural Language Speaking Styles and Ordinal Speech Emotion via Rank-N-Contrast","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:45:09.683582Z"},"links":{"cited_paper":"/paper/2501.11468","citing_paper":"/paper/2505.23732"},"observation_digest":"sha256:9b720e0c92f1616d07f13c727dbe57022aa2373bcd68bc8619de8b6990a92603","observation_id":"5b5d3e63-f6b8-439a-ab2d-f0034b509ce6","resolution":{"observed_at":"2026-08-07T12:45:09.683582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"cited_work":{"arxiv_id":"2501.11468","doi":"10.48550/arxiv.2501.11468","metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11468","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi:10.48550/arXiv.2501.11468 , abstract =","venue":"ArXiv.org","work_id":"36e2a382-9361-4b9f-ab0f-c4e06aedc170","year":null},"citing_paper":{"arxiv_id":"2606.24985","last_updated":"2026-06-23T14:24:43Z","snapshot_observed_at":"2026-07-06T23:59:28.120338Z","submitted_at":"2026-06-23T14:24:43Z","title":"Retrieval-Augmented Personalization with Foundation Models for Wearable Stress Detection","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-06-26T00:27:41.609691Z"},"links":{"cited_paper":"/paper/2501.11468","citing_paper":"/paper/2606.24985"},"observation_digest":"sha256:4c9ebf45fae51d2370a88fbf3305eb73e7fd0467cd3f214ac63face3a4c64a88","observation_id":"e0492a22-5dd2-4387-bf09-750e0ec97054","resolution":{"observed_at":"2026-06-26T00:28:42.836140Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.11468/citation-record","integrity":"/paper/2501.11468/integrity","json":"/paper/2501.11468/citation-record.json","paper":"/paper/2501.11468"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.301333Z","title":"Affective multimodal human-computer interaction,","venue":null,"work_id":"a7369c00-50ef-48b8-a953-deccaf78c77e","year":2005},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.419057Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:ad829049de5ade68d862a17d4038b8814ba3628c382babce2fb84a65cfc1a680","observation_id":"866cf597-9335-406d-af67-1484c8a6e549","resolution":{"observed_at":"2026-08-10T18:17:36.305023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.08458","last_updated":"2019-06-12T16:17:20Z","snapshot_observed_at":"2026-07-06T07:28:48.758265Z","submitted_at":"2019-01-24T15:35:00Z","title":"Emotion Detection and Analysis on Social Media","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1901.08458","snapshot_observed_at":"2026-08-10T18:17:35.423708Z","title":"Emotion detection and analysis on social media,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.423708Z"},"links":{"cited_paper":"/paper/1901.08458","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:ccff3684404177d3cdb67819a5116557f39730e4a06e9cfced37cf323087f13a","observation_id":"5e41bea9-d8ef-46ba-a1d7-82db4dd73f62","resolution":{"observed_at":"2026-08-10T18:17:35.423708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.290695Z","title":"Acoustic and lexical sentiment analysis for customer service calls,","venue":null,"work_id":"47856d2a-02de-4280-a745-02fecb05256d","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.427941Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:632b4bab93b89fcba6799b3bd4986eaacbdb9ffc368fc5ffe980a23e26c4bd23","observation_id":"cd31bab1-5abc-41bb-8447-aa75562f066c","resolution":{"observed_at":"2026-08-10T18:17:36.294668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.278921Z","title":"EmoKey: An emotion-aware smartphone keyboard for mental health monitoring,","venue":null,"work_id":"160fc926-237f-4f13-b38c-a5a3a4e99732","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.431637Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:cc5e11e0fafae488cb78de065b6ddf48b1a1c116a8e6edacbdbcf0e92807c4e2","observation_id":"5319079b-84c2-4e01-9db7-8ffd75547ee5","resolution":{"observed_at":"2026-08-10T18:17:36.282950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.266783Z","title":"K-EmoCon, a multimodal sensor dataset for contin- uous emotion recognition in naturalistic conversations,","venue":null,"work_id":"773ebc23-c3bc-46e1-b7f7-cfa0fd1622aa","year":2020},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.435965Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:ac74454ce4947e2ce31766edfeec5b608961a0eb8557e4a7bf7e62f5e1a9e09f","observation_id":"de201f61-bf36-4ec1-b4ee-70e1d2a40216","resolution":{"observed_at":"2026-08-10T18:17:36.271536Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.256552Z","title":"Emotion recognition in conversation: Research chal- lenges, datasets, and recent advances,","venue":null,"work_id":"ce962c1a-7c57-42ec-ba35-af904ae5cc48","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.440371Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:31090803bbd46afdb066b73716f9d9557a3ab11a1af91fc69a24fa11613f1a85","observation_id":"eecb4f29-c582-4d43-8fd0-ba01e5eb10ce","resolution":{"observed_at":"2026-08-10T18:17:36.260309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.245772Z","title":"Emotion recognition using facial expressions,","venue":null,"work_id":"deaeb54b-fad2-48c7-9228-873db95daa32","year":2017},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.444502Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:c7226aab094202e0d2129e485ee448c020d9f996f545e6fecf8b41745f0cd916","observation_id":"218d5c2b-eae6-457d-8f5f-916ed708f7b3","resolution":{"observed_at":"2026-08-10T18:17:36.249711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.235829Z","title":null,"venue":null,"work_id":"2b5e9fb7-3e6b-47f3-9564-fb7ddc081680","year":2003},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.448109Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:35a162c2d0cf914a96075e594771d780d4b45a0fc8b24372344ec00f71b34f8e","observation_id":"0aec1a22-6ce1-4d44-8121-9b7926a4d39a","resolution":{"observed_at":"2026-08-10T18:17:36.239418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.225516Z","title":"Individuality in communicative bodily behaviours,","venue":null,"work_id":"68e4b011-e764-42c0-9c20-b501dcfbbcb3","year":2012},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.451642Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:03a93641a2c57e7933322d905067c95119391e0e9c66916047aaf46417ee573f","observation_id":"03c98362-25c2-4815-ac91-5c702c1eea98","resolution":{"observed_at":"2026-08-10T18:17:36.229318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.214058Z","title":"Physiological signals and their use in augment- ing emotion recognition for human–machine interaction,","venue":null,"work_id":"a3d6f193-184d-4596-9295-44f56d0492fd","year":2011},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.455222Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:cac8614e7339f97976869209b5e4de289c52ad618f98ea1e24045b444d352b56","observation_id":"13dac0de-cf6a-4ddd-86f1-3b1c8e49fe9d","resolution":{"observed_at":"2026-08-10T18:17:36.218408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.203367Z","title":"A review of affective computing: From unimodal analysis to multimodal fusion,","venue":null,"work_id":"22b6bd0a-79a2-419a-aced-11f8f5a1cca6","year":2017},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.458822Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:f359aff0b9ae07384b1e25d7c3f224cd6b18a401bbb090d3f6442675678aa234","observation_id":"d03fef3a-3b49-4967-8bd5-5023e83342b6","resolution":{"observed_at":"2026-08-10T18:17:36.207108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.192077Z","title":"Some aspects of fundamental frequency and envelope amplitude as related to the emotional content of speech,","venue":null,"work_id":"d5a13b86-db2f-4ea0-aecf-f85e962fa98c","year":1962},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.462398Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:28b4ec8fa22a5c15f048da146f4d7d58dae1503968bc5f2456df81c89bbfbd80","observation_id":"989aff56-1feb-4c8f-a2f4-cb1cb21871d7","resolution":{"observed_at":"2026-08-10T18:17:36.196734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.181083Z","title":"Emotion in speech: Recognition and application to call centers,","venue":null,"work_id":"a626fa28-6da4-4b69-9acf-ac02ee3f5c4f","year":1999},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.466093Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:419d670ec9395b1e79c7fc5a1617c91117f384ec3d3c9b992c6bda1b55506a0a","observation_id":"c77b0d66-4f67-4b0a-92f8-e9749555649f","resolution":{"observed_at":"2026-08-10T18:17:36.184870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.169549Z","title":"Speech emotion recognition using spectrogram & phoneme embedding","venue":null,"work_id":"0bc33a55-d8a8-478f-8e89-632b170378b0","year":2018},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.470671Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:6685e1fb12e3175072deb319ac5ff641ce57f481b3b33c4552b1b956ef381893","observation_id":"e9a6ee3c-1466-45d7-ae3e-1c3b7447c96c","resolution":{"observed_at":"2026-08-10T18:17:36.173743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.157580Z","title":"Effective attention mechanism in dynamic models for speech emotion recognition,","venue":null,"work_id":"f1ba10e3-7acb-4bab-88a6-11f12dda10a6","year":2018},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.474280Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:c4de8a48cb78bab9bd597f77ed4c361f983b4a7ed964ec8c8e1ebc85f7afbf0e","observation_id":"d7b145a2-bfcd-4657-a864-db92f7ed2fb7","resolution":{"observed_at":"2026-08-10T18:17:36.161775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.146675Z","title":"Multimodal transformer with learnable frontend and self attention for emotion recognition,","venue":null,"work_id":"e0d412d5-1951-4fad-9608-813fe16ae74a","year":2022},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.477840Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:94e928a67f86540a3e8bc85e7b551ba57ce73de298dedb8d417a9797dcc39f91","observation_id":"31555f2e-c111-478b-9a1e-364b9796a3d7","resolution":{"observed_at":"2026-08-10T18:17:36.150548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.135441Z","title":"wav2vec 2.0: A framework for self-supervised learning of speech representations,","venue":null,"work_id":"2df65f82-56bd-4a76-a350-25cc4d2d91dd","year":2020},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.481598Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:e22e9bcd425465c74adc0b1644c4508912ec4549363c13564b7e9db2d65211d3","observation_id":"04007e6f-651a-474a-ba31-f4ff45361c37","resolution":{"observed_at":"2026-08-10T18:17:36.139343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.124481Z","title":"HuBERT: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":"68d04e3b-f9cd-43ff-9584-baa042dfbc7b","year":2021},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.485325Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:c05396903508db081680221b9bb71c1501829b3731db5371a9714893fd0b1a04","observation_id":"d9d93a3d-1382-4c1f-a520-50a97a349f2e","resolution":{"observed_at":"2026-08-10T18:17:36.128421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.113443Z","title":"WavLM: Large-scale self-supervised pre-training for full stack speech processing,","venue":null,"work_id":"ce93228b-6a35-44e7-a116-8ee9862de13a","year":2022},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.489285Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:2554e3991e8355f443f188a0f92658ac364e31aa7087e7c3cbb16529932d1432","observation_id":"49ce9a4a-afdc-4d20-acc7-d777167e1482","resolution":{"observed_at":"2026-08-10T18:17:36.117598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-02T21:51:36.809095Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-10T18:17:35.493122Z","title":"SALMONN: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.493122Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:4452fd8541de0a2071ea1471711ae86a61134be0d96a82714d3c18fd573b45dc","observation_id":"b8e6a9b6-7d14-47cb-b97e-903404c352bc","resolution":{"observed_at":"2026-08-10T18:17:35.493122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00656","last_updated":"2024-09-21T15:27:30Z","snapshot_observed_at":"2026-08-11T09:03:32.368448Z","submitted_at":"2024-03-31T12:01:32Z","title":"WavLLM: Towards Robust and Adaptive Speech Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00656","snapshot_observed_at":"2026-08-10T18:17:35.497624Z","title":"WavLLM: Towards robust and adaptive speech large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.497624Z"},"links":{"cited_paper":"/paper/2404.00656","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:ae5c65bee925826847440dc933cc20775a1921a6ed4149ebfb4a5d82558631a8","observation_id":"5bad9113-8d95-4f27-a1a3-14cd052698d5","resolution":{"observed_at":"2026-08-10T18:17:35.497624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.103077Z","title":"Sentiwordnet: A publicly available lexical resource for opinion mining,","venue":null,"work_id":"b20ab5a7-27d8-4867-aae8-688a0d67d167","year":2006},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.502020Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:96c0f57a061877a30d50eabc52aa2d98a68da4668c50eb1295129dd8d869fe33","observation_id":"a3447811-b9b6-4417-8a0d-10521405b4ab","resolution":{"observed_at":"2026-08-10T18:17:36.106808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.092613Z","title":"Lexicon-based methods for sentiment analysis,","venue":null,"work_id":"6b65f860-931b-42fe-b8ce-2db5e180b2a5","year":2011},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.505528Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:3638553e164c82720f70fb6d48fa50837612c7b5a805728a45f71ac91ac682e3","observation_id":"37643e19-2583-49fe-afe9-3064e0cf88be","resolution":{"observed_at":"2026-08-10T18:17:36.096339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.081954Z","title":"Convolutional neural networks for sentence classification,","venue":null,"work_id":"3175da02-fca7-4fe8-b914-50684003984e","year":2014},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.509248Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:e9a04605e4ac1de44f46d53b637a9d0415c6cbadbac453df67a272c1b5e2891a","observation_id":"f6aeab6a-b0fd-4378-a3b0-6a0e19ca802f","resolution":{"observed_at":"2026-08-10T18:17:36.085890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.070568Z","title":"Opinion mining with deep recurrent neural networks,","venue":null,"work_id":"a393ae87-01e6-45a1-9bd9-7f669dd5792d","year":2014},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.512922Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:03cfc69a4eac5bfec73ee635d725930cc4bda94053bf4ee2cbdfe31f8ac17daa","observation_id":"38599d5a-c0aa-494a-9682-8b7d7cf801db","resolution":{"observed_at":"2026-08-10T18:17:36.074582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.059231Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding,","venue":null,"work_id":"105b8b1a-b8bd-4d60-b28d-e04615d084b3","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.516512Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:f346947a751c6d9c47c8b4e446833bd43bfc07ca474b17c04cbbe4b897633030","observation_id":"f94de10d-12ca-4dcf-a399-f01ae3d52001","resolution":{"observed_at":"2026-08-10T18:17:36.063251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.048566Z","title":"Aspect-based sentiment analysis using bert,","venue":null,"work_id":"5413ab65-54d4-4d97-8a1d-4c97ebe0ba4f","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.520136Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:f98aba77ed99769cf33dc95073640b33bb3f10d166f9cb60110765494ce1dda5","observation_id":"60430582-59ab-4ca4-93d9-031a6dcc20dd","resolution":{"observed_at":"2026-08-10T18:17:36.052343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T18:17:35.523638Z","title":"Roberta: A robustly optimized bert pretraining approach,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.523638Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:7ba5058a1a4ebc60c1ca6e18a53340f4e23e4955ff7f9e037d1bcb37fc82c38d","observation_id":"be1fea05-c0a6-4952-a307-3895643a27de","resolution":{"observed_at":"2026-08-10T18:17:35.523638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.037123Z","title":"Exploring the limits of transfer learning with a unified text-to-text transformer,","venue":null,"work_id":"1c3f2462-1302-4a1a-96ec-ab7c55001bd2","year":2020},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.528094Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:1d49c019de138c434a5638361aeaeb8c654ebba7c7effebb7ab8727711c868ee","observation_id":"e6f24913-5941-4531-8902-4544698ab002","resolution":{"observed_at":"2026-08-10T18:17:36.041059Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15005","last_updated":"2023-05-24T10:45:25Z","snapshot_observed_at":"2026-08-10T05:38:31.450631Z","submitted_at":"2023-05-24T10:45:25Z","title":"Sentiment Analysis in the Era of Large Language Models: A Reality Check","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15005","snapshot_observed_at":"2026-08-10T18:17:35.531639Z","title":"Sentiment analysis in the era of large language models: A reality check,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.531639Z"},"links":{"cited_paper":"/paper/2305.15005","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:592b4f8208665a34ae49d12a5a64e1f9adce0acee1ebfaa21e39e3baecae253e","observation_id":"b34c2d07-636b-45f7-bcb1-cd2c7c338514","resolution":{"observed_at":"2026-08-10T18:17:35.531639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06910","last_updated":"2024-01-09T11:45:34Z","snapshot_observed_at":"2026-08-11T07:56:59.104094Z","submitted_at":"2023-04-14T03:25:00Z","title":"HCAM -- Hierarchical Cross Attention Model for Multi-modal Emotion Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06910","snapshot_observed_at":"2026-08-10T18:17:35.535448Z","title":"HCAM–Hierarchical Cross Atten- tion Model for Multi-modal Emotion Recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.535448Z"},"links":{"cited_paper":"/paper/2304.06910","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:c7e09ebea37c7bb1e885f7cfa970365803111505737c1465b1bb715c8913cee2","observation_id":"3f9dff2c-2cfb-4ba9-a79d-daf0c93186ac","resolution":{"observed_at":"2026-08-10T18:17:35.535448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.020365Z","title":"DialogueGCN: A Graph Convolutional Neural Net- work for Emotion Recognition in Conversation,","venue":null,"work_id":"c5125610-4b8b-4345-8986-7e268184c19f","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.539430Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:e40cc0a3047d5ac44e627f6cd2f73ac6de55cc629def482528934fdde6678db9","observation_id":"628fa957-8825-452e-9b37-1576f981fcb4","resolution":{"observed_at":"2026-08-10T18:17:36.024440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:36.009439Z","title":"EmoCaps: Emotion capsule based model for conversational emotion recognition,","venue":null,"work_id":"689dd331-5b22-40c2-9170-799916ea025d","year":2022},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.542769Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:fefdf6750d4a939e99d4fc05697d5375cbf2279ef7d2c1c0be3526bea3cc37c0","observation_id":"53af04c7-8f1a-45a9-9f5c-23ebba94c50a","resolution":{"observed_at":"2026-08-10T18:17:36.013202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.998423Z","title":"Robust speech recognition via large-scale weak supervision,","venue":null,"work_id":"03fac3c7-80b1-4d4c-ac92-1ef56d074b1d","year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.546273Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:06b8ec2044929291248e453781b1ce430267f1800029cc43c3172d01afc8f3cd","observation_id":"5f74b22b-3d8e-4c30-b979-a65fbf207f0d","resolution":{"observed_at":"2026-08-10T18:17:36.002290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05566","last_updated":"2025-08-26T06:33:35Z","snapshot_observed_at":"2026-07-06T19:12:27.820454Z","submitted_at":"2024-09-09T12:46:32Z","title":"Leveraging Content and Acoustic Representations for Speech Emotion Recognition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05566","snapshot_observed_at":"2026-08-10T18:17:35.549930Z","title":"Leveraging content and acoustic rep- resentations for efficient speech emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.549930Z"},"links":{"cited_paper":"/paper/2409.05566","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:e44195f9b21613820d6caf4ab147004f08ca83346cf291def321d147a02bdca3","observation_id":"10937777-6e3f-4a52-bf68-6b82ec5aaeeb","resolution":{"observed_at":"2026-08-10T18:17:35.549930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.986360Z","title":"Vilbert: Pretraining task-agnostic visiolinguistic represen- tations for vision-and-language tasks,","venue":null,"work_id":"63fe150f-15ff-42ec-bc4a-5f6cb753d06d","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.553675Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:8f70be05759401608a5e0a72d38aa85264ba179c1f9ee32e0c73be1f0052625a","observation_id":"6239004e-c073-4f25-811d-0a1009bf31e1","resolution":{"observed_at":"2026-08-10T18:17:35.991294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.973922Z","title":"IEMOCAP: Interactive emotional dyadic motion capture database,","venue":null,"work_id":"8422f1ce-978e-490f-93fa-528d58a23a16","year":2008},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.557776Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:5aed706e849069792ad95ee04785c5fc40622c6f10b499e7bebbf5893595a8ea","observation_id":"07ceb723-15c5-4e72-aa22-fd10da2abb48","resolution":{"observed_at":"2026-08-10T18:17:35.978298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.963314Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations,","venue":null,"work_id":"39cf2a3e-2568-4d51-8444-45d3ebca4006","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.561420Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:7c815fbfa6dff09b42f3b2a7e1fa493bcf6086329a264bea3c303323f42bbb87","observation_id":"dcd13b27-cd19-4848-a278-21dae32acc67","resolution":{"observed_at":"2026-08-10T18:17:35.967174Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06259","last_updated":"2016-08-12T02:39:40Z","snapshot_observed_at":"2026-07-06T05:00:39.739374Z","submitted_at":"2016-06-20T19:23:53Z","title":"MOSI: Multimodal Corpus of Sentiment Intensity and Subjectivity Analysis in Online Opinion Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06259","snapshot_observed_at":"2026-08-10T18:17:35.564982Z","title":"MOSI: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.564982Z"},"links":{"cited_paper":"/paper/1606.06259","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:8cdf069bc1b1e334daa8d86180129c606c6c4244fdeff43442a9358180f9b0d8","observation_id":"cc33a720-c270-41bf-b79c-549335ee802a","resolution":{"observed_at":"2026-08-10T18:17:35.564982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04339","last_updated":"2024-02-17T10:08:06Z","snapshot_observed_at":"2026-08-10T14:37:01.564142Z","submitted_at":"2023-04-10T00:55:59Z","title":"Is ChatGPT a Good Sentiment Analyzer? A Preliminary Study","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04339","snapshot_observed_at":"2026-08-10T18:17:35.569004Z","title":"Is ChatGPT a good sentiment analyzer? A preliminary study,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.569004Z"},"links":{"cited_paper":"/paper/2304.04339","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:d3e233d8e3059f11f3ce98152550eabe95d9a95acd500e18483a64aa81fd98e2","observation_id":"ba0b7b62-d813-4610-a861-c73c36a4113b","resolution":{"observed_at":"2026-08-10T18:17:35.569004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10198","last_updated":"2023-03-02T14:33:12Z","snapshot_observed_at":"2026-08-11T03:13:41.586299Z","submitted_at":"2023-02-19T12:29:33Z","title":"Can ChatGPT Understand Too? A Comparative Study on ChatGPT and Fine-tuned BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10198","snapshot_observed_at":"2026-08-10T18:17:35.573236Z","title":"Can chatgpt understand too? a comparative study on chatgpt and fine-tuned bert,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.573236Z"},"links":{"cited_paper":"/paper/2302.10198","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:e5994a4c776f340f57d67fa3794d1c16a2752e1f44cb412978fae7186e26ada9","observation_id":"7aa58c72-1264-467d-9e83-fae4e456f139","resolution":{"observed_at":"2026-08-10T18:17:35.573236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.952481Z","title":"Emotionflow: Capture the dialogue level emotion transitions,","venue":null,"work_id":"48ce590c-7709-49c1-a524-c15884477682","year":2022},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.577945Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:ac3954e9b890e6968a5d57120af5a288ef2aeb1b6506bb580dcbbc22f40fd72b","observation_id":"89ff986e-c5a6-4810-9e0d-76275c3aef26","resolution":{"observed_at":"2026-08-10T18:17:35.956180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.941112Z","title":"Supervised adversarial contrastive learning for emotion recognition in conversations,","venue":null,"work_id":"a3eb013d-7584-461b-9ed1-eb55ccfdf21e","year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.582336Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:979ec959729f346f4c260f371c978867c789ed8d7968ee2b2d5f019518eeceb0","observation_id":"9468b5ce-94e0-41cf-9c22-49d9cd9c4254","resolution":{"observed_at":"2026-08-10T18:17:35.945083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00262","last_updated":"2023-04-29T13:53:48Z","snapshot_observed_at":"2026-08-09T02:01:15.051781Z","submitted_at":"2023-04-29T13:53:48Z","title":"Hierarchical Dialogue Understanding with Special Tokens and Turn-level Attention","version":1},"cited_work":{"arxiv_id":"2305.00262","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.00262","snapshot_observed_at":"2026-08-10T18:17:35.699434Z","title":"Hierarchical Dialogue Understanding with Special Tokens and Turn-level Attention","venue":"cs.CL","work_id":"ef489745-8806-449f-98be-3a39b1198ded","year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.586649Z"},"links":{"cited_paper":"/paper/2305.00262","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:cc5fd1d019492ff1af48188f300995a3600e42aa090d9085ba7a0647617b614b","observation_id":"dcc564e9-e5b1-49e1-b1dc-1cd9653da385","resolution":{"observed_at":"2026-08-10T18:17:35.703566Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.930568Z","title":"Emotion-anchored contrastive learning framework for emotion recognition in conversation,","venue":null,"work_id":"40415e30-4f17-4f62-8823-57794346e879","year":2024},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.591792Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:dbe25b1b90d2fb76af9cec50be737dadf25bf61a2becdff640a8b6555aa9a05f","observation_id":"9c9854e4-7106-45b2-9f96-33bac1d6c7b7","resolution":{"observed_at":"2026-08-10T18:17:35.934154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.920054Z","title":"Multi-task self-supervised learning for robust speech recognition,","venue":null,"work_id":"2d2416cf-62fc-4602-8e5a-35b784f4b7ef","year":2020},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.596113Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:b8be02a4e570b84d262980114c15ae8e73c77c69d18aae57d3e60579ab8e9405","observation_id":"91dcfdf9-c96e-4999-9462-bccca90ed5a5","resolution":{"observed_at":"2026-08-10T18:17:35.923873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.907674Z","title":"SUPERB: Speech Processing Universal PERfor- mance Benchmark,","venue":null,"work_id":"4bcccb4f-c1e8-452c-8208-4767d7a87f9d","year":2021},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.599781Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:4e33642bb612aec9969e13c262492b1847b9492012a47eb940a92e2fdd14fa0a","observation_id":"acc39a6f-e84f-4aa0-a71e-aecf078a4ba2","resolution":{"observed_at":"2026-08-10T18:17:35.911298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16065","last_updated":"2023-05-28T17:26:58Z","snapshot_observed_at":"2026-07-30T23:02:55.787227Z","submitted_at":"2023-05-25T13:56:09Z","title":"ASR and Emotional Speech: A Word-Level Investigation of the Mutual Impact of Speech and Emotion Recognition","version":2},"cited_work":{"arxiv_id":"2305.16065","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.16065","snapshot_observed_at":"2026-08-10T18:17:35.679620Z","title":"ASR and Emotional Speech: A Word-Level Investigation of the Mutual Impact of Speech and Emotion Recognition","venue":"eess.AS","work_id":"c5995848-6e56-4bd7-a4ec-5aef535267fd","year":2023},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.603380Z"},"links":{"cited_paper":"/paper/2305.16065","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:2330241f0dc1d9c0ac0f9ac31f5656aa8e37d09ea4ae632acbf1e02986544380","observation_id":"a0e681ba-0310-4cfe-a927-27915f74f7f2","resolution":{"observed_at":"2026-08-10T18:17:35.686611Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.896569Z","title":"Building naturalistic emotionally balanced speech corpus by retrieving emotional speech from existing podcast recordings,","venue":null,"work_id":"f9b0b2e9-0ba6-4a27-b29f-1a19614fcd70","year":2017},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.607153Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:f5f3b26caf32616561d33ab4720bfded3f1a9a38419fe6855d879c11afc247ef","observation_id":"5249a9f6-c1bc-48d7-a0d8-50eec549ae25","resolution":{"observed_at":"2026-08-10T18:17:35.900529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.885041Z","title":"Context-dependent sentiment analysis in user-generated videos,","venue":null,"work_id":"0972d34f-41f9-4971-b1bd-741e29e76c3e","year":2017},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.610581Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:f6c64df46172211eda15275a59f4d45f5205e61761f87c2898e4c80e60acbfb2","observation_id":"77d57589-31ed-4fac-b5c6-d910b47bf336","resolution":{"observed_at":"2026-08-10T18:17:35.889219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.872426Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":"23a27245-7b66-4d67-983a-d4f973e243c5","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.613983Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:e0e1cf5e402ab5accac070819b6c814ec5927a7c78e4ea5c1f2602ed2543a735","observation_id":"b3afd40b-4c7d-4c1e-8f44-6d7e66da2914","resolution":{"observed_at":"2026-08-10T18:17:35.877120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.860224Z","title":"Locally confined modality fusion network with a global perspective for multimodal human affective computing,","venue":null,"work_id":"db6aa9cc-1f6d-40bb-8edf-df76c299f7ee","year":2019},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.617584Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:e30a1e8fdfe9d63f6ab214ea443eced6438d636660b3937a9d0427b3c77e377a","observation_id":"d27ca7da-ccad-46a4-aa13-3f5e2d22e1e7","resolution":{"observed_at":"2026-08-10T18:17:35.864016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.848359Z","title":"M3er: Multiplicative multimodal emotion recognition using facial, textual, and speech cues,","venue":null,"work_id":"35a1cdfa-5c76-4719-be02-3fea69b8da14","year":2020},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.622082Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:3f8ab64cc73d010f909733e26873a4efcddcf87b8af01332f60f902fce0803f1","observation_id":"66a9c210-d7cd-4975-a918-c3ff7f8e270a","resolution":{"observed_at":"2026-08-10T18:17:35.852336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.837104Z","title":"DialogueTRM: Exploring multi-modal emotional dy- namics in a conversation,","venue":null,"work_id":"19813901-6605-4d92-b91f-90275fe1ccc2","year":2021},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.625771Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:5012845d3435950f6c6341bab7b54c4b4ff5589eb8853e2aece5f0bf5178255b","observation_id":"66de570d-dc6f-4aa7-b5eb-e9a92af914ca","resolution":{"observed_at":"2026-08-10T18:17:35.840844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.825938Z","title":"SMIN: Semi-supervised Multi-modal Interaction Net- work for Conversational Emotion Recognition,","venue":null,"work_id":"2ecbc3a1-f458-4881-94c3-5bc9b70b6b45","year":2022},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.629471Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:3c9c02eea66718a89d875e9ea02da9248e28aff0303b8d34f3226a2cad784d72","observation_id":"7d2c6473-a9a9-47b9-8410-c9785ada2a3e","resolution":{"observed_at":"2026-08-10T18:17:35.830161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11256","last_updated":"2022-11-21T08:46:01Z","snapshot_observed_at":"2026-08-10T23:23:48.223778Z","submitted_at":"2022-11-21T08:46:01Z","title":"UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11256","snapshot_observed_at":"2026-08-10T18:17:35.633069Z","title":"UniMSE: Towards unified multimodal sentiment analysis and emotion recognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.633069Z"},"links":{"cited_paper":"/paper/2211.11256","citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:d28091fc125ab7d60395db50dbb3087f6592283c197b0d014e3269db5921d6a0","observation_id":"130df2fd-f238-405d-b6d9-aed2f2d9285e","resolution":{"observed_at":"2026-08-10T18:17:35.633069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:17:35.814649Z","title":"TelME: Teacher-leading Multimodal Fusion Network for Emotion Recognition in Conversation,","venue":null,"work_id":"10ec85e5-eed9-4332-8feb-bb1c91b07349","year":2024},"citing_paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:17:35.636796Z"},"links":{"citing_paper":"/paper/2501.11468"},"observation_digest":"sha256:f28d59129b567c97b05062e0a5487d57afdeb412b5197bb1d1d4f83129fa51ea","observation_id":"6921e8d7-6667-400a-a7e7-27feda6d958f","resolution":{"observed_at":"2026-08-10T18:17:35.818465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.11468","last_updated":"2025-01-20T12:56:02Z","latest_version":1,"primary_category":"eess.AS","snapshot_observed_at":"2026-08-11T06:53:51.702265Z","submitted_at":"2025-01-20T12:56:02Z","title":"LLM supervised Pre-training for Multimodal Emotion Recognition in Conversations"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":2,"verified_fuzzy":43},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 4 inbound Pith citation observations for arXiv:2501.11468."}