{"as_of":"2026-08-15T13:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f543324e6c29c208dd517eef3001a4f0ad4ce5605470b6cf300063d9b56dde80","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T18:21:40.130112Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:26:49.097526Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.08049","snapshot_observed_at":"2026-08-04T08:26:49.097526Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.20743","last_updated":"2026-05-28T07:50:13Z","snapshot_observed_at":"2026-08-15T11:54:44.009648Z","submitted_at":"2025-10-23T17:08:03Z","title":"Empathic Prompting: Non-Verbal Context Integration for Multimodal LLM Conversations","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T08:26:49.097526Z"},"links":{"cited_paper":"/paper/2412.08049","citing_paper":"/paper/2510.20743"},"observation_digest":"sha256:a35cc390d1de79becb8170b8d1aec4a17e5f271b4903d9f5e8f4ab7a43bd5290","observation_id":"0770b773-f9f8-486f-8a63-2e77ea8dca96","resolution":{"observed_at":"2026-08-04T08:26:49.097526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.08049/citation-record","integrity":"/paper/2412.08049/integrity","json":"/paper/2412.08049/citation-record.json","paper":"/paper/2412.08049"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T18:21:39.877031Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.877031Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:fee94aba522317a0c724bc2dd8df94431191600a16b1223869e917f8644a823d","observation_id":"38cfe572-9de1-4a26-bfed-f833afb4993a","resolution":{"observed_at":"2026-08-11T18:21:39.877031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.851948Z","title":"Semi-supervised mul- timodal emotion recognition with expression mae","venue":null,"work_id":"13a7acd7-36fe-4e0d-94b6-1df7648507b2","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.894745Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:25cb56f0bcf349dee3ff6da223a846ccd9fb836b5e803d119a892bde9fa4944c","observation_id":"ad6fd5f2-348b-483b-a391-bf0c003a45e0","resolution":{"observed_at":"2026-08-11T18:21:40.856845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11161","last_updated":"2024-11-02T02:30:50Z","snapshot_observed_at":"2026-08-13T08:03:37.427944Z","submitted_at":"2024-06-17T03:01:22Z","title":"Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11161","snapshot_observed_at":"2026-08-11T18:21:39.900836Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.900836Z"},"links":{"cited_paper":"/paper/2406.11161","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:63668e0e398c9cd3430a1f231c6a68806e993860314e4fce618e7db2d9513cd5","observation_id":"1cbf995a-8d64-4d85-a7eb-727bc0427149","resolution":{"observed_at":"2026-08-11T18:21:39.900836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-08-14T16:25:22.654846Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-11T18:21:39.906511Z","title":"Videollama 2: Advancing spatial-temporal model- ing and audio understanding in video-llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.906511Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:1b07aedd5dd9b5ec950eb6459a69959eb4dde7529637535c36604e458cac1d69","observation_id":"c7af2a0a-c42c-466e-b75d-ef422d42529a","resolution":{"observed_at":"2026-08-11T18:21:39.906511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.835509Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale,","venue":null,"work_id":"76c08b84-2bde-4c99-8161-83841208d438","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.913103Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:f9e258e4ecfea4b0527c298ca28f36425cdddf7ed13871503416458264693b29","observation_id":"0b78fe39-4f5a-42d6-9d35-83871aea5406","resolution":{"observed_at":"2026-08-11T18:21:40.841153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00412","last_updated":"2021-09-16T08:32:03Z","snapshot_observed_at":"2026-08-09T19:44:37.485389Z","submitted_at":"2021-09-01T14:45:16Z","title":"Improving Multimodal Fusion with Hierarchical Mutual Information Maximization for Multimodal Sentiment Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00412","snapshot_observed_at":"2026-08-11T18:21:39.935774Z","title":"Improving multimodal fusion with hierarchical mutual in- formation maximization for multimodal sentiment analy- sis","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.935774Z"},"links":{"cited_paper":"/paper/2109.00412","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:934009bc76e1131821503a4d714367ed444064ec57679818f4a3092249952a83","observation_id":"13600439-a05d-4b2f-987f-c6fea71f90f6","resolution":{"observed_at":"2026-08-11T18:21:39.935774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:39.944300Z","title":"Misa: Modality-invariant and-specific representations for multimodal sentiment analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.944300Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:2ea4c6032f0acb45ab10df88e05bedc32723cbe1f3e876a889c5e930bae989d1","observation_id":"63ce4830-d61d-405d-a5b2-2e7622a1c93e","resolution":{"observed_at":"2026-08-11T18:21:39.944300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01978","last_updated":"2021-06-09T05:28:04Z","snapshot_observed_at":"2026-08-14T19:31:03.814739Z","submitted_at":"2021-06-03T16:47:38Z","title":"DialogueCRN: Contextual Reasoning Networks for Emotion Recognition in Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01978","snapshot_observed_at":"2026-08-11T18:21:39.960892Z","title":"Dialoguecrn: Contextual reasoning networks for emotion recognition in conversations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.960892Z"},"links":{"cited_paper":"/paper/2106.01978","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:ef51a066e4a9900ffe29a6ad08825b3d450240faa5aaba6679d69fbd5515ad49","observation_id":"4646f9c1-2410-4214-be60-911b2b7631d2","resolution":{"observed_at":"2026-08-11T18:21:39.960892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-11T18:21:39.970411Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.970411Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:92faa58fd1b72154fdce352a923424aa2c1e71d5530981f1090ed2b715cc4ff5","observation_id":"c8f09bc7-6a46-461f-99c7-de298d0f8202","resolution":{"observed_at":"2026-08-11T18:21:39.970411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06779","last_updated":"2021-07-14T15:37:02Z","snapshot_observed_at":"2026-08-14T19:30:03.656126Z","submitted_at":"2021-07-14T15:37:02Z","title":"MMGCN: Multimodal Fusion via Deep Graph Convolution Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06779","snapshot_observed_at":"2026-08-11T18:21:39.977064Z","title":"Mmgcn: Multimodal fusion via deep graph convolution network for emotion recognition in conversa- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.977064Z"},"links":{"cited_paper":"/paper/2107.06779","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:36432a939dae73fd05aa478c45d2bed649f2fd7ca31e72eeb611d65977e4ee6a","observation_id":"6ee4b11e-4ac7-4cae-a8ca-2714cf3d90d0","resolution":{"observed_at":"2026-08-11T18:21:39.977064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.778219Z","title":"Mm-dfn: Multimodal dy- namic fusion network for emotion recognition in con- versations","venue":null,"work_id":"d82b8390-0dcf-41e3-9b47-59bbbd15df0d","year":2022},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.990244Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:f226431c9f71c7eb8aef880ccbee6f77749966460cc8135ab147ca3d14cfcee0","observation_id":"8548ba0b-19cd-4b6f-9926-edaa57f94683","resolution":{"observed_at":"2026-08-11T18:21:40.783500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.761915Z","title":"Dfew: A large-scale database for recognizing dynamic facial expressions in the wild","venue":null,"work_id":"0bfff4d0-99de-41d4-95fb-594146765138","year":2020},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.001853Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:4346099c9a91995458cc9da9f856c9ef53d488b99f87232707d7ce25141d933b","observation_id":"46fe8cbc-802e-4a71-aee9-49035aa7d748","resolution":{"observed_at":"2026-08-11T18:21:40.766604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11911","last_updated":"2024-08-29T05:14:36Z","snapshot_observed_at":"2026-08-14T09:30:14.695692Z","submitted_at":"2023-09-21T09:22:07Z","title":"InstructERC: Reforming Emotion Recognition in Conversation with Multi-task Retrieval-Augmented Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11911","snapshot_observed_at":"2026-08-11T18:21:40.008378Z","title":"Instructerc: Reforming emotion recognition in conversation with a retrieval multi-task llms framework","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.008378Z"},"links":{"cited_paper":"/paper/2309.11911","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:b1f4053d4904a60025e668c2ae940e467468e3ae526e01e35ca3af85777045ac","observation_id":"84d3364f-fb6b-4ade-b9be-fc82fdf8daf4","resolution":{"observed_at":"2026-08-11T18:21:40.008378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13504","last_updated":"2022-03-25T08:42:57Z","snapshot_observed_at":"2026-08-14T19:30:31.741430Z","submitted_at":"2022-03-25T08:42:57Z","title":"EmoCaps: Emotion Capsule based Model for Conversational Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.13504","snapshot_observed_at":"2026-08-11T18:21:40.017251Z","title":"Emocaps: Emotion capsule based model for conversational emotion recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.017251Z"},"links":{"cited_paper":"/paper/2203.13504","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:bb263ddedcaa86edfaf980192c8af44a209ac591445544faa25b23097f342525","observation_id":"f29ba094-f9f0-41b5-bada-ecdee5db2065","resolution":{"observed_at":"2026-08-11T18:21:40.017251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.744826Z","title":"Explainable mul- timodal emotion recognition,","venue":null,"work_id":"c07b6c96-c85c-4f40-b0c4-4a246d5c92e6","year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.031448Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:05a798b5dd69764ae17f60b585c52e29cee0b066f66974a8ef4e092d622117b3","observation_id":"fd9823b1-df60-478f-bbc9-7b7aa1a56cfd","resolution":{"observed_at":"2026-08-11T18:21:40.751483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.036712Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.036712Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:669caca98fec7ba0a2834d42b5f8aca6a29a97cff28b6a4d368c759f7cf24e1a","observation_id":"aab7339c-115e-4cb4-a2f8-80ec527ca8e0","resolution":{"observed_at":"2026-08-11T18:21:40.036712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.047875Z","title":"Progressive modality re- inforcement for human multimodal emotion recognition from unaligned multimodal sequences","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.047875Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:4d1c6a9901bc1cc9aca0c84633fceef038a3edbda5b96f4a4842125d0e03055c","observation_id":"e7c415b4-e5f2-4904-89b9-2e90276cd614","resolution":{"observed_at":"2026-08-11T18:21:40.047875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-14T18:19:10.821318Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-11T18:21:40.053544Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.053544Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:010c9b55d6eb6d4e0ab32f08fe56554ebe1b32f8adc63b71c9f915b3a7c9f6df","observation_id":"1444384f-54c8-484c-b745-b60e68337c55","resolution":{"observed_at":"2026-08-11T18:21:40.053544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.709726Z","title":"A discourse-aware graph neural network for emotion recog- nition in multi-party conversation","venue":null,"work_id":"12d764a6-34f4-49c7-8a07-f6ebb4e40ffd","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.067954Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:928d57175a0eadad5575fc9afffdcad0edad21970a252692ae62044ca2bd1f1e","observation_id":"72734523-fcd9-4099-a78d-cbd198eff2d7","resolution":{"observed_at":"2026-08-11T18:21:40.715435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.074867Z","title":"Multimodal transformer for un- aligned multimodal language sequences","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.074867Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:44917aa62a96e475b7bf2022f5609186adfcf52e75f202747a731e503335f0f7","observation_id":"f3f173ee-91d7-47db-a27f-83203db5072d","resolution":{"observed_at":"2026-08-11T18:21:40.074867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.668300Z","title":"SemEval-2024 task 3: Multimodal emotion cause analysis in conversations","venue":null,"work_id":"64932656-fac5-481e-82f7-eddbb3b6e1da","year":2024},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.084097Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:927e7d208422f049508f3f6c0abb6ad79a9739eebd3317ccda6c8cbd093f7aa8","observation_id":"5f4cf55e-d52b-48d9-ac13-d5517cca97e5","resolution":{"observed_at":"2026-08-11T18:21:40.675015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.651866Z","title":"Confede: Contrastive feature de- composition for multimodal sentiment analysis","venue":null,"work_id":"f75be6f7-aaa5-4d7f-a4a5-64a9b7a8c666","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.091473Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:d29a733315c8a569b64d966407c1b5cca1bec51a72c7012bd559ccba5a8b7ee9","observation_id":"bdb5e7d8-6c67-443f-8fbc-bfb831e57274","resolution":{"observed_at":"2026-08-11T18:21:40.657080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.633996Z","title":"Learning modality-specific representations with self- supervised multi-task learning for multimodal sentiment analysis","venue":null,"work_id":"89b575d2-7129-4bba-8a04-16ab000bbf1d","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.097739Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:bb785f5e8f9f3ad924602feb31988b04bbea723ef9c3e24c274ca73b4e7bfbcb","observation_id":"7fb9be27-7497-445a-948e-a62133d6c9e9","resolution":{"observed_at":"2026-08-11T18:21:40.640279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15796","last_updated":"2023-06-27T20:51:03Z","snapshot_observed_at":"2026-08-14T19:30:32.640067Z","submitted_at":"2023-06-27T20:51:03Z","title":"ConKI: Contrastive Knowledge Injection for Multimodal Sentiment Analysis","version":1},"cited_work":{"arxiv_id":"2306.15796","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.15796","snapshot_observed_at":"2026-08-11T18:21:40.203198Z","title":"ConKI: Contrastive Knowledge Injection for Multimodal Sentiment Analysis","venue":"cs.AI","work_id":"795f0dd2-6f31-497f-a295-b46b687ccc16","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.104909Z"},"links":{"cited_paper":"/paper/2306.15796","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:e3f046e39bd4ccb223d18eb7cb5c7bd3de228e58949bc9740947e16d7df167e7","observation_id":"22fa6b69-d2a6-4559-97c4-8d1b672a22b7","resolution":{"observed_at":"2026-08-11T18:21:40.213308Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.111189Z","title":"Multimodal language analysis in the wild: Cmu- mosei dataset and interpretable dynamic fusion graph","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.111189Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:601ad750f284dc122fbbfbf145b1b882d35ed101278d0a78ee0e87400c962692","observation_id":"4d621abb-ab80-451c-8467-9752863ab3af","resolution":{"observed_at":"2026-08-11T18:21:40.111189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.595490Z","title":"A multitask learning model for multimodal sarcasm, sentiment and emotion recognition in conversa- tions","venue":null,"work_id":"8970aa14-211e-49d2-94ed-51f1fd3334bd","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.116921Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:1bb6e3933bc8f3febb413a4c0570194e2cc292df43768da935ca16045042063e","observation_id":"3309d835-496c-4d93-905d-9ae35c6d2b95","resolution":{"observed_at":"2026-08-11T18:21:40.601901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-02T12:24:31.329178Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-11T18:21:40.124826Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.124826Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:b8d17f12583e7ff57394c04b4d1877f7a7274c6cdd7416f02948bdeb235d6e09","observation_id":"31a005c2-9ab3-41f9-9704-da2a26c1485a","resolution":{"observed_at":"2026-08-11T18:21:40.124826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.569578Z","title":"A facial expression-aware multimodal multi- task learning framework for emotion recognition in multi- party conversations","venue":null,"work_id":"3e8433ec-c30e-414d-ba4f-1af349449215","year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.130112Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:6149201bca5f6a3436bd8f76b8aefead437c77aa75991a8b4ca21bd2f51f3319","observation_id":"f9f1515f-ce4e-4ca9-9a9e-d649395dfb71","resolution":{"observed_at":"2026-08-11T18:21:40.577739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2105.12907","last_updated":"2021-09-16T02:22:09Z","snapshot_observed_at":"2026-08-14T19:31:04.818763Z","submitted_at":"2021-05-27T01:51:37Z","title":"Directed Acyclic Graph Network for Conversational Emotion Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.12907","snapshot_observed_at":"2026-08-11T18:21:40.061006Z","title":"Directed acyclic graph network for conversational emotion recognition","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:40.061006Z"},"links":{"cited_paper":"/paper/2105.12907","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:22f4943cbc23720f08d3957147ff9327d1573da544d15ce12a16462472b23f53","observation_id":"4df90b3c-8f35-4f47-b85a-3bbdafb567b0","resolution":{"observed_at":"2026-08-11T18:21:40.061006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.817748Z","title":"Bi-bimodal modality fusion for correlation-controlled multimodal sentiment analysis","venue":null,"work_id":"51b25ff8-6a50-483e-9a1a-8af54d2b5826","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.929705Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:9f1ea96aca877a22831e8cee00dc4e5e52b064f3c3c8ec5c1c22f138c45ea3fc","observation_id":"be1debd5-d809-40d3-ae3a-f8ebf9f8cfb2","resolution":{"observed_at":"2026-08-11T18:21:40.824020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T18:21:40.793023Z","title":"Hubert: Self- supervised speech representation learning by masked pre- diction of hidden units","venue":null,"work_id":"cfd68c57-c71e-4bbe-af74-9cae592bb130","year":2021},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.951671Z"},"links":{"citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:fce06bd7c20e5efb34de69a9e6d10489202934d1a436b09191bcc7fd4463b163","observation_id":"91e507e8-8cc7-41c2-92a5-72d86bb8a72d","resolution":{"observed_at":"2026-08-11T18:21:40.797771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11540","last_updated":"2019-08-30T05:44:24Z","snapshot_observed_at":"2026-08-14T14:29:23.428736Z","submitted_at":"2019-08-30T05:44:24Z","title":"DialogueGCN: A Graph Convolutional Neural Network for Emotion Recognition in Conversation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.11540","snapshot_observed_at":"2026-08-11T18:21:39.924087Z","title":"Dialoguegcn: A graph convolutional neural network for emotion recognition in conversation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.924087Z"},"links":{"cited_paper":"/paper/1908.11540","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:d545ec2e3fd5bdd0a3a6b1536d3e8627da684264d82dc9de34f2c4dde5bc1700","observation_id":"37ab2d83-624c-47cc-9c87-69ac303faf45","resolution":{"observed_at":"2026-08-11T18:21:39.924087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.11256","last_updated":"2022-11-21T08:46:01Z","snapshot_observed_at":"2026-08-14T19:31:06.607382Z","submitted_at":"2022-11-21T08:46:01Z","title":"UniMSE: Towards Unified Multimodal Sentiment Analysis and Emotion Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11256","snapshot_observed_at":"2026-08-11T18:21:39.994601Z","title":"Unimse: Towards unified multimodal sentiment analysis and emo- tion recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.994601Z"},"links":{"cited_paper":"/paper/2211.11256","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:a97020aa3abe4be7e6d0c5a1779fcb9db22364761cf59c3ad15d52023dd38352","observation_id":"30395d18-969e-4706-942a-949d16027849","resolution":{"observed_at":"2026-08-11T18:21:39.994601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-11T18:21:39.888754Z","title":"How far are we to gpt-4v? closing the gap to commercial mul- timodal models with open-source suites","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.888754Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:ea02b467f3574eb86f7fcc4e773b81a1671c438b34d076349146eaeb82783dc0","observation_id":"ea631df8-e4ad-4d4f-89bd-cdf051da4453","resolution":{"observed_at":"2026-08-11T18:21:39.888754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T18:21:39.882645Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-11T18:21:39.882645Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.08049"},"observation_digest":"sha256:999f992a5b8dcc8e18e7135f0055a300d486571a675ac09c1039f94db8e4f459","observation_id":"39ffd1b8-6266-4116-a151-0f461cff5335","resolution":{"observed_at":"2026-08-11T18:21:39.882645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.08049","last_updated":"2025-03-31T07:15:17Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-13T18:18:48.484103Z","submitted_at":"2024-12-11T02:55:00Z","title":"EmoVerse: Exploring Multimodal Large Language Models for Sentiment and Emotion Understanding"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":13},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 1 inbound Pith citation observation for arXiv:2412.08049."}