{"as_of":"2026-08-09T19:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c42af7225f5f2abacaf16da2c178efd64242000ac0bae9a2ce7458e77e3aa51","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T05:06:09.216428Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T07:20:31.305011Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27652","snapshot_observed_at":"2026-07-14T11:49:31.595873Z","title":"arXiv preprint arXiv:2606.27652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-06T10:45:46.606756Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-07-14T11:49:31.595873Z"},"links":{"cited_paper":"/paper/2606.27652","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:0b23a43039f9f75b31125b41317658a95753fafdf206428f6d74503b72d76199","observation_id":"68266c49-5a3a-4795-bd62-ebf0f98734f8","resolution":{"observed_at":"2026-07-14T11:49:31.595873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.27652","snapshot_observed_at":"2026-08-02T07:20:31.305011Z","title":"arXiv preprint arXiv:2606.27652 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10428","last_updated":"2026-07-24T14:32:58Z","snapshot_observed_at":"2026-08-06T10:45:46.606756Z","submitted_at":"2026-07-11T18:22:49Z","title":"Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-02T07:20:31.305011Z"},"links":{"cited_paper":"/paper/2606.27652","citing_paper":"/paper/2607.10428"},"observation_digest":"sha256:616c9a09ea2e2caf558e8d5397edca3ea9560764632c4e843c0a431b39941fe8","observation_id":"2bbb0d5f-756b-4635-9656-5a9a272bd2bb","resolution":{"observed_at":"2026-08-02T07:20:31.305011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.27652/citation-record","integrity":"/paper/2606.27652/integrity","json":"/paper/2606.27652/citation-record.json","paper":"/paper/2606.27652"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":"2410.21276","doi":"10.1177/15248380231178756","metadata_source":"pith","pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4o System Card","venue":"cs.CL","work_id":"f37bf1c7-4964-4e56-9762-d20da8d9009f","year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:f0ab85168044433da93f49e071ba3b291c43862312a6fa902c9d8687484fd4ce","observation_id":"9aff33c2-b51f-41bf-9184-c8dfcc767c22","resolution":{"observed_at":"2026-06-29T18:23:51.448041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":"2601.03267","doi":"10.48550/arxiv.2601.03267","metadata_source":"pith","pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"OpenAI GPT-5 System Card","venue":"cs.CL","work_id":"ca87689a-0d29-4476-b504-b65dbbb08af4","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:ebd9df20d023ee989f5802fa2e3ac5134e7db3f28e6e009b37ab0969cb9954a7","observation_id":"de2ba455-3b97-41de-a5d2-8cba257e897d","resolution":{"observed_at":"2026-06-29T18:23:51.435970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-03T00:38:11.458508+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2503.20215","doi":"10.48550/arxiv.2503.20215","metadata_source":"pith","pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-Omni Technical Report","venue":"cs.CL","work_id":"438f105c-fa9b-44aa-ad52-43acb8045cda","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:2041979393c825a52ecf6793c16291199962fdfded5730147d320c45b0e5d729","observation_id":"da7dea5b-8fed-471a-b87c-87df051a16da","resolution":{"observed_at":"2026-06-29T18:23:51.428492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:18:44.887499+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"MIT press, 2000","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:db25ccf036e548a2bee33dd017c9fba1c7a91c3110280636a54a5f4994e8df75","observation_id":"36891fd2-1076-4ede-97c3-d2a9a493e9ab","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mer 2025: When affective computing meets large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:91b5eaead5d9054e5a22b1a4d192eef99dc7c4263b2d515166af691ed2dea8bd","observation_id":"b1f64b24-c8f1-48b5-8eae-5497ddbf82cd","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T19:20:06.326002Z","title":"Multimodal large language models meet multimodal emotion recognition and reasoning: A survey","venue":null,"work_id":"a89eabef-0cd7-48f1-ac17-249d92a1a08f","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:8de97b111034c92b617d54c6fc8c3a6a4847081966bd75c4c9c34d1782688d39","observation_id":"739549d3-b542-434e-9569-12c879cf362f","resolution":{"observed_at":"2026-06-29T18:23:51.433738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mer 2023: Multi-label learning, modality robustness, and semi-supervised learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:724a708364049fa04384c626f2a225908d7938661d18827da3afe24732d895da","observation_id":"d5a39ae3-1023-44cc-9177-153db0e80cb8","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mer 2024: Semi-supervised learning, noise robustness, and open-vocabulary multimodal emotion recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:8a7bd1ac0347b9bcef63d7e92d9f18c60c423965c6465f13d71d1f871580a59e","observation_id":"149b0958-c115-4d1c-91a7-31bd1a4c22bb","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversa- tions","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:8292da395cc400fda2e780e09d5ea672a8b049af2c981e59afce5e09b7883643","observation_id":"0a3b1def-6148-4c7c-ad5d-31bcae9cf164","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Iemocap: Interactive emotional dyadic motion capture database.Language resources and evaluation, 42(4):335–359, 2008","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:6350a4d2077502def69f96ca16d7000108e869e4309b963cfeea4b83578ebaf7","observation_id":"a8e8c97f-d239-4dda-a882-8cb2735a49e5","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Affectgpt: A new dataset, model, and benchmark for emotion understanding with multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:a91442eb773aa9613a36317e900359e770d430dc2144854c6bdb59aa748d2a8e","observation_id":"89f16994-88af-47a2-b211-073f84fe5263","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Ov-mer: Towards open-vocabulary multimodal emotion recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:5fc3266493ebc87bbcfd443ec0d86ed7ba4e8d2e8b5ae5597d5a588f07b27105","observation_id":"c3fadfbc-79e2-4d54-9d54-2c3a397acb34","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Explainable multimodal emotion reasoning.CoRR, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:0eecb32e9da5a966784f95150064bb8a37de4f4aedfffa7256c1ba27cc45e7f7","observation_id":"2f6721db-461d-43d1-8c0a-5fc088aaf701","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Deepseek-r1 incentivizes reasoning in llms through reinforcement learning.Nature, 645(8081):633–638, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:0d9a4b55ace7a34c9030de5b5724baf648c854874969222c11025ed0d149fc90","observation_id":"a148fa02-2a7b-4c76-8a9c-b6148e7d5db1","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.01318","doi":"10.48550/arxiv.2508.01318","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Affectgpt-r1: Leveraging reinforcement learning for open-vocabulary multimodal emotion recognition","venue":"arXiv (Cornell University)","work_id":"5c280e1b-cbf3-4031-89e8-89c5b0f8e170","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:ef9dbfa319551403795d2162a6e1996bd11d8d0f3fa28a2b3dc932f41d7792d8","observation_id":"5641f6ad-3fb5-42ed-b9ed-ec256e5c27dc","resolution":{"observed_at":"2026-06-29T18:23:51.445768Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21277","last_updated":"2025-06-26T14:01:03Z","snapshot_observed_at":"2026-08-08T12:42:20.980285Z","submitted_at":"2025-06-26T14:01:03Z","title":"HumanOmniV2: From Understanding to Omni-Modal Reasoning with Context","version":1},"cited_work":{"arxiv_id":"2506.21277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.21277","snapshot_observed_at":"2026-07-04T19:20:06.286106Z","title":"Humanomniv2: From understanding to omni-modal reasoning with context","venue":null,"work_id":"8dd6d299-b8a6-4979-86fe-431ec0644784","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2506.21277","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:c493da0dac42fc4318e1fcabf4145eabd223ec1149ef0a6622aa18db1bedbf29","observation_id":"db441dfa-501f-404a-b6d7-55eb6216d76b","resolution":{"observed_at":"2026-06-29T18:23:51.450720Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"From system 1 to system 2: A survey of reasoning large language models.TPAMI, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:39e7a71531ec75f95400a66c83b61c4a2e3e7a428ea2542a55f5f00fd3c58d39","observation_id":"82ae2464-03d4-4626-b2e2-5586145176f3","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.17765","last_updated":"2025-09-22T13:26:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-22T13:26:24Z","title":"Qwen3-Omni Technical Report","version":1},"cited_work":{"arxiv_id":"2509.17765","doi":"10.48550/arxiv.2509.17765","metadata_source":"pith","pith_arxiv_id":"2509.17765","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-Omni Technical Report","venue":"cs.CL","work_id":"ae43e594-8bab-4471-b6af-92a300f6a048","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2509.17765","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:183c50368152e53f1d964c8dc2973da2b9c6e214c214e9f1f54c82e85e06d6fa","observation_id":"c1ffc9ea-2473-40d3-a7e7-3bcce07f176e","resolution":{"observed_at":"2026-06-29T18:23:51.438414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:66c9471a1e9c6d3dee6ce8cca0a14fd506bb4ba0c122d53ba67670141534e386","observation_id":"32e8cc38-a9dd-45db-afbd-d7a8773aa399","resolution":{"observed_at":"2026-06-29T18:23:51.440715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Visual instruction tuning.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:1227e0de429f98ce3e5bafb58a81a7f92b451d4100040978029ba21cde1d7e95","observation_id":"36323b14-11e6-4772-aa21-c36b39b7dd61","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Parallel diffusion solver via residual dirichlet policy optimization.IEEE TPAMI, pages 1–17, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:feddcc1c4fc89cb3a54cd248901a10b3ea6e9c1eb24f890b8f08b44ae4340606","observation_id":"4a50014c-ef68-4ab3-ae6c-ac2796c2a43e","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-09T01:06:58.674891Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.07365","doi":"10.48550/arxiv.2503.07365","metadata_source":"pith","pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","venue":"cs.CV","work_id":"eda3a54e-ebd6-40bd-af17-b567ea4c5d62","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:6ffba7a86ef535e8a171429515efe24d0725d2f6959ae478fb6afb9b37221a5d","observation_id":"14bfe3fd-5aa8-4dd0-98d8-9b993342d188","resolution":{"observed_at":"2026-06-29T18:23:51.426185Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Perception-aware policy optimization for multimodal reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:1bd5e43b4b4be7d975211f31b3de2b77ac51e0873c143b8ca7bcc99caa144f43","observation_id":"8450f34c-dcd4-4cb8-9822-91253341aaaa","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Visual-rft: Visual reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:fe54a198b27a011306dca1d2f1717de0104fbac201e52779ca6fb88cea0c94a6","observation_id":"45733f55-72e0-47bb-ab4a-99f6fde0ffef","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Vl- rethinker: Incentivizing self-reflection of vision-language models with reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:3ef6f447ba8461cf1903073d25952f26dec7704ad7956013c813e69abdb395eb","observation_id":"6d4eae79-72e5-409c-817b-5be5c45443ab","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.05175","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T17:40:00.895344Z","title":"Videoauto-r1: Video auto reasoning via thinking once, answering twice","venue":null,"work_id":"7a8e518d-2afc-49ca-8179-ecf520aa1753","year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:fa8b7045929d87e82dac60c06177007fb1b82c1d9b0881a04b8c731bd87f3abf","observation_id":"7fc44035-1d43-4e86-bb2d-0bd7171b9d00","resolution":{"observed_at":"2026-06-29T18:23:51.431143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning.NeurIPS, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:f7fb8aebbf227069fd08798f4aa4a1aa2b69c0cb4c1c9b79b69fcbc0b0a82336","observation_id":"264cb53c-4288-43a0-8527-c53326148bf7","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Benchmarking and bridging emotion conflicts for multimodal emotion reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:d6773603d8c819bba5083596c4cd77eb3056fda16c3020e3eb90e620e076c96d","observation_id":"d053f9a6-071c-4820-9585-8a194434da9f","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mme-emotion: A holistic evaluation benchmark for emotional intelligence in multimodal large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:421b47eab83e4008aaddd302c2cc3c9e66ed0adc9a2ed2959bbcdc2d47189c41","observation_id":"8e546f26-7de7-4ed5-9f63-2ad9a93e99a2","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05379","last_updated":"2025-03-10T07:11:14Z","snapshot_observed_at":"2026-08-07T21:57:26.595540Z","submitted_at":"2025-03-07T12:46:42Z","title":"R1-Omni: Explainable Omni-Multimodal Emotion Recognition with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2503.05379","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.05379","snapshot_observed_at":"2026-07-04T19:20:06.377429Z","title":"R1-omni: Explainable omni-multimodal emotion recognition with reinforcement learning","venue":null,"work_id":"bf1e132b-9fd3-4be1-9466-fc699b85e71a","year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2503.05379","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:a475ee855dfbc285e5dc0b82ef9116835ce54ecd46826b915cac4f3c7a32d2fd","observation_id":"086d81b5-2dc0-4052-961a-924a3405b370","resolution":{"observed_at":"2026-06-29T18:23:51.423928Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Emotion-coherent reasoning for multimodal llms via emotional rationale verifier","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:9256e0ac391d894ad80909b3f0dbb9f9a4320c95eb39246b977d9399f288ee1e","observation_id":"4b282b2f-c161-458b-9b76-c56c0e4435a5","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":"2311.07919","doi":"10.48550/arxiv.2311.07919","metadata_source":"pith","pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","venue":"eess.AS","work_id":"d3f033ac-bfa8-4143-9d0d-51f3f5bd3f0e","year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:0317bba2e2422e6f33015697562db7502a92ae657fa1e6b2b8ceee420b4239d3","observation_id":"83072bef-a268-4225-a828-3e1b98b061ed","resolution":{"observed_at":"2026-06-29T18:23:51.453211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Salmonn: Towards generic hearing abilities for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:10a1415a06840435c843021c0650726bab1bff97a0276903e7b2a5a8c06b07ee","observation_id":"0122020a-d026-48ab-8b21-2d79d000c8dc","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mvbench: A comprehensive multi-modal video understanding benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:f9cc71b6fae50b52b0b15ba08038ab0f2eb92ecb14e625b43edf7b9bd4ee90dc","observation_id":"859053f4-2207-4caf-baf0-528cce73949f","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:4f3a2ef25689a489a4a7e961c3624dae39fb6e3c5920c87eeb2069d3bd00c1f8","observation_id":"127d14ed-162b-4aa9-bb15-0ca07bac231c","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Chat-univi: Unified visual representation empowers large language models with image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:4c50110354ca561a081032ec303c3010acdec215a2791cc7b54d998a4d66ff1d","observation_id":"e11dc62f-2d2c-4f7e-b8dc-94eec586f0f6","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":"2304.14178","doi":"10.48550/arxiv.2304.14178","metadata_source":"pith","pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","venue":"cs.CL","work_id":"74a7deb6-48be-4132-9d35-882cc5870ebd","year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:1eac4cf3f3f79407eb377c507e28cd4d4022af3afe5dc1da661e9d80554d6ee4","observation_id":"143b3b6d-b76f-414e-84ef-d5e764626aae","resolution":{"observed_at":"2026-06-29T18:23:51.443168Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Pandagpt: One model to instruction-follow them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:132a6acb3cfea0567bce0d3500190cf29479747da43558ca9cc5a65f871fd514","observation_id":"2e5ccf09-1a84-4ab5-b844-cb47b6bbecfc","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:82d7a38ad45a28cbe12f6f98c2c34c388052760cca626e95ae5960b98805edc5","observation_id":"b38c01f2-033a-483f-9cdf-c17841a2db29","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Multimodal language analysis in the wild: Cmu-mosei dataset and interpretable dynamic fusion graph","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:992cb7c5aa07f908cee990ee137da81f86ce5ac19a67aa9af4839f9271d716f5","observation_id":"f93caa1b-a62c-4188-9bcf-52416996f7c9","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Ch-sims: A chinese multimodal sentiment analysis dataset with fine-grained annotation of modality","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:b9b17a0fbd91e5aab1c1e342a6738f058b19aa1fdb1d2b6a6b692750498f2591","observation_id":"01e3eb2d-5342-4afd-b2c0-e78bc5e9ccd6","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Make acoustic and visual cues matter: Ch-sims v2","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:aa1efd4f6a943b4736c0c8559e9a958e05cf1f9ed6c3de705c052899a72883cd","observation_id":"80d024b5-3ef5-4372-9754-565d282e052a","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"Unsupervised visual chain-of-thought reasoning via preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:0d612ac1c4a83f3ab40230b97a2af806eebed148647bd780bacf8a44297249f1","observation_id":"ee359edf-d1b4-4b92-be34-6913f13c6e36","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T05:06:09.216428Z","title":"I’ll tell you, it’s not easy for a woman who has divorced and is raising a child to find a partner","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-29T05:06:09.216428Z"},"links":{"citing_paper":"/paper/2606.27652"},"observation_digest":"sha256:9e7bd2eb960e202c08b4739c15f97056a308be8eea64895179a5ff776505bbb0","observation_id":"f91d2f90-53d9-4785-8c3c-dfd0ee759886","resolution":{"observed_at":"2026-06-29T05:06:09.216428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.27652","last_updated":"2026-06-26T02:07:53Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T10:45:51.342747Z","submitted_at":"2026-06-26T02:07:53Z","title":"MER-R1: Multimodal Emotion Reasoning via Slow-Fast Thinking Synergy"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":13,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2606.27652."}