{"as_of":"2026-08-14T13:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f971a48fc6d8df6aa1f8dc2878978ce29afedecc3d369cb9977f2207ce936e15","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:13:08.107303Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.16859/citation-record","integrity":"/paper/2508.16859/integrity","json":"/paper/2508.16859/citation-record.json","paper":"/paper/2508.16859"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.399227Z","title":null,"venue":null,"work_id":"92e4a469-30e9-4b1a-93f6-38cecf2a71ba","year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.519731Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:a57b7599829da7ad2c4080aefd0bc19eddec227298b18f1ffa2f6961530efc99","observation_id":"e75e522c-c8c2-4c84-b273-6da53fb2f435","resolution":{"observed_at":"2026-08-05T17:13:09.405146Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-05T17:13:05.587946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.587946Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7c7902d51dd28f3fa39712e5c047cb270994d54443a902c3f2cb00b2ddb3d708","observation_id":"732e1f94-5e98-47cc-bc01-bbc20db84576","resolution":{"observed_at":"2026-08-05T17:13:05.587946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:05.677868Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.677868Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:da94131d584e72d5749c89fea8b7b5de8cc11e709890a6da9fc0eb58e32861e1","observation_id":"4dda1526-ef3b-402d-807b-5b0c46585244","resolution":{"observed_at":"2026-08-05T17:13:05.677868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.372665Z","title":null,"venue":null,"work_id":"7bbede0f-fce1-449c-ab2d-66812937ea89","year":2008},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.847913Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:5c971a36478fee81b6612d0eaa81ee198d2865fc022708928614b21cc8f116dc","observation_id":"c14a31b1-1777-4449-b8c5-8be6b6a481cd","resolution":{"observed_at":"2026-08-05T17:13:09.376845Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04325","last_updated":"2024-06-06T17:58:54Z","snapshot_observed_at":"2026-08-12T23:48:30.486852Z","submitted_at":"2024-06-06T17:58:54Z","title":"ShareGPT4Video: Improving Video Understanding and Generation with Better Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04325","snapshot_observed_at":"2026-08-05T17:13:05.984791Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:05.984791Z"},"links":{"cited_paper":"/paper/2406.04325","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:084f530d152f5e01911212041fe3c820ae8e1a4720cb56e5d562c041e5227946","observation_id":"ea14db05-ebb2-4935-96bc-d8559c0b8a65","resolution":{"observed_at":"2026-08-05T17:13:05.984791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11161","last_updated":"2024-11-02T02:30:50Z","snapshot_observed_at":"2026-08-13T08:03:37.427944Z","submitted_at":"2024-06-17T03:01:22Z","title":"Emotion-LLaMA: Multimodal Emotion Recognition and Reasoning with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11161","snapshot_observed_at":"2026-08-05T17:13:06.075857Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.075857Z"},"links":{"cited_paper":"/paper/2406.11161","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:e77e4aae3abce2456fa2860548e71b9faef7d3b4a2e734080c532024ac984026","observation_id":"7d1d0059-2042-4cb1-a8b4-f272ef124b2b","resolution":{"observed_at":"2026-08-05T17:13:06.075857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-05T17:13:06.159347Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.159347Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:90a0ed1f7d09d455d7bedbbe9762d11844a2621e45a7012ed243ce706fc4305b","observation_id":"3fb0cb53-2ed0-415a-aa46-bd73c21f8650","resolution":{"observed_at":"2026-08-05T17:13:06.159347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:06.249665Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.249665Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:235a3cb49b40124e533b88b948450b16b2aa76c94f66161b52d3a0c2071bd2aa","observation_id":"389c554b-6ab4-480a-b2d1-a12f5e6c38ec","resolution":{"observed_at":"2026-08-05T17:13:06.249665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.343201Z","title":null,"venue":null,"work_id":"7cfb9ccf-d0e1-4260-85a7-20b5c3c7302a","year":2015},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.339759Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:16b8ea003fd1b5ee5b54a2430da09d9065b3f1739119815a1d76320e9f6cf777","observation_id":"834c21b6-ab2e-4bd9-af3e-f62c90727602","resolution":{"observed_at":"2026-08-05T17:13:09.349201Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15425","last_updated":"2022-11-20T14:43:36Z","snapshot_observed_at":"2026-08-13T13:38:50.905977Z","submitted_at":"2022-11-20T14:43:36Z","title":"FAF: A novel multimodal emotion recognition approach integrating face, body and text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15425","snapshot_observed_at":"2026-08-05T17:13:06.434869Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.434869Z"},"links":{"cited_paper":"/paper/2211.15425","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ed1a0b30a831912783c540565f5ca50d5a34b179ce7eff6bb416e2372782201e","observation_id":"9423a914-4a6d-4979-b516-5f7de9fdf164","resolution":{"observed_at":"2026-08-05T17:13:06.434869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.321279Z","title":null,"venue":null,"work_id":"019e085e-ce68-4edd-8de0-13b3ea0822b2","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.518257Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:48e87e8f04ff864744355a9bebbf590a7096194875865b184e4a48c398a34aa7","observation_id":"7526809b-5f9a-4e0e-951a-96f68c70e254","resolution":{"observed_at":"2026-08-05T17:13:09.326489Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:06.604599Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.604599Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ca97bbc205e3c57e86efec6e82afd1a108fd6ed717f446f83cfa461889a06156","observation_id":"cd084c4b-d8e8-49fe-9c16-a237190f0a39","resolution":{"observed_at":"2026-08-05T17:13:06.604599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.275086Z","title":null,"venue":null,"work_id":"5076e27d-de9d-4d33-b587-a137dd126cb3","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.790027Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:3605a90f43e07e755d4a0444784b5e308a2da9bcbafe8c8e4a58f0923dc6d57e","observation_id":"e8092681-94dc-40b0-8456-ce6400790b09","resolution":{"observed_at":"2026-08-05T17:13:09.279266Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.261406Z","title":null,"venue":null,"work_id":"f08067c7-70cd-4016-bc79-e76dda4088e2","year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.897082Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:0b92a9d74c1342b6bfbfb6389d5a553644d8a5c3898ada684b8bcebefaa7e113","observation_id":"e1f913b8-5ff0-4683-9cb7-5082f7a26c48","resolution":{"observed_at":"2026-08-05T17:13:09.265217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.248357Z","title":null,"venue":null,"work_id":"eff2607d-f05e-402c-acd3-0880d4b59a82","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.979671Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:556f00c9c85e766e8a8e2a9862ea065db4eecf63621694710139ee86878a8879","observation_id":"48e4de2f-2bac-468e-b87f-b901afcbe757","resolution":{"observed_at":"2026-08-05T17:13:09.252376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.223882Z","title":null,"venue":null,"work_id":"243d4105-e782-4019-9d3d-e2cbcf7378e5","year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.148606Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:4542af0c875d32cabaf814b97bf2fa3bc6270beacfe3f001337d48d1ce6a9b55","observation_id":"57a4fba6-d9f5-4bc1-b7e8-c569f7a54ef6","resolution":{"observed_at":"2026-08-05T17:13:09.228001Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-05T17:13:07.219278Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.219278Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6b86369bc685fc4e2cb62de53b60620d0f13aaabd77dfa3537946aeb962bd274","observation_id":"97f4482b-5d9d-4a45-a65e-b6bb2c3bb729","resolution":{"observed_at":"2026-08-05T17:13:07.219278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.338230Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.338230Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:eb83bfce8cc84d7938ee053e952dd9cbc8dca35d7d4f519197619f2bb5879f52","observation_id":"b75ecfab-c9bb-4931-b3dc-f3a637a9883b","resolution":{"observed_at":"2026-08-05T17:13:07.338230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.201295Z","title":null,"venue":null,"work_id":"3437bfb7-d409-48e3-bf5e-001cfa7cd0d2","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.427655Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6741ddd759445762217850d4ebecd2dadf9fdf896b3743769da6de33aef7720c","observation_id":"5b542ac3-282c-4872-84e4-c8b7310b6dbc","resolution":{"observed_at":"2026-08-05T17:13:09.205438Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.180992Z","title":null,"venue":null,"work_id":"e3fd4004-77d1-4d19-bbc8-ac0f8e32bf5c","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.519452Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:e76d4a7b792630f871aba725eb1e3456c7269e86e2280acfcecf571f49953892","observation_id":"4c5aefc1-623a-4970-a569-9fe9be5a3258","resolution":{"observed_at":"2026-08-05T17:13:09.185959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-05T17:13:07.599560Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.599560Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:448156c60b308598b8a7252e5cd5464da13848fbc954a98b649bc128bdc86ae6","observation_id":"15ecf628-7c09-4a99-a955-bc2e90e71ac8","resolution":{"observed_at":"2026-08-05T17:13:07.599560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06355","snapshot_observed_at":"2026-08-05T17:13:07.701705Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.701705Z"},"links":{"cited_paper":"/paper/2305.06355","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7f2d8b75e2de40df578b7806e364485005c60161cb4eaa3b48a418539b73b99e","observation_id":"844db2a6-5923-467f-8af6-5b798541e1dd","resolution":{"observed_at":"2026-08-05T17:13:07.701705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01552","last_updated":"2024-09-03T02:42:39Z","snapshot_observed_at":"2026-08-14T10:27:25.175382Z","submitted_at":"2024-09-03T02:42:39Z","title":"Self-Instructed Derived Prompt Generation Meets In-Context Learning: Unlocking New Potential of Black-Box LLMs","version":1},"cited_work":{"arxiv_id":"2409.01552","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.01552","snapshot_observed_at":"2026-08-05T17:13:08.689835Z","title":"Self-Instructed Derived Prompt Generation Meets In-Context Learning: Unlocking New Potential of Black-Box LLMs","venue":"cs.CL","work_id":"409544f7-6080-48fd-8d6e-67668de8a8f2","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.786044Z"},"links":{"cited_paper":"/paper/2409.01552","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:786663bc1a83d71455d660c7e1d553ff04868502b93cb2176e43bb7d34638d7b","observation_id":"3434fa3a-3bf1-427a-8c51-5f56facb69cc","resolution":{"observed_at":"2026-08-05T17:13:08.747954Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2503.02359","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.432155Z","title":null,"venue":null,"work_id":"36498013-2cf4-4337-8090-19e84a4d63f4","year":2025},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.871461Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:1fa54f666e19fc29b0ae18bc71da5d40a05268c9384a5abe6bd04fc5dd573c63","observation_id":"23f79d68-a403-4e9c-8294-634ec395614a","resolution":{"observed_at":"2026-08-05T17:13:08.570440Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.167411Z","title":null,"venue":null,"work_id":"e555fc7f-1dd4-455a-92ae-a90b1b82bd88","year":2025},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.948496Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:eb48f456eef56480448bebbb2ecc2c6f7d751b440af896a8702dd5457a584712","observation_id":"67d925de-95e6-45a5-9545-3177c2eea541","resolution":{"observed_at":"2026-08-05T17:13:09.171211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-05T17:13:07.952264Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.952264Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:3c012e0b3e1b7869245ac8e352d9a842ac57f89d5be26c063422e65e0b65ce51","observation_id":"51be394a-5e20-43b7-b812-11292e92281f","resolution":{"observed_at":"2026-08-05T17:13:07.952264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.156003Z","title":null,"venue":null,"work_id":"a1466e56-0363-4cdc-ab22-ec697ef3e782","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.955910Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:77cc4bc1166d2f50e564d5e1acc53eb4a1cbc5106d13b873a2afea44ea7e798e","observation_id":"1f9b4e37-a444-4bba-acd3-a1446d479532","resolution":{"observed_at":"2026-08-05T17:13:09.159587Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.142837Z","title":null,"venue":null,"work_id":"9837a7a2-1013-4650-a6f3-e7d3f9148086","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.959404Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:8ebe12d88be2e40ea91029fe69870e50885d3a9417c4ccd9affc13968463251b","observation_id":"88489a0b-8494-45e7-aacf-66cd7114ca4e","resolution":{"observed_at":"2026-08-05T17:13:09.146731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.132246Z","title":null,"venue":null,"work_id":"789c6575-d312-40c4-9fb1-898e8c01837c","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.962699Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:22448a9dfe2d6d5f0958717495da04f482d5b1674a86e22039dc2007ca0c6fda","observation_id":"79c268f5-c947-4a8e-8f28-7abb20b5a7ef","resolution":{"observed_at":"2026-08-05T17:13:09.135759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.970121Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.970121Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:adc9862dcbf4513e741204120ca665ba1c9bb113701b9468f7f989eb6f0fa820","observation_id":"b32b4851-901d-4c58-9ae7-bbab845eeaf3","resolution":{"observed_at":"2026-08-05T17:13:07.970121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.112363Z","title":null,"venue":null,"work_id":"91ec0b0a-8fed-4cf9-8e5b-74882cf02001","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.977741Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:22b0c19c6b38d853e1a4bf2543a4cd9771fcb971a8c0953f6ffc723bea941bdd","observation_id":"45cc20b3-ad38-427a-a114-974f9ab5345f","resolution":{"observed_at":"2026-08-05T17:13:09.115577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.101356Z","title":null,"venue":null,"work_id":"d9bc0578-3860-4c55-a259-b9e7ffb8b0f5","year":2011},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.981524Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:602b42cd770c7fd704ce69ae584587b3f45417b87f28312aedab5bce6859b56c","observation_id":"464776f6-f0ba-4b44-822c-6e8ed17e1785","resolution":{"observed_at":"2026-08-05T17:13:09.105075Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.089890Z","title":null,"venue":null,"work_id":"d9e78b7a-ee75-4ad3-9072-f198e17f66d6","year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.984928Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7303f6a1619ae63c0f0968def52ffc69c2cb11ff8da944aa23414e97c45cb2bf","observation_id":"cc12e840-1167-461f-8104-8d71b4769d88","resolution":{"observed_at":"2026-08-05T17:13:09.093858Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.079301Z","title":null,"venue":null,"work_id":"ccb406a1-4c30-43e2-9cd8-4bfe084119e3","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.988284Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:a70904b2556fd08b2e28cf1bbc6c5fc14730a74fd3a22294922eed99faeef0d9","observation_id":"8057417f-4cb4-417b-b978-e8b9406bddae","resolution":{"observed_at":"2026-08-05T17:13:09.082632Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.068385Z","title":null,"venue":null,"work_id":"05cd8fe4-4d6e-4172-9081-201b15d93742","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.991584Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:44361d72bf3220d017425ae450aacce2b4190c53ea44bec0b0316cb1f01c93bc","observation_id":"1a4ea820-0336-4651-aa1f-c3cf0880eb1c","resolution":{"observed_at":"2026-08-05T17:13:09.072023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:07.994833Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.994833Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:e9aede6e41f4a1a66a2394c8debf9dd199ec883b29299939dcd86a3249dad9f3","observation_id":"6203de18-52cb-4342-baa2-eae99658d5c9","resolution":{"observed_at":"2026-08-05T17:13:07.994833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00207","last_updated":"2019-08-28T21:35:38Z","snapshot_observed_at":"2026-08-13T06:34:44.774800Z","submitted_at":"2018-11-01T03:43:10Z","title":"Towards Empathetic Open-domain Conversation Models: a New Benchmark and Dataset","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00207","snapshot_observed_at":"2026-08-05T17:13:07.998728Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.998728Z"},"links":{"cited_paper":"/paper/1811.00207","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:bc4291e50cb63a3524fe142c9322e5f70b8e0c70bcd030de2bd1981ad5c2f7ae","observation_id":"ef128d14-1823-4700-947e-10af4ba3c72b","resolution":{"observed_at":"2026-08-05T17:13:07.998728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.049492Z","title":null,"venue":null,"work_id":"0061bc82-9618-4070-95ec-001132c32fd8","year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.002278Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:3101ca04e3c4270d748ad4eb5c2323f95a406fb69bb220c8a42917c9a1c57a54","observation_id":"c5b3dbd4-ba0b-44f1-a8d1-1735c0c5e73e","resolution":{"observed_at":"2026-08-05T17:13:09.053002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.037357Z","title":null,"venue":null,"work_id":"31b6a1aa-d6a2-4ae6-b1f7-792bafdeaa67","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.014833Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6af6af6a01c101a0dcf5d14de7690e7bf501525b2bf0de0ac1727a41d0a3b3ab","observation_id":"6dbf51d2-2898-4f35-a9dd-aab0055580c5","resolution":{"observed_at":"2026-08-05T17:13:09.040652Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.025658Z","title":null,"venue":null,"work_id":"ca867295-0d83-4d9b-88b4-324962e5b6d3","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.019187Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:2605892e31db36e3a57e6e89ab7bb5afeaf735d869aa26311e706c6c2a968708","observation_id":"a2579fbc-4067-465d-a20e-425d7bc0a2b8","resolution":{"observed_at":"2026-08-05T17:13:09.029401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.012928Z","title":null,"venue":null,"work_id":"494d080f-f1bb-43fa-a1a6-b45bcfc4e033","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.022904Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:ce0a0c841cbd72be45971743d9777ea94f222e7c10d86f8157ee548271999ae0","observation_id":"8e2492ce-5b92-4203-bcce-390043777933","resolution":{"observed_at":"2026-08-05T17:13:09.016573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.990113Z","title":null,"venue":null,"work_id":"245526f0-cb1b-4232-b151-bdf1749a047b","year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.030614Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:8ca072719f880de1a43054627f99e33833bcf319dfa5654c50cec7212e4bf33c","observation_id":"69ef2ebd-6923-438e-b005-31d07e57836a","resolution":{"observed_at":"2026-08-05T17:13:08.993683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T17:13:08.034197Z","title":"Jinpeng Hu et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.034197Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:512c5b81e5942a10682a83dfcadff13a0809dd36bae30dd9447556cd7e49e296","observation_id":"933620c3-3c5d-4885-90e7-20d725a97951","resolution":{"observed_at":"2026-08-05T17:13:08.034197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.00133","last_updated":"2019-10-31T22:28:45Z","snapshot_observed_at":"2026-07-06T08:33:58.970043Z","submitted_at":"2019-10-31T22:28:45Z","title":"Dreaddit: A Reddit Dataset for Stress Analysis in Social Media","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.00133","snapshot_observed_at":"2026-08-05T17:13:08.038353Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.038353Z"},"links":{"cited_paper":"/paper/1911.00133","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:376084277d2c3e6cef491d4eeb811ba5499fbd3390b8f518d56fc430e128a153","observation_id":"c42a1013-1461-4778-8c06-b7edbd901303","resolution":{"observed_at":"2026-08-05T17:13:08.038353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.041586Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.041586Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:61215517eb5d8b7e7559d66267f4d59caea7e3952f4542bdd9f1dfa977beeb18","observation_id":"60c8ae63-b1f4-4588-a9fd-9dc9c944d0aa","resolution":{"observed_at":"2026-08-05T17:13:08.041586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.000807Z","title":"In Proceedings of the 31st ACM International Conference on Multimedia","venue":null,"work_id":"000498db-7d5b-43cf-925e-1446f97c39f5","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.027117Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:0002e883408e43764f4cd2f286be3fc08cc7ec09d5dda94ad1513e6c7fc48dc5","observation_id":"0b254268-ea50-47fc-bf5e-de1358a07982","resolution":{"observed_at":"2026-08-05T17:13:09.005138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-05T17:13:08.048793Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.048793Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:f2647d726654628b912347638b9231ffef88c34672f1eeb8702e67089875f67f","observation_id":"d20a879f-66e9-4036-854f-3cb5dc989c1f","resolution":{"observed_at":"2026-08-05T17:13:08.048793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.052613Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.052613Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:43c6651a97886622dada52c38e490ffd774974f5ce71972c2f80767a61d6433c","observation_id":"4aa04bef-7909-4aaa-ad1f-f75aca149122","resolution":{"observed_at":"2026-08-05T17:13:08.052613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.964807Z","title":null,"venue":null,"work_id":"bcd96e3f-634b-45f4-bd06-139134d0e639","year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.055975Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:0dcfb89c190299ff07e3599016285ff27ff782267c003ae38fa1f69b99cdaeac","observation_id":"464434eb-7fa3-49aa-b92f-2a814862bdee","resolution":{"observed_at":"2026-08-05T17:13:08.968568Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.954214Z","title":null,"venue":null,"work_id":"aa7e6b15-7336-46c0-a4fd-857ed3273320","year":2013},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.059516Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:7a574cd608512db25cb4aca31e06199a4d36c730d1745e4c9e1a7958cdb1c36c","observation_id":"7a3ec6cb-c905-462f-b18b-effbf3b92f70","resolution":{"observed_at":"2026-08-05T17:13:08.957414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T17:13:08.045053Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.045053Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:d92afa2c1f712a27a03ec2f70aed08e21a230bc2c51b0c85e57b01746272ef86","observation_id":"ff766519-ef13-4409-af69-1826248e572a","resolution":{"observed_at":"2026-08-05T17:13:08.045053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.932156Z","title":null,"venue":null,"work_id":"e49059b1-3e52-4715-b2b7-2242a40040b3","year":2022},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.066051Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:cf466d865619b2b0290d6035aa4bf63b1715f5029560889b4568078836aa2013","observation_id":"9c931404-c032-46f4-9a90-45c50b555780","resolution":{"observed_at":"2026-08-05T17:13:08.935957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-08-13T02:06:18.586697Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-05T17:13:08.069316Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.069316Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:be62fdcdfa96406b8991f8877a18d0915ac24bc9e8a60241283c1c19d4b21e7c","observation_id":"c1f4f801-25f5-4f0f-8122-70e9ec01d806","resolution":{"observed_at":"2026-08-05T17:13:08.069316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.919417Z","title":null,"venue":null,"work_id":"c345bbc2-0fac-492d-85e9-e22e6d6dadfa","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.073087Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:c966c6ff7b8dcff0d7eac6ede7a20e2afac88d520052970c9f358b962e7bae9f","observation_id":"e703e0a0-531b-4e15-b59f-fd672a714cb3","resolution":{"observed_at":"2026-08-05T17:13:08.924061Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16375","last_updated":"2025-01-20T00:29:19Z","snapshot_observed_at":"2026-08-13T00:22:32.993708Z","submitted_at":"2024-04-25T07:29:17Z","title":"List Items One by One: A New Data Source and Learning Paradigm for Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16375","snapshot_observed_at":"2026-08-05T17:13:08.076343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.076343Z"},"links":{"cited_paper":"/paper/2404.16375","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:8a2506b7f005b9c64c33cc26f65fc0836038f3d1b98ed828de2513c844fb8a9a","observation_id":"3da926a6-f313-47a3-954a-cc2967c60026","resolution":{"observed_at":"2026-08-05T17:13:08.076343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.943762Z","title":null,"venue":null,"work_id":"d8686491-2939-4bfb-a1a1-0f2c92b1c88f","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.062675Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:be61df521401d84642189204566f4321950af866a09960965df8544bff4325ef","observation_id":"0c570132-11ab-4664-9948-e5438ded5133","resolution":{"observed_at":"2026-08-05T17:13:08.946855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.897008Z","title":null,"venue":null,"work_id":"c67965b5-935d-4abc-adff-47be306d55fc","year":2020},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.082963Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:f26c2a9fac0b082b46da24153097436714fea6c23eca38fa8912fa796f38f799","observation_id":"3834ffb0-2b29-4314-912b-e2360205980b","resolution":{"observed_at":"2026-08-05T17:13:08.900285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.886427Z","title":null,"venue":null,"work_id":"977816c3-3816-429e-b6a7-3bcd2d040f55","year":2019},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.086241Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:117d507f31a2c34602c0dfc9de1f6152a2c36a5d39d31afc260efa15173ca898","observation_id":"af1430fc-e2dc-4821-89de-36a1c1cbbe52","resolution":{"observed_at":"2026-08-05T17:13:08.889585Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.875331Z","title":null,"venue":null,"work_id":"751e26a2-f63a-4940-a3e9-cb3d3e6e11e9","year":2016},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.089463Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:c93a3a6044367a55737b31df5c1f9557be6c32e418a8b32eb26af120c9144216","observation_id":"5d958a74-4b47-4aa4-8f54-8267591a0503","resolution":{"observed_at":"2026-08-05T17:13:08.878670Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.864763Z","title":null,"venue":null,"work_id":"ba283c03-6ac3-45b4-97a3-1210b449ec17","year":2018},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.092588Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:dc74d02e169943b5aa20788314ac7feb6d7d115b47c4b43c14f1eff63f89a251","observation_id":"0aba231a-144f-407d-8d7b-9f3456e91678","resolution":{"observed_at":"2026-08-05T17:13:08.868168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.908022Z","title":"Chi, and Denny Zhou","venue":null,"work_id":"d379fb22-22a2-4744-a3cb-3fcb61496ba8","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.079745Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:68f6a48452652aab8d2d2fa1ce0f3fb475f2b619363932ec284db4ec0975a575","observation_id":"19f7ab63-4b55-4b6b-af22-c367e428befe","resolution":{"observed_at":"2026-08-05T17:13:08.911889Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-13T10:59:39.237521Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-05T17:13:08.100077Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.100077Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:d5190eb7de3f2c98639d051370a992eeec359d8f388e0d706214fb1b1c84ec79","observation_id":"5d3013a8-c5cd-43e0-bdfe-d4519226568b","resolution":{"observed_at":"2026-08-05T17:13:08.100077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:08.853627Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":"33fa6337-ea7a-405c-a622-337ea90e8720","year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.103403Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:534391f5a9e8c71a530d274dcf3e2a6e86c2b1a768132ba2b5e178d228cf2238","observation_id":"d001ec0d-55c6-4356-9c3b-c26b15920aab","resolution":{"observed_at":"2026-08-05T17:13:08.856822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T17:13:08.107303Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.107303Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:b85a9d77ce3cfcb0a9a9dbaa64969332dc29df38e27ace62e7ced3f3bbdd0813","observation_id":"92786083-b1d7-4def-9f9e-5fb5b8a4b82e","resolution":{"observed_at":"2026-08-05T17:13:08.107303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-05T17:13:08.096024Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:08.096024Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:55c5282e263f9dc659765f8a8539ba3b9ee52b3e15e8297974e78c73cda747ed","observation_id":"9f7999db-19ce-4621-af6c-b8935cf10a27","resolution":{"observed_at":"2026-08-05T17:13:08.096024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.289582Z","title":null,"venue":null,"work_id":"25f4244b-7d9c-47c7-a551-f43c4629fd16","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:06.704956Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:a49720af8a8dc356166e0f60c4d344c32810c969bbe43180ba1dc074f3fee273","observation_id":"1338ecd0-323a-4b3a-b8bb-c9686f3352af","resolution":{"observed_at":"2026-08-05T17:13:09.294435Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T17:13:09.235910Z","title":"In Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":"abd88e80-80ad-497b-aa3b-57510fc2ed10","year":null},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.063714Z"},"links":{"citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:6d69423ba08e06f0b3c1139f385b5b26c7fe6f14d052d188ee244432380cee85","observation_id":"ec614a4a-9aeb-4948-a5ad-cb5d55c26644","resolution":{"observed_at":"2026-08-05T17:13:09.239747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05424","last_updated":"2024-06-10T01:36:53Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"Video-ChatGPT: Towards Detailed Video Understanding via Large Vision and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05424","snapshot_observed_at":"2026-08-05T17:13:07.973742Z","title":"arXiv preprint arXiv:2306.05424 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.973742Z"},"links":{"cited_paper":"/paper/2306.05424","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:b0bff0758425e12136be30ce5aef8ccf327eca0ffe68496eeff289708ac1d4aa","observation_id":"bbe44f30-f85c-43b2-ae98-ddd6a875e668","resolution":{"observed_at":"2026-08-05T17:13:07.973742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-12T22:41:32.229292Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-05T17:13:07.966651Z","title":"arXiv preprint arXiv:2409.12961 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:07.966651Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2508.16859"},"observation_digest":"sha256:5e3c9c373020ef2e49a04e77639a36355b6372b918fd59c4d0ce1b3cd3417394","observation_id":"658ce853-647e-4c11-9558-ed2cef15393e","resolution":{"observed_at":"2026-08-05T17:13:07.966651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.16859","last_updated":"2025-08-23T01:10:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T00:37:54.667584Z","submitted_at":"2025-08-23T01:10:29Z","title":"Beyond Emotion Recognition: A Multi-Turn Multimodal Emotion Understanding and Reasoning Benchmark"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":63,"verified_exact":2,"verified_fuzzy":4},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2508.16859."}