{"as_of":"2026-08-09T19:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:feccae2a701c9baf95cc1ece6d40afb658be1537f077b9edb522c6088fe642f9","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:06:50.337605Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:56:58.344964Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.07355","snapshot_observed_at":"2026-08-03T00:56:58.344964Z","title":"Perez, E., Strub, F., De Vries, H., Dumoulin, V ., and Courville, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11065","last_updated":"2026-05-28T11:37:06Z","snapshot_observed_at":"2026-08-07T11:50:35.561029Z","submitted_at":"2026-02-11T17:32:52Z","title":"S-MARC: Causal Streaming Reasoning for Full-Duplex Conversational Behavior Modeling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T00:56:58.344964Z"},"links":{"cited_paper":"/paper/2510.07355","citing_paper":"/paper/2602.11065"},"observation_digest":"sha256:fac3b065f3b346f8bdc9d6341c86f6d246900a86ba5889247824dec8d52e2f6b","observation_id":"4bbd6493-6c83-43e5-9f56-dba555af0d74","resolution":{"observed_at":"2026-08-03T00:56:58.344964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.07355/citation-record","integrity":"/paper/2510.07355/integrity","json":"/paper/2510.07355/citation-record.json","paper":"/paper/2510.07355"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:43.632154Z","title":"Emotional communication in speech and music: The role of melodic and rhythmic contrasts,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:43.632154Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:bfe1d3d6ee5a657a4308f87daf63f19eeefaff987450f1003f8d8d5dac472f31","observation_id":"8b51d3a7-2e73-4cf8-bf6d-d8a2ba21af06","resolution":{"observed_at":"2026-08-04T11:06:43.632154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:43.675176Z","title":"Effects of variation in emotional tone of voice on speech perception,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:43.675176Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:744287571d03da1104c6702bcdc4dd689e5f999ffcab7411b7fb0fb40a286416","observation_id":"6d4917ed-eef9-49dc-b21f-0e0d0879834c","resolution":{"observed_at":"2026-08-04T11:06:43.675176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:43.765144Z","title":"Analysis of emotion recognition using facial ex- pressions, speech and multimodal information,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:43.765144Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:e32080dc0d852adc75bab14756350ca37a4c4a6b7322708816006b6dafbe3b57","observation_id":"56007e68-f4c7-4b26-8fd2-92161abff7f0","resolution":{"observed_at":"2026-08-04T11:06:43.765144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:43.901861Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:43.901861Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:cdcfc882fe37910287abf44fb8791ce2e04d8daab379621e76bcd54accc389e3","observation_id":"50d76174-2266-43d9-a942-edcaf98c9b63","resolution":{"observed_at":"2026-08-04T11:06:43.901861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06666","last_updated":"2025-03-01T12:59:49Z","snapshot_observed_at":"2026-07-06T19:13:20.458958Z","submitted_at":"2024-09-10T17:34:34Z","title":"LLaMA-Omni: Seamless Speech Interaction with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06666","snapshot_observed_at":"2026-08-04T11:06:44.086529Z","title":"Llama-omni: Seamless speech interaction with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.086529Z"},"links":{"cited_paper":"/paper/2409.06666","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:2c782034e649d9f4bde762bc9e830a93dfb1c5344baf903ca4652e2f00b16875","observation_id":"55ce28e0-4813-4353-8197-81b50a8f88de","resolution":{"observed_at":"2026-08-04T11:06:44.086529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16725","last_updated":"2024-11-05T02:24:18Z","snapshot_observed_at":"2026-07-06T19:07:46.545514Z","submitted_at":"2024-08-29T17:18:53Z","title":"Mini-Omni: Language Models Can Hear, Talk While Thinking in Streaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16725","snapshot_observed_at":"2026-08-04T11:06:44.257304Z","title":"Mini-omni: Language mod- els can hear, talk while thinking in streaming,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.257304Z"},"links":{"cited_paper":"/paper/2408.16725","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:0594455e08c4a9c50bf4bdafc04c74337eedd27463c1acc713f520a1b2f60341","observation_id":"1b8bbee8-5951-4f8c-a92d-3c152e36ae7c","resolution":{"observed_at":"2026-08-04T11:06:44.257304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.00774","last_updated":"2024-12-08T05:41:56Z","snapshot_observed_at":"2026-08-04T02:03:05.931925Z","submitted_at":"2024-11-01T17:59:51Z","title":"Freeze-Omni: A Smart and Low Latency Speech-to-speech Dialogue Model with Frozen LLM","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.00774","snapshot_observed_at":"2026-08-04T11:06:44.360493Z","title":"Freeze-omni: A smart and low latency speech-to-speech dialogue model with frozen llm,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.360493Z"},"links":{"cited_paper":"/paper/2411.00774","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:a365978dabebff2d1c2dee16d412c0b11bac8490934bce468d8039215a557296","observation_id":"875ecdf8-0960-418d-b24a-1bc98129c738","resolution":{"observed_at":"2026-08-04T11:06:44.360493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02612","snapshot_observed_at":"2026-08-04T11:06:44.532704Z","title":"Glm-4-voice: Towards intelligent and human-like end-to-end spoken chatbot,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.532704Z"},"links":{"cited_paper":"/paper/2412.02612","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:7e86d0d12ffc9e11f36a340df78044e79c8d09bdda7bf620915175166b18760c","observation_id":"6d8c3881-632a-40ca-9478-ee325d43010f","resolution":{"observed_at":"2026-08-04T11:06:44.532704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.00037","last_updated":"2024-10-02T09:11:45Z","snapshot_observed_at":"2026-07-30T10:21:14.474746Z","submitted_at":"2024-09-17T17:55:39Z","title":"Moshi: a speech-text foundation model for real-time dialogue","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.00037","snapshot_observed_at":"2026-08-04T11:06:44.649264Z","title":"Moshi: a speech-text foundation model for real-time dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.649264Z"},"links":{"cited_paper":"/paper/2410.00037","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:1ef828dce77dd44e5366c21361b3e5c768450f04922fe9eeddd58b198ef3c3ec","observation_id":"88a46cbb-0276-4a0c-b631-cfcac641ba3a","resolution":{"observed_at":"2026-08-04T11:06:44.649264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:44.765981Z","title":"EMO-Reasoning: Benchmarking Emotional Rea- soning Capabilities in Spoken Dialogue Systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.765981Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:0210bc699a1e7197b40bef03774e601f067611986851199fa7455a4e23ccd1e9","observation_id":"d21cad1c-f787-4e84-98ac-87728cf598ea","resolution":{"observed_at":"2026-08-04T11:06:44.765981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:44.936563Z","title":"Textually pretrained speech language mod- els,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:44.936563Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:33fd1f453dbf5d64089ffeadd6de47bc2edd5d91da364d0b8126ba59c328306a","observation_id":"39279745-9fba-4474-9f3e-652bed7a1193","resolution":{"observed_at":"2026-08-04T11:06:44.936563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09781","last_updated":"2024-07-22T02:47:56Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:33:18Z","title":"GSQA: An End-to-End Model for Generative Spoken Question Answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09781","snapshot_observed_at":"2026-08-04T11:06:45.071560Z","title":"Gsqa: An end-to-end model for generative spo- ken question answering,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:45.071560Z"},"links":{"cited_paper":"/paper/2312.09781","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:b8742b747965070b51256376d42892388973d056dbc83294e5c861c40f73f771","observation_id":"f0f98697-da92-443a-b0aa-be673aa1316b","resolution":{"observed_at":"2026-08-04T11:06:45.071560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.01834","last_updated":"2025-05-27T16:17:52Z","snapshot_observed_at":"2026-07-06T19:44:38.954993Z","submitted_at":"2024-11-04T06:07:53Z","title":"Align-SLM: Textless Spoken Language Models with Reinforcement Learning from AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.01834","snapshot_observed_at":"2026-08-04T11:06:45.216359Z","title":"Align-slm: Textless spoken language mod- els with reinforcement learning from ai feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:45.216359Z"},"links":{"cited_paper":"/paper/2411.01834","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:6b8906748c1a884c174fe4529f2fef215089e704825269c8c5c4966e4c0e28bf","observation_id":"da687337-5354-4610-8d33-81c741879d91","resolution":{"observed_at":"2026-08-04T11:06:45.216359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:45.330196Z","title":"Dynamic-superb: Towards a dynamic, collab- orative, and comprehensive instruction-tuning benchmark for speech,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:45.330196Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:d88bff3b7d09c8ee724faef15a8a51096e17fe247652d0adc265a5a59a90fc49","observation_id":"125e2bb9-743b-4c43-a38f-8fc9c0a22b07","resolution":{"observed_at":"2026-08-04T11:06:45.330196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05361","last_updated":"2025-06-09T16:36:12Z","snapshot_observed_at":"2026-07-06T19:47:16.854192Z","submitted_at":"2024-11-08T06:33:22Z","title":"Dynamic-SUPERB Phase-2: A Collaboratively Expanding Benchmark for Measuring the Capabilities of Spoken Language Models with 180 Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05361","snapshot_observed_at":"2026-08-04T11:06:45.452664Z","title":"Dynamic-superb phase-2: A collaboratively expanding benchmark for measuring the capabilities of spoken lan- guage models with 180 tasks,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:45.452664Z"},"links":{"cited_paper":"/paper/2411.05361","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:f8c7303c23c45d08d4ccb2976e1d207632aed3bd175277e96cd705827632ac21","observation_id":"2e7e6682-6c59-46bc-a742-1b2da70970a0","resolution":{"observed_at":"2026-08-04T11:06:45.452664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:45.617090Z","title":"Sd-eval: A benchmark dataset for spoken dialogue understanding beyond words,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:45.617090Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:e7d56846254e3ac7fd1fb6e74d4554b7ad326302b62aa584d3b710e288f85e8d","observation_id":"5bcdd55d-b602-4683-9c78-67d02463c97b","resolution":{"observed_at":"2026-08-04T11:06:45.617090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12786","last_updated":"2024-05-30T09:06:34Z","snapshot_observed_at":"2026-08-09T16:11:46.334107Z","submitted_at":"2024-02-20T07:51:43Z","title":"Advancing Large Language Models to Capture Varied Speaking Styles and Respond Properly in Spoken Conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12786","snapshot_observed_at":"2026-08-04T11:06:45.730320Z","title":"Advancing large language models to capture varied speaking styles and respond properly in spoken conversations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:45.730320Z"},"links":{"cited_paper":"/paper/2402.12786","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:4aba6e061411086d66238a4f18484a04d63e86353864e2026e5bc8144263d2cf","observation_id":"294f0709-7083-4820-8032-f79d87d4813c","resolution":{"observed_at":"2026-08-04T11:06:45.730320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11065","last_updated":"2024-09-28T05:50:26Z","snapshot_observed_at":"2026-08-09T11:52:13.142999Z","submitted_at":"2024-06-16T20:41:44Z","title":"Can LLMs Understand the Implication of Emphasized Sentences in Dialogue?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11065","snapshot_observed_at":"2026-08-04T11:06:45.892058Z","title":"Can LLMs Understand the Im- plication of Emphasized Sentences in Dialogue?,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:45.892058Z"},"links":{"cited_paper":"/paper/2406.11065","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:9825b5d02a259859081134670d8e55ae2fdea61dbaf7acbb6e2aee7440aeccad","observation_id":"d79b70b3-246a-4063-ad4d-4050923f06a6","resolution":{"observed_at":"2026-08-04T11:06:45.892058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:46.069842Z","title":"Paralinguistics-enhanced large language model- ing of spoken dialogue,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.069842Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:7178c6a2302a6a23987c73beb97ffcbe36b543aee72f2a078c91625ca05b8f1e","observation_id":"59b66f37-2dda-4843-acd9-3416ffaabd9e","resolution":{"observed_at":"2026-08-04T11:06:46.069842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04721","last_updated":"2025-08-16T05:46:19Z","snapshot_observed_at":"2026-08-08T10:00:14.544688Z","submitted_at":"2025-03-06T18:59:16Z","title":"Full-Duplex-Bench: A Benchmark to Evaluate Full-duplex Spoken Dialogue Models on Turn-taking Capabilities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04721","snapshot_observed_at":"2026-08-04T11:06:46.172940Z","title":"Full-duplex-bench: A benchmark to evaluate full-duplex spoken dialogue models on turn-taking capabilities,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.172940Z"},"links":{"cited_paper":"/paper/2503.04721","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:c46fb097ae61a0afa7fd457e1b56275346fae4e12c8a0c9d0d4cc3e5074bc1e1","observation_id":"8cf06290-04af-4d4b-b500-0508e399abb4","resolution":{"observed_at":"2026-08-04T11:06:46.172940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.23159","last_updated":"2026-04-26T17:51:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-30T23:41:05Z","title":"Full-Duplex-Bench v1.5: Evaluating Overlap Handling for Full-Duplex Speech Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.23159","snapshot_observed_at":"2026-08-04T11:06:46.285556Z","title":"Full-Duplex-Bench v1. 5: Evaluating Over- lap Handling for Full-Duplex Speech Models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.285556Z"},"links":{"cited_paper":"/paper/2507.23159","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:190d5c07cc313ba78fb7e428f86cfe6caacc72c6d68b57462296524e7f13efa4","observation_id":"393e8571-d257-4c2c-85f1-4bf558dec92d","resolution":{"observed_at":"2026-08-04T11:06:46.285556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20033","last_updated":"2025-05-27T07:26:21Z","snapshot_observed_at":"2026-08-08T13:00:46.007301Z","submitted_at":"2025-05-26T14:19:58Z","title":"EmoNet-Face: An Expert-Annotated Benchmark for Synthetic Emotion Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20033","snapshot_observed_at":"2026-08-04T11:06:46.449195Z","title":"Emonet-face: An expert-annotated benchmark for synthetic emotion recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.449195Z"},"links":{"cited_paper":"/paper/2505.20033","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:e43cd4d8bcd7ba905fcbd226351bfa4615e7f0c03fcde67d4ea6297880295960","observation_id":"6a3bd3b4-2cb7-481c-9ffb-82fbbd7114b7","resolution":{"observed_at":"2026-08-04T11:06:46.449195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:46.510825Z","title":"Dfme: A new benchmark for dynamic facial micro- expression recognition,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.510825Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:836ad6e7c01aed69ddae0cf7b0d30a63f8bd85641939e10b3d1d4086f5c614de","observation_id":"1952de1b-9e3c-48fb-83b2-c9ab0b44afeb","resolution":{"observed_at":"2026-08-04T11:06:46.510825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.03201","last_updated":"2020-05-07T01:58:05Z","snapshot_observed_at":"2026-08-05T20:13:46.641885Z","submitted_at":"2020-05-07T01:58:05Z","title":"What comprises a good talking-head video generation?: A Survey and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.03201","snapshot_observed_at":"2026-08-04T11:06:46.566015Z","title":"What comprises a good talking-head video gener- ation?: A survey and benchmark,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.566015Z"},"links":{"cited_paper":"/paper/2005.03201","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:a10323dd3d931117b6d24a462d2bcad13053d085d7d8813785a45cbe6abd63fc","observation_id":"650e59fa-b87e-4d33-996e-ec183875082e","resolution":{"observed_at":"2026-08-04T11:06:46.566015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:46.658569Z","title":"Subjective and objective quality-of-experience assessment for 3d talking heads,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.658569Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:d46a83e72dda4956ff26615e780c49ddd205b0413881b02e2044e7e3c03dba90","observation_id":"8e28c4f6-9261-415c-b69f-acb4787ddc3d","resolution":{"observed_at":"2026-08-04T11:06:46.658569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:46.766534Z","title":"Av- data2vec: Self-supervised learning of audio-visual speech representa- tions with contextualized target representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.766534Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:8e525a719c34e8b1e57d1c6cfb54f4f8d321d9322f16a47caebe4317be026989","observation_id":"a6619faf-fe91-4fdc-91ca-efe844f7e6ac","resolution":{"observed_at":"2026-08-04T11:06:46.766534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:46.881448Z","title":"Jointly Learning From Unimodal and Multimodal-Rated Labels in Audio-Visual Emotion Recognition,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:46.881448Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:d776ffa3c7b507291aaa5ee0cf43d31d9cf7f0c2679bca5e46495fc7178ac4df","observation_id":"c84f1758-c514-4d74-adb5-c47ff4736a94","resolution":{"observed_at":"2026-08-04T11:06:46.881448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:47.055060Z","title":"Stimulus Modality Matters: Impact of Perceptual Evaluations from Different Modalities on Speech Emotion Recognition System Performance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:47.055060Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:e66ff98dc64aba767e33f2ba06aef63c703b83fdf6e0be697ba2699797e38b4b","observation_id":"e491b503-38be-46cd-ae0d-99b8fc7f6426","resolution":{"observed_at":"2026-08-04T11:06:47.055060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:47.160427Z","title":"Cross-modal incongruity aligning and collaborating for multi-modal sarcasm detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:47.160427Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:a703d3aaf4baa8e139c9f80daf5549775204ba87f0d44fefd3bae1646a3ed394","observation_id":"94344922-5168-4498-b185-ff6548bd7b27","resolution":{"observed_at":"2026-08-04T11:06:47.160427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:47.327139Z","title":"Let’s Go Real Talk: Spoken Dialogue Model for Face-to-Face Conversation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:47.327139Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:d97629d726076822f20cafb559a0b0d494b133c9af4f875f499d8c9c9d5b96bb","observation_id":"324591fa-222c-4683-aab5-a9d0f6d31fa5","resolution":{"observed_at":"2026-08-04T11:06:47.327139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04051","last_updated":"2024-07-11T02:08:35Z","snapshot_observed_at":"2026-08-06T00:42:36.144034Z","submitted_at":"2024-07-04T16:49:02Z","title":"FunAudioLLM: Voice Understanding and Generation Foundation Models for Natural Interaction Between Humans and LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04051","snapshot_observed_at":"2026-08-04T11:06:47.467247Z","title":"FunAudioLLM: V oice Understanding and Genera- tion Foundation Models for Natural Interaction Between Humans and LLMs,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:47.467247Z"},"links":{"cited_paper":"/paper/2407.04051","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:de45095b901be6b5af56b56eeb706148a2eaf75064680677a835c54d6394180f","observation_id":"5741f955-ca5f-4795-9766-ca92451055e3","resolution":{"observed_at":"2026-08-04T11:06:47.467247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:47.604554Z","title":"Facial Expression Recognition with Adaptive Frame Rate based on Multiple Testing Correction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:47.604554Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:1e8fd4a30d3f4d033f99d4438a749303095a58058622727886ad6791e2b5d0e0","observation_id":"8b2d7aaa-cd9f-4a57-8f0c-a142052a77cb","resolution":{"observed_at":"2026-08-04T11:06:47.604554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:47.778184Z","title":"Introducing the RECOLA multimodal corpus of remote collaborative and affective interactions,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:47.778184Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:701a7d1ad38cf7c554d0c046eacf65cb43cf52b64314a32cdcef25170d0e68aa","observation_id":"19302319-6d60-438c-ba27-2ed0c0b0ef8d","resolution":{"observed_at":"2026-08-04T11:06:47.778184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:47.905073Z","title":"Avec 2016: Depression, mood, and emotion recognition workshop and challenge,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:47.905073Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:218f5bc2b2105f85c44b66a2f394a5d5fbf14db3dec08d39d5883bfaf8df8012","observation_id":"e9d32696-507a-47d3-a9ea-25741e192fb7","resolution":{"observed_at":"2026-08-04T11:06:47.905073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:48.047900Z","title":"Hicmae: Hierarchical contrastive masked autoencoder for self-supervised audio-visual emotion recognition,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.047900Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:4bf8cd3fe04ae15e28e7dc64406da22b789dd892874eac2799ee1444d8172f17","observation_id":"69f15386-e08b-434c-b053-4dfb0cccb9d9","resolution":{"observed_at":"2026-08-04T11:06:48.047900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:48.131813Z","title":"Baichuan-Omni-1.5 Technical Report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.131813Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:90b1f49248eec6c3f555181af009b9ead1868d4b44d80b354b14e043280bee42","observation_id":"e33dd677-042a-4cc7-9867-0beb00476dde","resolution":{"observed_at":"2026-08-04T11:06:48.131813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-04T11:06:48.189332Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.189332Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:279ca27cef9cb4146634261439508202868f2fc0b9d6931608c4fc33d39d7e85","observation_id":"158e03a8-2b26-406f-8e84-9d8f6cbc1791","resolution":{"observed_at":"2026-08-04T11:06:48.189332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-04T11:06:48.258673Z","title":"Qwen2.5-Omni Technical Report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.258673Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:27a3c742d8ad4746cd3cf613730ae9dd830c58d8af26975a96eab3776c8ce999","observation_id":"7e3ad335-ff11-4fb1-966f-20765b90f8e2","resolution":{"observed_at":"2026-08-04T11:06:48.258673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T11:06:48.330522Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.330522Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:f64fbd0fe9a445437907be1b735d2876bdfe0dafc1ca3d61ccfc3813d0aeb2b5","observation_id":"2b570d25-4ff0-4d74-915c-2a9b94f73a29","resolution":{"observed_at":"2026-08-04T11:06:48.330522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10117","last_updated":"2024-12-25T11:54:03Z","snapshot_observed_at":"2026-08-09T04:36:59.879757Z","submitted_at":"2024-12-13T12:59:39Z","title":"CosyVoice 2: Scalable Streaming Speech Synthesis with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10117","snapshot_observed_at":"2026-08-04T11:06:48.378240Z","title":"Cosyvoice 2: Scalable streaming speech synthesis with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.378240Z"},"links":{"cited_paper":"/paper/2412.10117","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:09688b73ff837dbedb650b0b4a83910078ec6b6fc90d52810f072c5b81fcf6d8","observation_id":"21296364-8cff-4b23-8a30-2db2bb9e81d5","resolution":{"observed_at":"2026-08-04T11:06:48.378240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:48.434176Z","title":"AI-Face: A Million-Scale Demographically Annotated AI-Generated Face Dataset and Fairness Benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.434176Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:689f32dec59e1d781e202831b57cabeda04e32d8e1f559af58cc6ecfca16ee42","observation_id":"d394c90c-79b4-45d5-9426-971267eb3242","resolution":{"observed_at":"2026-08-04T11:06:48.434176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-04T11:06:48.586938Z","title":"DreamTalk: When Expressive Talking Head Generation Meets Diffusion Probabilistic Models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.586938Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:d26f962b8d4694fb8fa549f5495b250909bcfde076180767a21a3ecbe0f91def","observation_id":"18ba8698-1e52-45ca-8930-12de44413092","resolution":{"observed_at":"2026-08-04T11:06:48.586938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:48.730556Z","title":"Unconstrained dysfluency modeling for dys- fluent speech transcription and detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.730556Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:b5a4c8a40450a7cd3fe4a5218e4dc205323671aca6150127243b45807f2dbc1e","observation_id":"92494f21-2696-4f33-8c6e-89b5d4088fb3","resolution":{"observed_at":"2026-08-04T11:06:48.730556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:48.867492Z","title":"Towards hierarchical spo- ken language disfluency modeling,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:48.867492Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:aacc3035af0ee7f1aca006bbd3c00b09811f30d7219a272de8a873b31d45cd0d","observation_id":"981e0606-c161-4694-be0a-c9722b56dde7","resolution":{"observed_at":"2026-08-04T11:06:48.867492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.002050Z","title":"Ssdm: Scalable speech dysfluency model- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.002050Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:a8b842fd906949197cfd063ff82be495186c25bb7b644bbcb01303e8dacdc74c","observation_id":"2e6ba329-a502-4cd3-aafb-36ff0892a010","resolution":{"observed_at":"2026-08-04T11:06:49.002050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.173181Z","title":"Auto- matic detection of articulatory-based disfluencies in primary progres- sive aphasia,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.173181Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:b5b43599c63aa6ab26c673408515131ce8ec4aa570b1be1fd2fa0ce250ff332f","observation_id":"9ef1c0e1-47e9-4c16-8d7c-5b26e31ef006","resolution":{"observed_at":"2026-08-04T11:06:49.173181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.337643Z","title":"Yolo-stutter: End-to-end region-wise speech dysfluency detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.337643Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:9b0475086d4d43d038d17a2020e233c10bd25029fbcc243b64bb635aa9b3a791","observation_id":"23c766c1-283b-400f-b708-8f41dd377b11","resolution":{"observed_at":"2026-08-04T11:06:49.337643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.474841Z","title":"Stutter-solver: End-to-end multi- lingual dysfluency detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.474841Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:d187381b74a3baba64f49f9b109461615a1409cedd05f9a4edf201ae41f5a2fa","observation_id":"e6c095a5-c59c-4296-90a6-f4270545c875","resolution":{"observed_at":"2026-08-04T11:06:49.474841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.590004Z","title":"Time and tokens: Benchmarking end-to-end speech dys- fluency detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.590004Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:5946483380e6e7fd51523054d8cd20ef40bd7edf4058cd44e2371bcd71c2c7cf","observation_id":"c0fd4617-7d21-4a44-9fa9-f104ec2ee1bf","resolution":{"observed_at":"2026-08-04T11:06:49.590004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.731493Z","title":"Towards accurate phonetic error detection through phoneme similarity modeling,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.731493Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:bab26792c02f97a2b8b499bb89a22f122f65505478113c1f28d7bf8070956e37","observation_id":"5f5d49ad-c691-4f74-946f-1d5f811bd2bb","resolution":{"observed_at":"2026-08-04T11:06:49.731493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.811259Z","title":"Dysfluent wfst: A framework for zero-shot speech dysfluency transcription and detection,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.811259Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:ec91af7f7eee914f0e31b547c31d73e0583c7e2edab864a6ddb81f7d38e136f4","observation_id":"ee530a01-f84e-46d9-a9e6-15199c6855d0","resolution":{"observed_at":"2026-08-04T11:06:49.811259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:49.906913Z","title":"Analysis and evaluation of synthetic data generation in speech dysfluency detec- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.906913Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:b44cd4ff87915b105c66f269bb48c2cabd23c78745f93cd00aac1aa41ef54ec9","observation_id":"dbea160c-b9e7-43e5-828d-747d8831208d","resolution":{"observed_at":"2026-08-04T11:06:49.906913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03937","last_updated":"2025-08-13T18:58:04Z","snapshot_observed_at":"2026-08-06T01:10:15.255047Z","submitted_at":"2025-08-05T21:59:35Z","title":"LCS-CTC: Leveraging Soft Alignments to Enhance Phonetic Transcription Robustness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03937","snapshot_observed_at":"2026-08-04T11:06:49.960449Z","title":"Lcs-ctc: Leveraging soft alignments to enhance phonetic transcription robustness,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:49.960449Z"},"links":{"cited_paper":"/paper/2508.03937","citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:92c208a4d5f4548395923411be2a4025f32039e171fbc610cb8a7ed75f3a4082","observation_id":"6fab458a-3d21-45c4-9b3e-731303dd4d5f","resolution":{"observed_at":"2026-08-04T11:06:49.960449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:50.075040Z","title":"Seamless dysfluent speech text alignment for disordered speech analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:50.075040Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:650cf27c63fe14375feee78d7e54ba208a626fd1ca8bd11aef2ac2e99d9488b0","observation_id":"7d32a70c-a167-4f3d-a62f-1c516f3e9576","resolution":{"observed_at":"2026-08-04T11:06:50.075040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:50.181760Z","title":"K-function: Joint pronunciation transcription and feedback for evaluating kids language function,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:50.181760Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:6942f91d25cd385280ea62ab6a53d2162ee037bc020eb4e27146cab6cf4501d2","observation_id":"7f7edb46-3e57-4b63-9836-0d198d68fec6","resolution":{"observed_at":"2026-08-04T11:06:50.181760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:50.261052Z","title":"Deep Neural Convolutive Matrix Factorization for Articulatory Representation Decomposition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:50.261052Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:e1b9ed28e7f3c72cd41f3be9c319d3a399324ccd654bcabdab8557b9e6b8fc8a","observation_id":"50249b44-c621-400b-b776-11c39a144355","resolution":{"observed_at":"2026-08-04T11:06:50.261052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:06:50.337605Z","title":"Articulatory representation learn- ing via joint factor analysis and neural matrix factorization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T11:06:50.337605Z"},"links":{"citing_paper":"/paper/2510.07355"},"observation_digest":"sha256:b0d3168b9af38ce3b6a7517b12c221db6069d759e745bc389c366a6b1887c663","observation_id":"b7dea22d-a56e-4a87-a507-4492bc2313e8","resolution":{"observed_at":"2026-08-04T11:06:50.337605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.07355","last_updated":"2026-05-28T11:55:17Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-07T20:52:44.589895Z","submitted_at":"2025-10-08T14:13:28Z","title":"AV-EMO-Reasoning: Benchmarking Emotional Reasoning Capabilities in Omni-modal LLMS with Audio-visual Cues"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2510.07355."}