{"as_of":"2026-08-09T15:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:982be59a59eac105c0e3a43e689d9c7ddc6e7af2dc50ba7022cbffe1c8956e16","coverage":[{"denominator":81,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":81,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T20:49:51.683856Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:28:56.798473Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T17:18:53.193305Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"cited_work":{"arxiv_id":"2502.04976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04976","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards multimodal empathetic response generation: A rich text-speech-vision avatar-based benchmark","venue":null,"work_id":"2469b24c-0e20-4c52-b94e-5e7743162282","year":2025},"citing_paper":{"arxiv_id":"2503.12605","last_updated":"2025-03-23T13:47:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-16T18:39:13Z","title":"Multimodal Chain-of-Thought Reasoning: A Comprehensive Survey","version":2},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-15T17:18:52.996467Z"},"links":{"cited_paper":"/paper/2502.04976","citing_paper":"/paper/2503.12605"},"observation_digest":"sha256:bc1e57ab12e843b8eb5848f927f30019160d9b8d6f01789a927b0158d8b85520","observation_id":"a5c5a808-e9d9-47ff-b2fc-35e12ed5f1a6","resolution":{"observed_at":"2026-05-15T17:18:53.196060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"cited_work":{"arxiv_id":"2502.04976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.04976","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards multimodal empathetic response generation: A rich text-speech-vision avatar-based benchmark","venue":null,"work_id":"2469b24c-0e20-4c52-b94e-5e7743162282","year":2025},"citing_paper":{"arxiv_id":"2604.18988","last_updated":"2026-04-21T02:18:18Z","snapshot_observed_at":"2026-07-06T23:05:44.499005Z","submitted_at":"2026-04-21T02:18:18Z","title":"A Multi-Agent Framework with Structured Reasoning and Reflective Refinement for Multimodal Empathetic Response Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T03:31:05.546782Z"},"links":{"cited_paper":"/paper/2502.04976","citing_paper":"/paper/2604.18988"},"observation_digest":"sha256:ca347410f49f5b5acd4ea3d22b64ca02ac5d4a79caf4f95e2305b90e77b2bdf6","observation_id":"d9dd7114-7e1d-4658-bdd7-c897424e51b0","resolution":{"observed_at":"2026-05-11T12:31:04.092789Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04976","snapshot_observed_at":"2026-08-06T18:28:56.798473Z","title":"arXiv preprint arXiv:2502.04976 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04709","last_updated":"2026-08-05T11:23:40Z","snapshot_observed_at":"2026-08-08T23:12:20.276843Z","submitted_at":"2026-08-05T11:23:40Z","title":"EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T18:28:56.798473Z"},"links":{"cited_paper":"/paper/2502.04976","citing_paper":"/paper/2608.04709"},"observation_digest":"sha256:10401db2a7bb487e5fb7e86b197e18a38ac8feabd4b2e940412ae36ecaf15383","observation_id":"e42e6a58-8452-43d4-b7fd-a389285c8dce","resolution":{"observed_at":"2026-08-06T18:28:56.798473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.04976/citation-record","integrity":"/paper/2502.04976/integrity","json":"/paper/2502.04976/citation-record.json","paper":"/paper/2502.04976"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-08T20:49:51.402163Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.402163Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:c37b5699de59788bdcca8bd3af8c16e1532bdeb156d9c38525aff3fd660c58e9","observation_id":"fb87eba8-4fc5-4cc3-a2a9-697bfd994a21","resolution":{"observed_at":"2026-08-08T20:49:51.402163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.406713Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.406713Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:4b03f1f61e07bb50650dc5944c824040a9164fcd8bd721d5a5cfeb8e640d509f","observation_id":"31147a08-07ff-4534-9c32-ccbbf8074a64","resolution":{"observed_at":"2026-08-08T20:49:51.406713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.410253Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.410253Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:aca0d19ffe58a566e806e15bd80740f2f63962f11270c7966f71d9e6b6c0da25","observation_id":"056093af-70b6-445d-bb1a-871fb52b9cc5","resolution":{"observed_at":"2026-08-08T20:49:51.410253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.413339Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.413339Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:3bb40cbb10b7e41beb72d6466187cada783edbeadc33fefdd6f2236ddde4a128","observation_id":"66ebfe9e-e93b-4e7d-9fb7-86552c74a084","resolution":{"observed_at":"2026-08-08T20:49:51.413339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.416963Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.416963Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:9048d6bd8265154e04a734354cb3892ce5402ae7776c1586495d5ba8726e011a","observation_id":"29821088-ca91-40cf-a029-9405535b50de","resolution":{"observed_at":"2026-08-08T20:49:51.416963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-08T20:49:51.420407Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.420407Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:0af1d7d1d1d0dcc24a86d28f78933c9bdb5eb7e87376875b5e3507ed20c36d65","observation_id":"5ed0215c-ad68-4e10-b656-50786cd0b997","resolution":{"observed_at":"2026-08-08T20:49:51.420407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.416913Z","title":null,"venue":null,"work_id":"1bc0a6dd-ada9-4084-8b8e-49dbe41df378","year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.424211Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:73735c119df5c264f9723373a8a3037ad66c546499711249943d81d704542fa7","observation_id":"d775e18f-52dd-4ee1-ae6b-23aa0f2522ac","resolution":{"observed_at":"2026-08-08T20:49:52.420055Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.407537Z","title":null,"venue":null,"work_id":"dc2fe710-9247-4ec8-ab26-dd1a406c1bd8","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.427160Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:aa4a06b5409f68e5c9b4a789094f2318fca8745730a7962a6ad730383b243238","observation_id":"0a18e02f-bb40-4054-a0cf-d9235503413d","resolution":{"observed_at":"2026-08-08T20:49:52.410994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.388385Z","title":null,"venue":null,"work_id":"ef35939b-50c6-47f4-9c06-914155a9f40e","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.434111Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:f88a712edb3b3833d0f1a93fc82e7cb7bd625f5ffeaf7f3046ec56573510edf5","observation_id":"bed9aafa-425c-4deb-a3d3-5c9862d2d37c","resolution":{"observed_at":"2026-08-08T20:49:52.391618Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.378817Z","title":null,"venue":null,"work_id":"1429ef1d-ffab-417d-8137-2177cd389db6","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.438529Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:e48b9d93e71a6cf7bd74c9d345eee4f7eaaa0e9d3034f4aa27699119b6a80f5c","observation_id":"f6d23236-04d6-4b56-a5d5-57ccb2b86412","resolution":{"observed_at":"2026-08-08T20:49:52.382153Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15177","last_updated":"2024-06-21T14:23:31Z","snapshot_observed_at":"2026-07-06T18:34:56.008706Z","submitted_at":"2024-06-21T14:23:31Z","title":"EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot","version":1},"cited_work":{"arxiv_id":"2406.15177","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.15177","snapshot_observed_at":"2026-08-08T20:49:51.930353Z","title":"EmpathyEar: An Open-source Avatar Multimodal Empathetic Chatbot","venue":"cs.MM","work_id":"a67adfec-20c0-4640-aae2-823c95928c63","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.444014Z"},"links":{"cited_paper":"/paper/2406.15177","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:187c0e5d72b21e4cbb63ee6865ba27a5d148fe2d9a09940719f01a81a24cbac1","observation_id":"da6d4218-8a5a-4b4e-bf2f-c80d7351c8f3","resolution":{"observed_at":"2026-08-08T20:49:51.934715Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.369059Z","title":"In Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024): Tutorial Summaries","venue":null,"work_id":"62a3dbdb-a6c6-49e9-9ad9-c5b56c582a1f","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.441406Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:688a2af3322c94fc2ca912fd5c97ffdab8bd5735a4061b7e35321ed977964c1c","observation_id":"503c6581-b745-444c-ac62-337a5dc32756","resolution":{"observed_at":"2026-08-08T20:49:52.372704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.349977Z","title":null,"venue":null,"work_id":"d4108ae6-afeb-4770-be59-555b68d56e27","year":2021},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.450379Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:8ca09c0eb796430073dc0cbadd7c5884db31bbe43b3223d1feb5964538343005","observation_id":"26abf529-89f8-465c-82c9-a342d2febada","resolution":{"observed_at":"2026-08-08T20:49:52.353222Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.359422Z","title":null,"venue":null,"work_id":"35e19af5-d8ea-46ca-be1f-cfd20e2d882e","year":2020},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.447368Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:8a47b9f81ab6ff6e6e763842b2d0acc75858209f1cd8e66588abc7e0b44b2203","observation_id":"026f6c2b-820e-432e-97a8-e7b6408c99f8","resolution":{"observed_at":"2026-08-08T20:49:52.362524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-08T20:49:51.456352Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.456352Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:25a166176610b3adfd5062b29b78de3cd2cadf98ebf122ffad41b54ee19ed150","observation_id":"e3d29065-5f7a-4c8f-8de0-e02348cc64a3","resolution":{"observed_at":"2026-08-08T20:49:51.456352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.453494Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.453494Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:9b538a101bc8e9614067c6f026b4460618d5b8523381956fde92fd4acdf82010","observation_id":"4189bc9b-c508-4943-b6ba-5366ab3247f7","resolution":{"observed_at":"2026-08-08T20:49:51.453494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05705","last_updated":"2023-05-22T10:49:20Z","snapshot_observed_at":"2026-07-06T14:16:48.496031Z","submitted_at":"2022-11-10T17:18:20Z","title":"DiaASQ : A Benchmark of Conversational Aspect-based Sentiment Quadruple Analysis","version":4},"cited_work":{"arxiv_id":"2211.05705","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.05705","snapshot_observed_at":"2026-08-08T20:49:51.898176Z","title":"DiaASQ : A Benchmark of Conversational Aspect-based Sentiment Quadruple Analysis","venue":"cs.CL","work_id":"bd144e95-2d73-48fb-bf65-d7bda589ca1a","year":2022},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.463088Z"},"links":{"cited_paper":"/paper/2211.05705","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:584a4b6bcedcac1ccb29f1b339e700b19bae335dddead4e2df325bdc447bfc43","observation_id":"18f12589-cb3a-4c75-ad01-c5cd9541715d","resolution":{"observed_at":"2026-08-08T20:49:51.902059Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-08T20:49:51.459647Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.459647Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:8fa0a60b237dd311a26a5a68ca3ffcc079aba229a4b30da3e5764295ba6df801","observation_id":"639262ca-b2a4-499c-90d3-901024897bd1","resolution":{"observed_at":"2026-08-08T20:49:51.459647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.334911Z","title":null,"venue":null,"work_id":"5db18355-d0c6-4934-9999-fc560c2251a2","year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.469739Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:7984b1a74dcdcabe36214d274ee0374a3163a6fa3b622c59a13980845275290a","observation_id":"00378d85-45e0-4e90-a7a5-2c533c9f3cee","resolution":{"observed_at":"2026-08-08T20:49:52.338392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1510.03055","last_updated":"2016-06-10T22:03:28Z","snapshot_observed_at":"2026-07-06T04:32:42.614338Z","submitted_at":"2015-10-11T14:04:57Z","title":"A Diversity-Promoting Objective Function for Neural Conversation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1510.03055","snapshot_observed_at":"2026-08-08T20:49:51.466277Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.466277Z"},"links":{"cited_paper":"/paper/1510.03055","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:bddda9d504763dbb12d7948bce72ecb181df27dc6f5bc48a45b1744abc23eaff","observation_id":"6357f5ef-71d5-49d2-b059-d866fe875d4c","resolution":{"observed_at":"2026-08-08T20:49:51.466277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.325489Z","title":null,"venue":null,"work_id":"d20ec28f-5738-43c9-9657-96a59c9d2d8f","year":2022},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.476098Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:22ebfbd73e2d9f42cd9d52ca391435dbedf163fc343711f397d9d1f7b514faab","observation_id":"0f81845f-abf1-49a0-bc00-421084672c58","resolution":{"observed_at":"2026-08-08T20:49:52.328872Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-07-06T19:01:27.827878Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-08T20:49:51.472790Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.472790Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:f0a739d4e72f85b492e3b6d1f1f5cffcd68f5d95ab41c602df9b3fde7bcd87af","observation_id":"dc6c9300-5af4-4b18-aca5-a9ab9bb1ea3d","resolution":{"observed_at":"2026-08-08T20:49:51.472790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-08T20:49:51.482452Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.482452Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:e1e4bc149e4f35e82c57fbaeab0a2c400ac25e52cbae1576816c98b6c2913ccf","observation_id":"c16bd71b-5db5-4cce-acc5-dd42d2412db8","resolution":{"observed_at":"2026-08-08T20:49:51.482452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.316379Z","title":null,"venue":null,"work_id":"580a385f-b265-410d-a2bf-3b75f625cf86","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.479145Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:c126f8c819187f0e6d18c633ce029be41d12cff87d09e552a7b1435c1448f8c4","observation_id":"7cc22715-9a48-4d91-9b05-62f5586f76c5","resolution":{"observed_at":"2026-08-08T20:49:52.319703Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.489205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.489205Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:aa48e18a8a83611d8ecaf610cdeb0fa29cb80650d15532a595792be76c25b880","observation_id":"d7a011df-0e4a-4441-ad5c-8c795905297a","resolution":{"observed_at":"2026-08-08T20:49:51.489205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.07687","last_updated":"2019-08-21T03:02:56Z","snapshot_observed_at":"2026-08-09T06:51:40.935279Z","submitted_at":"2019-08-21T03:02:56Z","title":"MoEL: Mixture of Empathetic Listeners","version":1},"cited_work":{"arxiv_id":"1908.07687","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.07687","snapshot_observed_at":"2026-08-08T20:49:51.857848Z","title":"MoEL: Mixture of Empathetic Listeners","venue":"cs.CL","work_id":"13b32373-0602-468e-9b5e-58a9f45d22a9","year":2019},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.485665Z"},"links":{"cited_paper":"/paper/1908.07687","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:283bdf30e5866638fbb2e98a3cc971c82388fc7de4cd517ef3da0b9ced1dcb1f","observation_id":"774632b9-a894-4948-8628-4ed7e5677e85","resolution":{"observed_at":"2026-08-08T20:49:51.861607Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.301320Z","title":null,"venue":null,"work_id":"f1e2fd2f-591c-4d64-96b2-53a3623c21dd","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.495423Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:7cd3e160357bd0961f04a9a60ab47479d7f31ab094d239d4a487912721add84a","observation_id":"8c2ad0f5-e375-4a3a-b729-bea345d8a0a8","resolution":{"observed_at":"2026-08-08T20:49:52.304549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.04262","last_updated":"2018-04-12T00:14:10Z","snapshot_observed_at":"2026-07-06T06:33:01.922458Z","submitted_at":"2018-04-12T00:14:10Z","title":"The Voice Conversion Challenge 2018: Promoting Development of Parallel and Nonparallel Methods","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.04262","snapshot_observed_at":"2026-08-08T20:49:51.492309Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.492309Z"},"links":{"cited_paper":"/paper/1804.04262","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:250378872c76c6ab285c3859353817fce1a2fd107856736b4e0c8a90e2a9d811","observation_id":"1e125c31-4ad3-4b76-9d4d-69cb9c4b4d23","resolution":{"observed_at":"2026-08-08T20:49:51.492309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.291501Z","title":null,"venue":null,"work_id":"7f3619ab-1e2d-4510-94bc-2cd09e3c16b4","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.502866Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:7b1b33ac40cd030a19fd27b8748a83ed500770f7fe0a9789cf3a9bb312809a8e","observation_id":"519ba272-27db-40c5-ae17-409449357493","resolution":{"observed_at":"2026-08-08T20:49:52.295005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09481","last_updated":"2024-09-09T15:57:34Z","snapshot_observed_at":"2026-08-08T20:13:01.078820Z","submitted_at":"2024-08-18T13:51:01Z","title":"PanoSent: A Panoptic Sextuple Extraction Benchmark for Multimodal Conversational Aspect-based Sentiment Analysis","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09481","snapshot_observed_at":"2026-08-08T20:49:51.499157Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.499157Z"},"links":{"cited_paper":"/paper/2408.09481","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:f9a1360e80dd3d0b49f2967e51887f74a1c7fbeceb47d0070a749c3a5cc5af1a","observation_id":"3377d4c9-0abc-42e4-8b07-7bbe50a1a9ac","resolution":{"observed_at":"2026-08-08T20:49:51.499157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.01454","last_updated":"2020-10-04T00:35:47Z","snapshot_observed_at":"2026-08-08T04:49:20.499813Z","submitted_at":"2020-10-04T00:35:47Z","title":"MIME: MIMicking Emotions for Empathetic Response Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.01454","snapshot_observed_at":"2026-08-08T20:49:51.510158Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.510158Z"},"links":{"cited_paper":"/paper/2010.01454","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:e0812f8ceff27c33516378cbc531efbe9b7cca324fc7be5d497b1b89baf7c1a8","observation_id":"adda083f-3989-4b76-9f15-1470a0218d7d","resolution":{"observed_at":"2026-08-08T20:49:51.510158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09767","last_updated":"2024-08-10T09:37:55Z","snapshot_observed_at":"2026-07-06T17:02:37.841641Z","submitted_at":"2023-12-15T13:15:42Z","title":"DreamTalk: When Emotional Talking Head Generation Meets Diffusion Probabilistic Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09767","snapshot_observed_at":"2026-08-08T20:49:51.506385Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.506385Z"},"links":{"cited_paper":"/paper/2312.09767","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:e83b6afc894fa1df9da9c81e7e9bdda91e1641902177cd7c5518da9b37c4d661","observation_id":"ad011661-eb30-4f38-b868-0fa2e5831a66","resolution":{"observed_at":"2026-08-08T20:49:51.506385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05140","last_updated":"2024-07-26T15:07:01Z","snapshot_observed_at":"2026-07-06T16:29:23.853368Z","submitted_at":"2023-10-08T12:21:24Z","title":"Harnessing the Power of Large Language Models for Empathetic Response Generation: Empirical Investigations and Improvements","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05140","snapshot_observed_at":"2026-08-08T20:49:51.518375Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.518375Z"},"links":{"cited_paper":"/paper/2310.05140","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:42bcdb5283516b3716c2b4c854ac93a261973f1f82b4e5b304a109e3ed7fbd86","observation_id":"0b57493c-9938-4813-b92a-dd57ea777fc7","resolution":{"observed_at":"2026-08-08T20:49:51.518375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.282130Z","title":null,"venue":null,"work_id":"a6b92314-e356-4b48-87a7-0be6f96f81cb","year":2011},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.514162Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:f94459c5ad1f836190e062c476e36342416e270220ad375aea4a6ae3ccf2e325","observation_id":"87ec28d0-353a-4027-adbc-14929db4ddfe","resolution":{"observed_at":"2026-08-08T20:49:52.285217Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.525875Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.525875Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:6ddf9209f789067e92aa6baaa0b77d3b52266b002995628165aeac818619e2c8","observation_id":"ebd0be06-2ead-48bf-b3f9-bc832c413447","resolution":{"observed_at":"2026-08-08T20:49:51.525875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.272759Z","title":null,"venue":null,"work_id":"5a144484-95bf-4866-ab49-c1a808588fd5","year":2022},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.522263Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:c60b7067e813d0f01dceefe8a9302e5ef4ee463bbd0631f3de987cccdd216350","observation_id":"f3f87b12-e718-4dba-b923-859d5d12b45d","resolution":{"observed_at":"2026-08-08T20:49:52.276019Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.257851Z","title":null,"venue":null,"work_id":"6c6bb6a6-acfd-4c97-b6c6-b37e171f5fac","year":2020},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.533397Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:8a78386821cb42c3ed09a22e86793a618d048ccd203f20329959cbcb7efc76e4","observation_id":"01c515dd-d82c-4aaf-a231-3b81af018c48","resolution":{"observed_at":"2026-08-08T20:49:52.261092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00207","last_updated":"2019-08-28T21:35:38Z","snapshot_observed_at":"2026-07-31T15:34:21.257195Z","submitted_at":"2018-11-01T03:43:10Z","title":"Towards Empathetic Open-domain Conversation Models: a New Benchmark and Dataset","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00207","snapshot_observed_at":"2026-08-08T20:49:51.529599Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.529599Z"},"links":{"cited_paper":"/paper/1811.00207","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:37f74d2044db8fef9667962cf90b6bf67ee3bbd30f3dece70be44bdc8c7096b7","observation_id":"7e4d92b7-ad2c-4f5c-b3b6-f4b5fa189708","resolution":{"observed_at":"2026-08-08T20:49:51.529599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.540459Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.540459Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:18e4f85eb32a5ff99ece83dffba16c08122aee66ad110578b163922c7d157633","observation_id":"a940ed49-f0b6-4a23-9e7b-7e18e28f4774","resolution":{"observed_at":"2026-08-08T20:49:51.540459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.248551Z","title":null,"venue":null,"work_id":"0fb4036d-f0a3-4eb9-964f-610027833741","year":2022},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.536999Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:5a2028aa60286df850c856a352e3cc0896e23cf3b2e976d3c7e792af7893586e","observation_id":"80047f13-f03c-4e15-a98f-c317e2a2cb7f","resolution":{"observed_at":"2026-08-08T20:49:52.251869Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.551860Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.551860Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:b839fdf567bbecc5e8bc840ff4a77909b91dda473f74828605a8412a8bf0fb70","observation_id":"1f9e4a3e-c6ca-467a-ae58-0b6a4160d5bb","resolution":{"observed_at":"2026-08-08T20:49:51.551860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.555321Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.555321Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:ca5d9074c4f5e14aa6c70d07d652bd66f87c3fa91309f7115fc82a14ac987930","observation_id":"840e6f52-38dc-4251-88b6-e2d43a08c4e3","resolution":{"observed_at":"2026-08-08T20:49:51.555321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.233206Z","title":null,"venue":null,"work_id":"a3154aee-bb67-45cb-9ae3-de5b96400f04","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.548221Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:d636f9b6933309f981e2df10eb110050e68439f47206456c18478300e6c2c124","observation_id":"cc5ae234-023d-442f-9b5c-527e3301931e","resolution":{"observed_at":"2026-08-08T20:49:52.236565Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.201818Z","title":null,"venue":null,"work_id":"3bf2f85a-5699-469b-a786-4be4e4534142","year":2002},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.562421Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:ae9ff48c8eeae377a98d4034db8945400776e0c945c6710abea99e50466b7302","observation_id":"1343a509-e0af-4f92-aea5-ceffad9ab69f","resolution":{"observed_at":"2026-08-08T20:49:52.205795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05127","last_updated":"2025-02-26T02:55:53Z","snapshot_observed_at":"2026-08-06T09:50:19.009159Z","submitted_at":"2024-06-07T17:55:43Z","title":"Towards Semantic Equivalence of Tokenization in Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05127","snapshot_observed_at":"2026-08-08T20:49:51.565771Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.565771Z"},"links":{"cited_paper":"/paper/2406.05127","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:8f819858de31cbcf4add3560f1ca4a6b61728730b66580d818a5c05f7b654cb9","observation_id":"e03bcb67-6ab2-4b67-97b7-44db29d4d48d","resolution":{"observed_at":"2026-08-08T20:49:51.565771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.212154Z","title":null,"venue":null,"work_id":"f1eba7a6-db68-45b5-b452-1eaa27c73ce7","year":2005},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.558870Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:e949610ce10b4a87c72f55a01adf0d5dc3d7db489a7db7cf02200863553bdb59","observation_id":"1ba78d90-f4a9-4817-b575-1e48d260b4e2","resolution":{"observed_at":"2026-08-08T20:49:52.215408Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.572967Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.572967Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:1203576db61e93393f351cc11e5c1071a0e4dbc8ae72bef7a9a8bda6e6b207d5","observation_id":"c1ec96a0-5b61-47cc-b32d-ca99d38961b3","resolution":{"observed_at":"2026-08-08T20:49:51.572967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.176985Z","title":null,"venue":null,"work_id":"e6a59390-91e4-47e1-be2f-788896f20356","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.580202Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:0b07393dbd64ad800a29b1905f7fd880d6e039f5f517dc913dfe86662f9b3080","observation_id":"32f64eee-8cdd-4936-a868-d7c5cc0d2cbb","resolution":{"observed_at":"2026-08-08T20:49:52.180118Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.192090Z","title":null,"venue":null,"work_id":"1f6febfb-7e71-4715-b545-6f292fe3b846","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.569609Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:8074e7f8a9088420193bf84a02d1022090e18cbe0d325124d26ec5867ed8cf0b","observation_id":"6fa01968-e790-43c7-840f-f341027f7931","resolution":{"observed_at":"2026-08-08T20:49:52.195317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11801","last_updated":"2024-02-19T03:12:12Z","snapshot_observed_at":"2026-07-06T17:31:58.268105Z","submitted_at":"2024-02-19T03:12:12Z","title":"Enhancing Empathetic Response Generation by Augmenting LLMs with Small-scale Empathetic Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11801","snapshot_observed_at":"2026-08-08T20:49:51.586828Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.586828Z"},"links":{"cited_paper":"/paper/2402.11801","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:717d216ae0dfe778bd790f515682b1f61e25bd9836c21789e3e77b615e7186cf","observation_id":"8ea6d1d5-c5a6-4848-bca1-e89bf56e8cd2","resolution":{"observed_at":"2026-08-08T20:49:51.586828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18357","last_updated":"2024-06-11T07:41:03Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T16:55:33Z","title":"Faithful Logical Reasoning via Symbolic Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18357","snapshot_observed_at":"2026-08-08T20:49:51.576651Z","title":"arXiv preprint arXiv:2405.18357 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.576651Z"},"links":{"cited_paper":"/paper/2405.18357","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:bc0b653a999728e4f5685df017d0849d95daf9c82272a786e09a8b27c38ca20b","observation_id":"139bc4c6-ce29-4d47-ac3c-e0c0ccb5b7eb","resolution":{"observed_at":"2026-08-08T20:49:51.576651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T23:27:24.356320Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.18223","snapshot_observed_at":"2026-08-08T20:49:51.593437Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.593437Z"},"links":{"cited_paper":"/paper/2303.18223","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:23efab3dcd20a971fdc81afc239707d45fdf334d14f12c220864ff4e85fd0631","observation_id":"7e637f55-148f-4a4e-bfad-048a9e2e7e83","resolution":{"observed_at":"2026-08-08T20:49:51.593437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17437","last_updated":"2024-02-27T11:50:05Z","snapshot_observed_at":"2026-07-06T17:36:11.854303Z","submitted_at":"2024-02-27T11:50:05Z","title":"Exploiting Emotion-Semantic Correlations for Empathetic Response Generation","version":1},"cited_work":{"arxiv_id":"2402.17437","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.17437","snapshot_observed_at":"2026-08-08T20:49:51.765451Z","title":"Exploiting Emotion-Semantic Correlations for Empathetic Response Generation","venue":"cs.CL","work_id":"477d6b53-a200-4d5e-bc39-4d9891edae6d","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.583466Z"},"links":{"cited_paper":"/paper/2402.17437","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:7728a569ad5cde3d2a6ac6d2a3025c23ea21024a02a65643d5b7dfbb8a1b5ebc","observation_id":"7bece7b9-8aef-43ac-b64e-ace0af46964f","resolution":{"observed_at":"2026-08-08T20:49:51.769322Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08845","last_updated":"2023-05-14T09:57:28Z","snapshot_observed_at":"2026-07-06T13:43:09.333113Z","submitted_at":"2022-08-18T14:28:38Z","title":"CASE: Aligning Coarse-to-Fine Cognition and Affection for Empathetic Response Generation","version":2},"cited_work":{"arxiv_id":"2208.08845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.08845","snapshot_observed_at":"2026-08-08T20:49:51.722895Z","title":"CASE: Aligning Coarse-to-Fine Cognition and Affection for Empathetic Response Generation","venue":"cs.AI","work_id":"0b1ea6fe-7729-40b1-9986-23c09da3a0d0","year":2022},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.600355Z"},"links":{"cited_paper":"/paper/2208.08845","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:d2204edd42d82be7e1da30473fe0c0129ec813b5cb802b7e55970d3c0ff7a377","observation_id":"2533db02-107c-4585-a428-c44e8307f18e","resolution":{"observed_at":"2026-08-08T20:49:51.728632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.168060Z","title":null,"venue":null,"work_id":"1ed604b3-057a-41d1-a6ce-a05f55dfe980","year":2024},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.590277Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:466c6d2caa4ac8454b407328cca1be3a7a9d35c45d90ea495e25afd40688fe52","observation_id":"972c834a-7b94-4739-87de-b0325cc573ab","resolution":{"observed_at":"2026-08-08T20:49:52.171186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03969","last_updated":"2023-06-10T06:52:49Z","snapshot_observed_at":"2026-07-06T15:39:26.695526Z","submitted_at":"2023-06-06T19:04:30Z","title":"ECQED: Emotion-Cause Quadruple Extraction in Dialogs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03969","snapshot_observed_at":"2026-08-08T20:49:51.596829Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.596829Z"},"links":{"cited_paper":"/paper/2306.03969","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:e70d161c4f1968f4c8ab3f88ceab011f6ed4b0cce69b52b1539a853b7799e656","observation_id":"96151797-fc49-416e-9120-772d8c712263","resolution":{"observed_at":"2026-08-08T20:49:51.596829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-08T20:49:51.604550Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.604550Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:1b9f3039d52faf02aba76803c8913bc8135f1f1630c072d2396e2cceab3dcea9","observation_id":"41e073f6-2b6d-4735-9a4a-4e2ab616a733","resolution":{"observed_at":"2026-08-08T20:49:51.604550Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.158428Z","title":"dia_id\":","venue":null,"work_id":"43252177-ef3a-46b7-b0d1-f8b64671387b","year":2025},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.608745Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:74e726d8062e101c1164d2152d49c83e2e2aed074f01446830f93ab9dcc1a64e","observation_id":"c7931415-92b0-4347-b766-87de8e798a2f","resolution":{"observed_at":"2026-08-08T20:49:52.162028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.148877Z","title":null,"venue":null,"work_id":"8ae56530-1e19-4f2b-8497-b3a858a7024c","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.612368Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:d551abc6c36feb07ca6edc7604527ee4fe0f00d1183fc0500a1ef37709c3de44","observation_id":"b1153dac-d97b-4c20-b916-4eba867c6306","resolution":{"observed_at":"2026-08-08T20:49:52.152215Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.139846Z","title":null,"venue":null,"work_id":"a4917525-6265-4967-a57f-2fa3e901cbf0","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.616140Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:0eb021d033a16422b7153ba281279c7bc3dc364b3541971e7d14ea5d5711e317","observation_id":"38d1a22a-a33d-44db-ba4c-2661f8c4c309","resolution":{"observed_at":"2026-08-08T20:49:52.143087Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.130252Z","title":"It’s like they have no empathy or think about what if it was them","venue":null,"work_id":"175dc859-fa5d-4cdd-aafa-2e31b766911a","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.619386Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:4d76c7f82263a45f73fcfa1128bfe32a5799536d61b27f49c6d1dd871f579622","observation_id":"b5e822e1-d806-478b-8b4b-35fbae1cd6b4","resolution":{"observed_at":"2026-08-08T20:49:52.133737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.121136Z","title":"Achievements and Self-Realization","venue":null,"work_id":"e04f2d07-f661-469d-af11-8c99b244806d","year":2025},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.622729Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:b949246106b168f70ac4cea95a738f543b70ee795d56ce22d21c362b2a893551","observation_id":"a4fdbe06-2545-46be-ba4a-060b3e34e4e4","resolution":{"observed_at":"2026-08-08T20:49:52.124516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.111845Z","title":null,"venue":null,"work_id":"20fced8d-e85e-432f-bfa5-b9f09c205f09","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.627132Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:5831f8173d05168d2da2d52cdb7a7461b0b7eb32195116f53e8e36b97384e604","observation_id":"40a52432-062e-4a44-a55c-1e18d064b5e9","resolution":{"observed_at":"2026-08-08T20:49:52.115094Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.102643Z","title":null,"venue":null,"work_id":"ca65daaf-e8ad-407f-9a16-bdba06b1f5ae","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.630499Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:80a918f34a6d1e3cf459368e0f1487a0f3a07e47fb957d0c99d62e2f6094878c","observation_id":"17733aba-a035-4fb3-bf77-9ad0bfc0205f","resolution":{"observed_at":"2026-08-08T20:49:52.105871Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.093625Z","title":null,"venue":null,"work_id":"5450e068-da53-4f31-ac2d-a6f9b8d63828","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.634207Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:5765680841ca4d9c271ea36e0e98ecf37c28083f116c701147bd1ca87c76e475","observation_id":"2be31d4b-7a47-4c47-a6bc-762fee5f8602","resolution":{"observed_at":"2026-08-08T20:49:52.096776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.084532Z","title":"Avg. Score","venue":null,"work_id":"cd383d24-6f00-4800-a4d3-6f8c5fd14c1f","year":2025},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.637772Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:2306ed8b0321a13eba665f8d8efeb94927fbbe8c7a2f0033549e6deeb7932c00","observation_id":"074d344d-e9e9-4799-8589-d15636c8c968","resolution":{"observed_at":"2026-08-08T20:49:52.087871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.075131Z","title":"As shown, the model’s performance peaks when the number of tokens reaches 16","venue":null,"work_id":"84d634c9-08b4-4bec-ab53-63654ad03efe","year":2025},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.641508Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:68d01dec9c8534430b9d5b3ac2c20700edf649815d5031303070d90c6ef60a5c","observation_id":"649fcae0-1cb1-4ad0-ae2c-4dfa1520ef2e","resolution":{"observed_at":"2026-08-08T20:49:52.078641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.066156Z","title":null,"venue":null,"work_id":"28b0083e-75b1-4102-a4b2-08472d94a90e","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.645210Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:d09c7e5b0bb1644780f3d12327ec673850f43cf284ad54e977535081b403fe7f","observation_id":"b7132b85-21e9-4e4d-bc31-2fe924d2828f","resolution":{"observed_at":"2026-08-08T20:49:52.069295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.056977Z","title":null,"venue":null,"work_id":"176b57a4-0956-4fb2-b545-66fc42ced02b","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.648662Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:20edd1ff430f68e5703055d85fbfa295243c1211bf506c9c91173b4aad5964bc","observation_id":"1daad0ad-245f-4243-a96b-e0ffdb572373","resolution":{"observed_at":"2026-08-08T20:49:52.060370Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.047604Z","title":null,"venue":null,"work_id":"bf9d1369-1806-491f-8855-78622790b794","year":2025},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.652248Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:e8310b16863ceea16a45642adbd2a93c1032a4195ab8f9a9fab00a0bf1a1ef7a","observation_id":"5b7a6db1-39ae-4259-b7e8-59f202305a64","resolution":{"observed_at":"2026-08-08T20:49:52.050814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.038205Z","title":null,"venue":null,"work_id":"695bdb57-2380-4c80-9ff2-946dad8a8d0f","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.655747Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:485cee3a5cdff1eb430c43acae5db1779cba8bdd11b5b0c1f14dadfba9e8761a","observation_id":"b7d9000f-65a5-4168-9fe4-edcb5fa5a0c0","resolution":{"observed_at":"2026-08-08T20:49:52.041555Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.028472Z","title":null,"venue":null,"work_id":"0d775db9-4bf7-4a26-a5f0-2307d375d466","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.659041Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:1ccff7bd31ae95e9386129dde2b84b00dce234fb6c26f9651de3f7101adf6503","observation_id":"f8f960a5-79f9-4072-b7d1-17889a6b1ee1","resolution":{"observed_at":"2026-08-08T20:49:52.031828Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.018458Z","title":"4.Goal to Response: Validate the speaker’s sense of relief and preparedness, acknowledging the stressful situation they avoided","venue":null,"work_id":"8bfba088-2d93-473d-8fad-6030f8edf4cb","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.662921Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:be4e66972e4025429f6579c9a3d088650b523a47a839581e5606bc03688e105b","observation_id":"76328e9c-ba14-44f1-b375-d964621910fd","resolution":{"observed_at":"2026-08-08T20:49:52.022313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.008542Z","title":null,"venue":null,"work_id":"8486cb22-8084-417c-aebd-b7784c3ecbbc","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.666565Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:399f30bedd3fc474c8020f33b0f233f67ab9ff04d6b27b6ce7aae20e4052cc8b","observation_id":"2dc9975c-9905-41f8-84f1-950c27fe3330","resolution":{"observed_at":"2026-08-08T20:49:52.011982Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.998230Z","title":null,"venue":null,"work_id":"52bbfc44-5fb4-4b62-9068-c5c1c0e73c65","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.670365Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:261a246a7936949bce4a329d3f28f547ea4cde0cc5bbf1587973b8563b9939c7","observation_id":"6b757b37-4780-49a9-8028-102a74959d60","resolution":{"observed_at":"2026-08-08T20:49:52.001767Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.988523Z","title":"4.Goal to Response: To provide empathy and acknowledge the speaker’s excitement and enjoyment of the trip","venue":null,"work_id":"3e3cbd94-e364-46b6-baf5-0a80364f840e","year":2025},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.673892Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:4081bd101ecf27ccd6ff64d1e671f6aff71bb059c7181cf174f8090c798e89e3","observation_id":"2540466f-e338-4f96-8906-664f4489e4e6","resolution":{"observed_at":"2026-08-08T20:49:51.992188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.978536Z","title":null,"venue":null,"work_id":"2e4e1acb-3b67-40be-818b-3d4769f4b61d","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.677229Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:9b2a9b33776f7c3f3125f9277bbf5ee3d4e6225aac3ea64dd8a5e1419ebb0486","observation_id":"a130b068-e74f-44ae-9ffe-0ac0e290fbd6","resolution":{"observed_at":"2026-08-08T20:49:51.982285Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.968891Z","title":null,"venue":null,"work_id":"686a25de-b194-4740-912e-f34e7443621f","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.680586Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:96121deb00faceed43554b4ed9c1b806c9e69dd34f69e87faa7a99ede110a03a","observation_id":"e92b5957-dfe8-4510-b368-284088896f31","resolution":{"observed_at":"2026-08-08T20:49:51.972365Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:51.958758Z","title":"4.Goal to Response: Offer empathy and validation for the speaker’s feelings, acknowledging the challenge of parenting and the importance of communication","venue":null,"work_id":"c2977e91-d59f-421c-a085-399a076cfee8","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.683856Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:ac18e33708a563bd8b01357291ea5abea341e49a537b4ecda20a572cba6bc1d8","observation_id":"83ef674b-50de-4c29-aee8-73302ef10a5e","resolution":{"observed_at":"2026-08-08T20:49:51.962545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-02T07:50:35.580500Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-08T20:49:51.543944Z","title":"arXiv preprint arXiv:2305.16355 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.543944Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:2b72e6ea5d31888e7a76efe4b556b27956c7cb9631adb10cbd728def711524d0","observation_id":"b6542455-5c43-442a-88bb-038ad27c90d1","resolution":{"observed_at":"2026-08-08T20:49:51.543944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T20:49:52.397859Z","title":"Proceedings of the Advances in neural information processing systems","venue":null,"work_id":"90cd1987-14f9-44f0-8331-29fa61ecbaff","year":null},"citing_paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T20:49:51.430540Z"},"links":{"citing_paper":"/paper/2502.04976"},"observation_digest":"sha256:225d86dbd0a0b854ccd85491749259eba121a1c30fcd945e622cd882e36512f4","observation_id":"84b2134c-7597-4a83-a21e-9fefb77419fd","resolution":{"observed_at":"2026-08-08T20:49:52.401199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.04976","last_updated":"2025-02-07T14:50:10Z","latest_version":1,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-08T20:42:47.770955Z","submitted_at":"2025-02-07T14:50:10Z","title":"Towards Multimodal Empathetic Response Generation: A Rich Text-Speech-Vision Avatar-based Benchmark"},"reference_resolution":{"displayed":81,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":4,"unresolved":62,"verified_exact":5,"verified_fuzzy":10},"total_outbound_references":81},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 81 of 81 outbound references and 3 inbound Pith citation observations for arXiv:2502.04976."}