{"as_of":"2026-08-14T13:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0259afbe0061d767355ccb458d2bd06405a7efa0ba5f20aab858ffd245395a33","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:02:24.778729Z","state":"measured"},{"denominator":76,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":76,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:19:34.140857Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T13:55:53.243562Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02429","snapshot_observed_at":"2026-08-03T11:19:34.140857Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.06870","last_updated":"2026-05-24T17:00:03Z","snapshot_observed_at":"2026-08-14T04:47:09.382384Z","submitted_at":"2026-01-11T11:29:21Z","title":"QASA: Quality-Aware Semantic Augmentation for Robust Multimodal Sentiment Analysis","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T11:19:34.140857Z"},"links":{"cited_paper":"/paper/2508.02429","citing_paper":"/paper/2601.06870"},"observation_digest":"sha256:96410a6e4b23fcff56b708468f2dd7a784452b95361535b6e20d469e84f5484b","observation_id":"8b65755c-ea84-4a75-8437-4557e50e4303","resolution":{"observed_at":"2026-08-03T11:19:34.140857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"cited_work":{"arxiv_id":"2508.02429","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.02429","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multimodal large language models for end-to-end affective computing: Benchmarking and boosting with generative knowledge prompting","venue":null,"work_id":"a4695b16-2cd7-43bf-b923-39956af2848c","year":2025},"citing_paper":{"arxiv_id":"2604.00013","last_updated":"2026-04-12T03:30:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-03-10T12:48:41Z","title":"C2F-Thinker: Coarse-to-Fine Reasoning with Hint-Guided Reinforcement Learning for Multimodal Sentiment Analysis","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T13:51:40.334057Z"},"links":{"cited_paper":"/paper/2508.02429","citing_paper":"/paper/2604.00013"},"observation_digest":"sha256:e5ace3f55051621924ce6876f5b1013281b6673714e3c6cf781493e663bc7949","observation_id":"73165972-423e-47ac-9fdc-f2fb77c25237","resolution":{"observed_at":"2026-05-15T13:55:53.245819Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.02429/citation-record","integrity":"/paper/2508.02429/integrity","json":"/paper/2508.02429/citation-record.json","paper":"/paper/2508.02429"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.340081Z","title":"A review of affective computing: From unimodal analysis to multimodal fusion,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.340081Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:74c4ad3b4f7f7c196baddec66e70b4f0ce5b93d378feb8196f29456879f02058","observation_id":"97ea4dbf-5925-42e3-87e0-8cbc9aab1064","resolution":{"observed_at":"2026-08-06T05:02:24.340081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:31.405170Z","title":"A systematic review on affective computing: Emotion models, databases, and recent advances,","venue":null,"work_id":"d6f11035-1b9d-46f1-96dd-2d6dc22781f8","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.345319Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:774655a816ac9e6422730ca10313bbae3ffb282b40b8c742d7c79551cfe9a59c","observation_id":"11db27f3-e04a-4364-a9a2-a32fe4fb8e4a","resolution":{"observed_at":"2026-08-06T05:02:31.520898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:31.174721Z","title":"An effective data fusion methodology for multi-modal emotion recognition: A survey,","venue":null,"work_id":"a40c2b72-405b-4578-a9ff-314965953f2f","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.350453Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:9165ac9ce7fb1d419a1fd4651158466cec0a6a02702a6928bf68998d364f6a37","observation_id":"de78fbb7-3a1d-4f76-84a8-a9aca737d6bd","resolution":{"observed_at":"2026-08-06T05:02:31.232058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.355118Z","title":"Surveying the mllm landscape: A meta-review of current surveys,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.355118Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:77b1979f16aab2ffd45827a82fb5eb105295a1efb76732bf3234ef862b4d3c66","observation_id":"b7525118-6794-41e5-a078-930cd45e178b","resolution":{"observed_at":"2026-08-06T05:02:24.355118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:31.002154Z","title":"Learning by comparing: Boosting multi- modal affective computing through ordinal learning,","venue":null,"work_id":"5cac80ff-f5b4-4c95-a98f-ca75f7a0e477","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.359998Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:3d12161815a865fd83dbbaaddd90783d7c3c543ed5358b4fca2a2c2b180532d3","observation_id":"f1b077f7-53f5-49e0-b917-d81568e64559","resolution":{"observed_at":"2026-08-06T05:02:31.087023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.814165Z","title":"Llm-based nlg evaluation: Current status and challenges,","venue":null,"work_id":"b6c61c05-28cc-4029-9ac2-4beecf48bcfd","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.365403Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6b1af1c1ea3c484ca264e4485e8be2efad003204cf4d76590a68d11d341ff97e","observation_id":"e75fac92-5937-4d9f-99cf-2ab6992642da","resolution":{"observed_at":"2026-08-06T05:02:30.871599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-06T05:02:24.371526Z","title":"The dawn of lmms: Preliminary explorations with gpt-4v (ision),","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.371526Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:2a9ad01594cb04553dbe507703188673741ab4d58c8873bf8dd71d5cdeecec12","observation_id":"f3f1bbd2-9bca-4223-b3f0-c63677aba923","resolution":{"observed_at":"2026-08-06T05:02:24.371526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.637214Z","title":"Visual instruction tuning,","venue":null,"work_id":"d7256e8e-1135-41dc-b31b-a91a32487d6d","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.378442Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:259f5591d45042040cd8ae8c44eed85442da7858523c3af8f60e43773dce239d","observation_id":"81d76dc5-c191-4d76-9687-2d6e99d50007","resolution":{"observed_at":"2026-08-06T05:02:30.718937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T05:02:24.382903Z","title":"Gemini: a family of highly capable multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.382903Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:46d2fdb2df4e20158378ab9d6661107a30d15420f5359e4525749982fb9997ff","observation_id":"0fe48994-3171-4398-b5a2-43388ce28bca","resolution":{"observed_at":"2026-08-06T05:02:24.382903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.451460Z","title":"Qwen-vl: A versatile vision-language model for understanding, localization,","venue":null,"work_id":"0f805edb-6183-48b6-86d9-eb1cf6126486","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.388809Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:c2226c40f56e4acbfa1aeacd16f16e31af0c5e6440ead44cfcb63cf15fea06a6","observation_id":"bd611aaf-b1b6-4e25-96de-8140eb598eae","resolution":{"observed_at":"2026-08-06T05:02:30.529258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.335588Z","title":"A survey on multimodal large language models,","venue":null,"work_id":"b394c4f6-c78c-4d80-9276-82720307d569","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.394458Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:d6885f1fa81cee3019baa80d239a8d22b1978c9621bed839fdf96eb9109bd222","observation_id":"df5a41c4-2648-4435-a407-e74517b4513f","resolution":{"observed_at":"2026-08-06T05:02:30.385999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.13359","last_updated":"2024-09-20T09:44:51Z","snapshot_observed_at":"2026-08-12T22:41:08.967519Z","submitted_at":"2024-09-20T09:44:51Z","title":"EmotionQueen: A Benchmark for Evaluating Empathy of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.13359","snapshot_observed_at":"2026-08-06T05:02:24.399808Z","title":"Emotionqueen: A benchmark for evaluating empathy of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.399808Z"},"links":{"cited_paper":"/paper/2409.13359","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6ff2a9c1e4db97be0f359b8da7079bf31819c6c2ec1b851feddf184b55a54a37","observation_id":"b0d994dc-4d41-410e-91a1-54be9d9d8e9a","resolution":{"observed_at":"2026-08-06T05:02:24.399808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.405487Z","title":"Eemo-bench: A benchmark for multi-modal large lan- guage models on image evoked emotion assessment,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.405487Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6dc8440ae01dd2711fcdcfde321f780595955d64bfc8a221817527573f8730a9","observation_id":"54470714-89de-4455-97f4-f8f45267dceb","resolution":{"observed_at":"2026-08-06T05:02:24.405487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16427","last_updated":"2025-04-24T07:35:03Z","snapshot_observed_at":"2026-08-13T19:15:41.314885Z","submitted_at":"2025-04-23T05:25:13Z","title":"Can Large Language Models Help Multimodal Language Analysis? MMLA: A Comprehensive Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16427","snapshot_observed_at":"2026-08-06T05:02:24.412048Z","title":"Can large language models help multimodal language analysis? mmla: A comprehensive benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.412048Z"},"links":{"cited_paper":"/paper/2504.16427","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:b0a18c83f907fc8fab8afbaa026a8fe5955302f4b0d938f135115dbc7944cb3e","observation_id":"d1c5d6d0-bdc4-4b2a-8647-0b82c892956b","resolution":{"observed_at":"2026-08-06T05:02:24.412048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10179","last_updated":"2025-04-14T12:31:39Z","snapshot_observed_at":"2026-08-12T07:49:03.948967Z","submitted_at":"2025-04-14T12:31:39Z","title":"The Future of MLLM Prompting is Adaptive: A Comprehensive Experimental Evaluation of Prompt Engineering Methods for Robust Multimodal Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10179","snapshot_observed_at":"2026-08-06T05:02:24.417545Z","title":"The future of mllm prompting is adaptive: A comprehensive experimental evaluation of prompt engineering methods for robust multimodal performance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.417545Z"},"links":{"cited_paper":"/paper/2504.10179","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:f29103f2db13b6e0380b23e9c9e478f73095e1338925bf765aed30ff271d273c","observation_id":"42d0d87b-261b-41e3-8ed8-a2c60f5f6119","resolution":{"observed_at":"2026-08-06T05:02:24.417545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06259","last_updated":"2016-08-12T02:39:40Z","snapshot_observed_at":"2026-07-06T05:00:39.739374Z","submitted_at":"2016-06-20T19:23:53Z","title":"MOSI: Multimodal Corpus of Sentiment Intensity and Subjectivity Analysis in Online Opinion Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06259","snapshot_observed_at":"2026-08-06T05:02:24.423638Z","title":"Mosi: multimodal corpus of sentiment intensity and subjectivity analysis in online opinion videos,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.423638Z"},"links":{"cited_paper":"/paper/1606.06259","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:02bd1df74c9b06866f48816acc4a16960891ab858bef873c27eaf2275c9cf84c","observation_id":"b1b62d41-cbfa-452e-a7a0-e9afabb2e9b6","resolution":{"observed_at":"2026-08-06T05:02:24.423638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.165455Z","title":"Ch- sims: A chinese multimodal sentiment analysis dataset with fine-grained annotation of modality,","venue":null,"work_id":"fe4b4c01-3a5e-4ba9-8abc-8d615d814cd7","year":2020},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.429162Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6fca58068098551cba99093a2ade9d913ce9b5cccf00f23734967312ab6876aa","observation_id":"21db1851-7af0-41ee-ba55-5898ff420f84","resolution":{"observed_at":"2026-08-06T05:02:30.238274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:30.040368Z","title":"Make acoustic and visual cues matter: Ch-sims v2. 0 dataset and av-mixup consistent module,","venue":null,"work_id":"6aba8fee-5670-42f7-a76e-8b748ff76ac7","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.434158Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:169f200217e53291cb467bfba4ff9caf14ac8f8888f3170dcaff191a9244f92d","observation_id":"3309977f-1b35-4894-a074-94440234caa7","resolution":{"observed_at":"2026-08-06T05:02:30.092305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.02508","last_updated":"2019-06-04T12:33:49Z","snapshot_observed_at":"2026-08-09T15:41:11.041317Z","submitted_at":"2018-10-05T03:50:24Z","title":"MELD: A Multimodal Multi-Party Dataset for Emotion Recognition in Conversations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.02508","snapshot_observed_at":"2026-08-06T05:02:24.438791Z","title":"Meld: A multimodal multi-party dataset for emotion recognition in conversations,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.438791Z"},"links":{"cited_paper":"/paper/1810.02508","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:bc1bbe841cb5aff62afa31561008ae95582aa1b0d1ffdc102d271c03fa1eeebc","observation_id":"d915f76c-e091-4c4e-8496-012f69e9870b","resolution":{"observed_at":"2026-08-06T05:02:24.438791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.06618","last_updated":"2019-04-14T03:15:38Z","snapshot_observed_at":"2026-08-08T11:29:17.512292Z","submitted_at":"2019-04-14T03:15:38Z","title":"UR-FUNNY: A Multimodal Language Dataset for Understanding Humor","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.06618","snapshot_observed_at":"2026-08-06T05:02:24.443408Z","title":"Ur-funny: A multimodal language dataset for understanding humor,","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.443408Z"},"links":{"cited_paper":"/paper/1904.06618","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:7c18c29d3684c69bfac7e88ec6347682b40002863a3e3092d2ea721d17b3596d","observation_id":"0855267a-b265-4c1c-838b-74924086cff2","resolution":{"observed_at":"2026-08-06T05:02:24.443408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08387","last_updated":"2022-09-28T19:24:24Z","snapshot_observed_at":"2026-08-04T15:44:42.221453Z","submitted_at":"2021-10-15T21:58:03Z","title":"Generated Knowledge Prompting for Commonsense Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08387","snapshot_observed_at":"2026-08-06T05:02:24.447997Z","title":"Generated knowledge prompting for commonsense reasoning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.447997Z"},"links":{"cited_paper":"/paper/2110.08387","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:a689c1c9874ea448f843a8d57a05006d953a743ca121538f35903523482af8bd","observation_id":"fd73413d-c3a3-48cf-b9f0-4314da5146bc","resolution":{"observed_at":"2026-08-06T05:02:24.447997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.895417Z","title":"Self-attentive feature-level fusion for multimodal emotion detection,","venue":null,"work_id":"6672f833-92d4-46ff-9d75-f4a2dee95953","year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.452615Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:bab68af65ff0da3282841d69cf188090679178098a9e079e057ea307fa201cbc","observation_id":"8fc8751e-6fb9-4930-8744-859f0a979492","resolution":{"observed_at":"2026-08-06T05:02:29.971592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.781329Z","title":"Emotion recognition using feature-level fusion of facial expressions and body gestures,","venue":null,"work_id":"24931bd4-15d8-4a34-bbf8-0b0801f34afd","year":2019},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.457912Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:115fbee4d11ddeff7834c0a875796520e8787cbc0dcdd043b693f80425ee7681","observation_id":"adfaf75b-99c2-44bb-a848-01b9d6828b6c","resolution":{"observed_at":"2026-08-06T05:02:29.832233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.638629Z","title":"Decision-level fusion method for emotion recognition using multimodal emotion recog- nition information,","venue":null,"work_id":"38dd493d-6aff-400c-b4cf-3a7bea61689b","year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.463005Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:3d6b44d1e0f4e33510774d141841d54d92cc4fe730383cacc458fe23e8bc1290","observation_id":"090ae2fc-4055-4976-84ac-48158ff0fd74","resolution":{"observed_at":"2026-08-06T05:02:29.705955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.415210Z","title":"Deep learning-based late fusion of multi- modal information for emotion classification of music video,","venue":null,"work_id":"cfbda44e-ffb7-4bf4-b3dd-1f38b0cb5a64","year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.467810Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:dd2ca44fed0a5bb0ea961ea156eb95726fef8819b420cf8aeb7efc7442716550","observation_id":"1e10bca3-bf67-4ee0-9c05-2e71ca3b791f","resolution":{"observed_at":"2026-08-06T05:02:29.514991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.235743Z","title":"A joint cross-attention model for audio-visual fusion in dimensional emotion recognition,","venue":null,"work_id":"b6aacb6e-c702-464e-94ce-a4370552f547","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.472652Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:0bb6c33d7c676845509f924c1532d302f355d63e1dd46e9a608a27eeda0ad252","observation_id":"368a5029-19d1-4bcd-9ea0-746739f59219","resolution":{"observed_at":"2026-08-06T05:02:29.311160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:29.054036Z","title":"Speech emotion recognition with co-attention based multi-level acoustic information,","venue":null,"work_id":"846716a1-d030-46dd-9d34-610ef97063c9","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.476988Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:1e0e23b967f686e4b34653456dd14c8e6ec257ef50912c7407c5a8f604aa28a4","observation_id":"404f1533-fea9-4bfe-a18d-5545045a8f36","resolution":{"observed_at":"2026-08-06T05:02:29.122837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09502","last_updated":"2025-01-16T12:27:05Z","snapshot_observed_at":"2026-08-10T19:55:29.245089Z","submitted_at":"2025-01-16T12:27:05Z","title":"Omni-Emotion: Extending Video MLLM with Detailed Face and Audio Modeling for Multimodal Emotion Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09502","snapshot_observed_at":"2026-08-06T05:02:24.481438Z","title":"Omni-emotion: Extending video mllm with detailed face and audio modeling for multimodal emotion analysis,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.481438Z"},"links":{"cited_paper":"/paper/2501.09502","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6c5292df67ffa211dacba17b56e01a238a21ab32f15b9351a2644087cc9cd0af","observation_id":"b284676b-38d0-44fd-978f-2acca5ce5b4a","resolution":{"observed_at":"2026-08-06T05:02:24.481438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.21480","last_updated":"2025-03-28T12:34:25Z","snapshot_observed_at":"2026-08-07T16:32:56.614880Z","submitted_at":"2025-03-27T13:12:49Z","title":"OmniVox: Zero-Shot Emotion Recognition with Omni-LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.21480","snapshot_observed_at":"2026-08-06T05:02:24.486614Z","title":"Omnivox: Zero-shot emotion recognition with omni-llms,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.486614Z"},"links":{"cited_paper":"/paper/2503.21480","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:c3008679527c7a3cd1e9cd12cd91f261bd7bb6f81a43fd0db7fd991f0d3dc789","observation_id":"74964bcf-796f-4350-a856-84deb9c68674","resolution":{"observed_at":"2026-08-06T05:02:24.486614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.491839Z","title":"Mellm: Exploring llm-powered micro-expression understanding enhanced by subtle motion perception,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.491839Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:99b6c3a6cb79d7b2707b9b4831dc29221f3bca15031aac94f2c4462ae70177ad","observation_id":"a0fec81d-4e6d-40dc-9b2f-8d553f64eefc","resolution":{"observed_at":"2026-08-06T05:02:24.491839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.497289Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.497289Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:d20d47d49308e97de0d6128765c5db9bffc8cd8691c6df372393bebcbe24632c","observation_id":"a3f3bde7-2787-49c7-9fca-fcaec3ec39ca","resolution":{"observed_at":"2026-08-06T05:02:24.497289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.851874Z","title":"Videomae: Masked autoen- coders are data-efficient learners for self-supervised video pre-training,","venue":null,"work_id":"c36ca630-80af-4298-8eae-143ba6e10d94","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.504123Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:cc1edd0f1f886d84e9053ea84c096c1facbbaae554fb3181bccfa1c35d521e91","observation_id":"c35e7560-2238-4b01-b812-b28bcbea21f0","resolution":{"observed_at":"2026-08-06T05:02:28.930253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.09058","last_updated":"2022-12-18T10:41:55Z","snapshot_observed_at":"2026-08-13T23:08:38.852972Z","submitted_at":"2022-12-18T10:41:55Z","title":"BEATs: Audio Pre-Training with Acoustic Tokenizers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.09058","snapshot_observed_at":"2026-08-06T05:02:24.509860Z","title":"Beats: Audio pre-training with acoustic tokenizers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.509860Z"},"links":{"cited_paper":"/paper/2212.09058","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:094baf0e5743a81b7334b70606ce32b64ce969a8de1ce5da0f8ca6fbbed5f28d","observation_id":"d32b479c-3c7f-4f03-9026-72d988877b7b","resolution":{"observed_at":"2026-08-06T05:02:24.509860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.516633Z","title":"Blip-2: Bootstrapping language- image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.516633Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:b254fe3a8e1a33b8ca47a50233821c97d0172d5b4e69a3e91d8b8d53f763379b","observation_id":"c7731c3b-89bc-49ca-a089-6d1ee0720fdf","resolution":{"observed_at":"2026-08-06T05:02:24.516633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13289","last_updated":"2024-04-08T06:12:52Z","snapshot_observed_at":"2026-08-14T05:30:13.223510Z","submitted_at":"2023-10-20T05:41:57Z","title":"SALMONN: Towards Generic Hearing Abilities for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13289","snapshot_observed_at":"2026-08-06T05:02:24.523176Z","title":"Salmonn: Towards generic hearing abilities for large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.523176Z"},"links":{"cited_paper":"/paper/2310.13289","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:2b96cae0dc18f4a8e7f7d86de583c5b5a98a540c302e80e9577b73a97fb0630f","observation_id":"20b4fd2d-8357-4fa8-905d-821aa6e42340","resolution":{"observed_at":"2026-08-06T05:02:24.523176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07919","last_updated":"2023-12-21T10:20:42Z","snapshot_observed_at":"2026-08-07T10:17:55.688598Z","submitted_at":"2023-11-14T05:34:50Z","title":"Qwen-Audio: Advancing Universal Audio Understanding via Unified Large-Scale Audio-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07919","snapshot_observed_at":"2026-08-06T05:02:24.529880Z","title":"Qwen-audio: Advancing universal audio understanding via unified large-scale audio-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.529880Z"},"links":{"cited_paper":"/paper/2311.07919","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:62f65f51b166b27cf1b635b68d3861c3f7622833c4283cabcd26d5bef289ed55","observation_id":"5af11d9b-7bd0-4ea7-ac40-7c30cab0911d","resolution":{"observed_at":"2026-08-06T05:02:24.529880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T05:02:24.535612Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.535612Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:74dd26590c620ed9d5753424d0e00f89a569bec6d39c3553bceac462686d0530","observation_id":"11f2de67-3088-49d6-8256-7b9f687d8eef","resolution":{"observed_at":"2026-08-06T05:02:24.535612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15111","last_updated":"2025-01-25T07:26:37Z","snapshot_observed_at":"2026-08-13T14:25:54.211530Z","submitted_at":"2025-01-25T07:26:37Z","title":"HumanOmni: A Large Vision-Speech Language Model for Human-Centric Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15111","snapshot_observed_at":"2026-08-06T05:02:24.540778Z","title":"Humanomni: A large vision-speech language model for human-centric video understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.540778Z"},"links":{"cited_paper":"/paper/2501.15111","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:0c9648b97801fa4c8865e6ec29f3e05a19de85a1064c987e90573fbeeda6683a","observation_id":"fa56c0e6-2f13-4c61-8dc4-f259ad81b243","resolution":{"observed_at":"2026-08-06T05:02:24.540778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.694130Z","title":"Ola: Pushing the frontiers of omni-modal language model with progressive modality alignment,","venue":null,"work_id":"bd414612-eb2e-45f6-ae39-6ad33ff06bb3","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.548636Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:f7572e366eb335c488f3998bbf4a7da88d588d2ee2eae619e7a2e5506a4511d7","observation_id":"a779eae7-fa98-4831-9eb1-a1dd5b7829b9","resolution":{"observed_at":"2026-08-06T05:02:28.768680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-06T05:02:24.555547Z","title":"Qwen2. 5-omni technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.555547Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:e80a9b734ae587b920a3d3bb0a8354a032608e47eface53e7e6b4cf3c6a1b750","observation_id":"ce2dff1b-3623-49ca-8b58-96642e13d7f8","resolution":{"observed_at":"2026-08-06T05:02:24.555547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.546493Z","title":"Learning emotional prompt features with multiple views for visual emotion analysis,","venue":null,"work_id":"f2d34a86-b8c9-4cc6-8b85-c69b90de77bd","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.563409Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:9948662fccf6bd90aee6d8918b064581e6e599ce12f7a5603ec3358c4700d3e2","observation_id":"23714ce4-ca41-49be-a199-fdb7fe05d0c0","resolution":{"observed_at":"2026-08-06T05:02:28.612232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.406192Z","title":"Visual and textual prompts in vllms for enhancing emotion recognition,","venue":null,"work_id":"be44786c-ca73-4200-812a-9c5b418a12c4","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.570432Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:e3aa65a294ce2f08bab7a4a23803afcd905df9aba8156738b295ef11601b54ed","observation_id":"fd4ab5fb-87cc-402c-988d-3457955a13c0","resolution":{"observed_at":"2026-08-06T05:02:28.478909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.227607Z","title":"Multimodal language analysis in the wild: Cmu-mosei dataset and interpretable dynamic fusion graph,","venue":null,"work_id":"2f409388-4f39-4f8d-ada1-49550f7f286f","year":2018},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.578864Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:44b6ff213efb4939e5f04c03d42da45a93c0cd6e3ec7d0c13908ae13519e1b48","observation_id":"86ed16c1-d44c-4cd9-80cf-0b421f060ff1","resolution":{"observed_at":"2026-08-06T05:02:28.328838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07476","last_updated":"2024-10-30T06:49:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-11T17:22:23Z","title":"VideoLLaMA 2: Advancing Spatial-Temporal Modeling and Audio Understanding in Video-LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07476","snapshot_observed_at":"2026-08-06T05:02:24.586681Z","title":"Videollama 2: Advancing spatial- temporal modeling and audio understanding in video-llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.586681Z"},"links":{"cited_paper":"/paper/2406.07476","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:4c684343c64bf48deb4d6efeb1c3a17db234763aa5f689a4d10f9608cb1c51c4","observation_id":"b4ec7c38-d45f-40db-9361-da55708317ab","resolution":{"observed_at":"2026-08-06T05:02:24.586681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:28.067368Z","title":"Emotion-llama: Multimodal emotion recognition and reasoning with instruction tuning,","venue":null,"work_id":"cc017601-330f-49e3-bb3d-c63dda61ab1b","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.593485Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:1b3df454524e196f9b5d9c2555fd221fd5edab84758748e51ad36f06c7dedc99","observation_id":"0dd638df-6b46-4131-9a35-4098b317b9dd","resolution":{"observed_at":"2026-08-06T05:02:28.130166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16355","last_updated":"2023-05-25T04:16:07Z","snapshot_observed_at":"2026-08-14T10:09:12.476133Z","submitted_at":"2023-05-25T04:16:07Z","title":"PandaGPT: One Model To Instruction-Follow Them All","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16355","snapshot_observed_at":"2026-08-06T05:02:24.597936Z","title":"Pandagpt: One model to instruction-follow them all,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.597936Z"},"links":{"cited_paper":"/paper/2305.16355","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:09e0110dd0180634b1effb5893db9ffef4c05f3918e7fcdfeba99ec28d25a8d1","observation_id":"a138cafe-fb39-4808-a7e6-ba7c95b95a7d","resolution":{"observed_at":"2026-08-06T05:02:24.597936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.908707Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":"3c4733cc-aaa8-440e-8c05-0615469e9b77","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.602861Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:b4776ccd7d0d9831bb903dd33ecc7219517eab01f00f4441cb40f54d6b165f66","observation_id":"42933506-5da1-4470-bf52-7a1a9093cb09","resolution":{"observed_at":"2026-08-06T05:02:27.979157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.760550Z","title":"Multimodal information bottleneck: Learning minimal sufficient unimodal and multimodal representations,","venue":null,"work_id":"a7144eee-128b-444a-87ca-506e131cb475","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.608419Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:2ac46c388805bcfa44dfe15714b2c7a24d45e8a057656d9fd962abe42984ce72","observation_id":"23935ab7-5e3e-4cd0-bf5e-dfdfc236d63f","resolution":{"observed_at":"2026-08-06T05:02:27.838128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.625525Z","title":"Injecting multimodal informa- tion into pre-trained language model for multimodal sentiment analysis,","venue":null,"work_id":"c9228c4d-7f13-4c89-ac5a-ac7d4e08403a","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.614031Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:886a281b0ab7a3dc3fa2d88b61520d53d1e141481faae50808495e17be29857a","observation_id":"f4ade031-da1b-491c-a62b-695a1d283a13","resolution":{"observed_at":"2026-08-06T05:02:27.684303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12151","last_updated":"2025-07-07T16:31:28Z","snapshot_observed_at":"2026-08-07T16:01:45.484833Z","submitted_at":"2025-04-16T15:00:06Z","title":"Towards Explainable Fusion and Balanced Learning in Multimodal Sentiment Analysis","version":2},"cited_work":{"arxiv_id":"2504.12151","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.12151","snapshot_observed_at":"2026-08-06T05:02:25.025404Z","title":"Towards Explainable Fusion and Balanced Learning in Multimodal Sentiment Analysis","venue":"cs.LG","work_id":"fda9e7ed-97f2-48fa-85a5-abf7385b32f3","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.619395Z"},"links":{"cited_paper":"/paper/2504.12151","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:59a3d08233a3b5f75a5a22c423368c2bc693520aae2de0830ca7900c825b08c2","observation_id":"9364ce03-6343-4e38-8aba-e1f5a2243737","resolution":{"observed_at":"2026-08-06T05:02:25.031605Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.444695Z","title":"Hgtfm: Hierarchical gating-driven transformer fusion model for robust multimodal sentiment analysis,","venue":null,"work_id":"d2bd4f68-26bd-48c1-aed8-a91a3dce28a2","year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.624420Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:df67c8d5a88d97fb777eeb51df609d4907337ab1b4f1720c064944a97952b09e","observation_id":"07d8b9bb-8567-4c82-b9d9-4716b492c995","resolution":{"observed_at":"2026-08-06T05:02:27.533321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07694","last_updated":"2024-08-14T17:50:27Z","snapshot_observed_at":"2026-08-12T23:03:33.846686Z","submitted_at":"2024-08-14T17:50:27Z","title":"End-to-end Semantic-centric Video-based Multimodal Affective Computing","version":1},"cited_work":{"arxiv_id":"2408.07694","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07694","snapshot_observed_at":"2026-08-06T05:02:24.990661Z","title":"End-to-end Semantic-centric Video-based Multimodal Affective Computing","venue":"cs.CV","work_id":"87ef4319-60e3-4ff7-9114-3442b9425d8d","year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.630238Z"},"links":{"cited_paper":"/paper/2408.07694","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:4c4b9c79a76d07ee42f0b2aeccaf74b4a53a3a45e2942ab55b3dc7f6e4472b3f","observation_id":"19298fd8-686c-4506-ab67-daa8ca63f8cf","resolution":{"observed_at":"2026-08-06T05:02:24.999298Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-06T05:02:24.635326Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.635326Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:c616e97665995659df7633489bde4200538d289ec83c7ea66be262e29a4bcd53","observation_id":"721e03b3-f413-49f6-b0d5-41838fea01f9","resolution":{"observed_at":"2026-08-06T05:02:24.635326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T05:02:24.641304Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.641304Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:48d346421655d3007271d41758f36435ca5937c84067bfa7ac6887a562c79123","observation_id":"50dd4fc4-8c65-4259-999c-7920a4cd450d","resolution":{"observed_at":"2026-08-06T05:02:24.641304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.271472Z","title":"Divide, conquer and combine: Hierarchical feature fusion network with local and global perspectives for multimodal affective computing,","venue":null,"work_id":"4ff0d20c-013e-479c-8b3c-8e476ad59cf5","year":2019},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.647280Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:f0fc265069a8adbe10977dd56d5efc5ba8a3b74c56bb9525414bb327e8a12b96","observation_id":"ef9dcab4-4f63-40a7-a256-d0d59273805d","resolution":{"observed_at":"2026-08-06T05:02:27.338026Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T05:02:24.652010Z","title":"Qwen2. 5-coder technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.652010Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:376bb26d75ade06f1f23018510f4c4b794bb2c11e9ecac11a971174794fd3f7d","observation_id":"e1fd8b1b-21fa-48b1-9fa3-0f4edd6ef6ae","resolution":{"observed_at":"2026-08-06T05:02:24.652010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.657476Z","title":"Robust speech recognition via large-scale weak supervi- sion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.657476Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:7dc12e1d700d7a00369e200a42f4bc7dac422f8a9e759a4efea42564e70ad3ad","observation_id":"85140fb3-e5f7-4992-910b-cca5bdd125be","resolution":{"observed_at":"2026-08-06T05:02:24.657476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T05:02:24.671751Z","title":"Qwen2. 5-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.671751Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:cb2e353ffa8424b72ad1e825a86ea39bad1f6668e78790a95bbc76327bd27840","observation_id":"8c2e31f1-ad87-48ef-89f8-083ee16eb6b6","resolution":{"observed_at":"2026-08-06T05:02:24.671751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:27.085378Z","title":"A survey on vision transformer,","venue":null,"work_id":"218dd95b-df5d-4389-b4d9-3c5e0d44772e","year":2022},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.677944Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:9e11c3241d25def4aadeeefd258893fbf9d0455a9d409684d4e642e13fbd8cf6","observation_id":"4f549136-c179-4339-8972-b9a90ce551b8","resolution":{"observed_at":"2026-08-06T05:02:27.174956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.933098Z","title":"Sigmoid loss for language image pre-training,","venue":null,"work_id":"84e41651-517d-4b21-b9c3-3c01faff363c","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.683813Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:25633d88b5ec345c39d62bfc82e382dc6127e663088d687f84f11bfc1da0c73a","observation_id":"4e5f5b46-67cf-4e38-9266-19f98ad5916a","resolution":{"observed_at":"2026-08-06T05:02:27.008775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-06T05:02:24.688796Z","title":"Llava-onevision: Easy visual task transfer,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.688796Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:5001a8c45971f07b9a94d07d66666e9892b7091d8997bef9acb11d4de39a4205","observation_id":"8b1132f2-adf1-4797-9d46-f0ba22dcad40","resolution":{"observed_at":"2026-08-06T05:02:24.688796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12961","last_updated":"2025-02-27T06:09:46Z","snapshot_observed_at":"2026-08-12T22:41:32.229292Z","submitted_at":"2024-09-19T17:59:51Z","title":"Oryx MLLM: On-Demand Spatial-Temporal Understanding at Arbitrary Resolution","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12961","snapshot_observed_at":"2026-08-06T05:02:24.696608Z","title":"Oryx mllm: On- demand spatial-temporal understanding at arbitrary resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.696608Z"},"links":{"cited_paper":"/paper/2409.12961","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:4261debbe4c9b5ac161317af6015964b56da34033eb78f5bff28ea685c7f201d","observation_id":"b95fbbae-b9c3-43f3-8cf9-7f2c29168dbd","resolution":{"observed_at":"2026-08-06T05:02:24.696608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T05:02:24.703321Z","title":"Qwen2 technical report,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.703321Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:4d1fc3b322725ded26ce2c6518fa75feafa3091de05f1275199fabb3a110e4ea","observation_id":"39714fe6-3995-4275-b61f-95aee8211602","resolution":{"observed_at":"2026-08-06T05:02:24.703321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.743653Z","title":"Imagebind: One embedding space to bind them all,","venue":null,"work_id":"755d2f63-c296-4a50-ba8e-b7120d2dfccc","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.710416Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:758729144d4bf30c4d41f5c0c7553ca80ab70160cf6dd05f7785c268e03f69df","observation_id":"5548e265-db02-49f1-82f6-2416ffd59237","resolution":{"observed_at":"2026-08-06T05:02:26.848544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:24.717254Z","title":"Hubert: Self-supervised speech representation learning by masked prediction of hidden units,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.717254Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:f51cacc1b1b0374c12adc1d3844e825630618c49dd4736f8b605f9dc9fd5be24","observation_id":"3fa0f8c0-2f9e-4206-a2a3-56bda65f93b1","resolution":{"observed_at":"2026-08-06T05:02:24.717254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.503615Z","title":"Mae-dfer: Efficient masked au- toencoder for self-supervised dynamic facial expression recognition,","venue":null,"work_id":"0faaf1ff-cdfc-46b9-b1dd-fc42335a37f2","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.723159Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:9f19a5b0aafd5500312d22535b25bde098015c8eee740d50ee525c3cf9404698","observation_id":"263337ce-aea8-41fb-9da2-b727ba36fc0d","resolution":{"observed_at":"2026-08-06T05:02:26.617560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.297250Z","title":"Eva: Exploring the limits of masked visual representation learning at scale,","venue":null,"work_id":"ad9e0d6e-c2fe-44cd-b761-4a781b960e25","year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.730210Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:6f202f8d5461a1ab7677c77fa873eaf4436c37beeb7d8dcf7d9e266e3cf480ea","observation_id":"0b18373b-846d-452e-9c72-040a0914caa9","resolution":{"observed_at":"2026-08-06T05:02:26.349226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T05:02:24.737622Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.737622Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:ee3bbf29b6eeef910cdee1d472ffeff56e9fd64863acc964fd43de5c0e5a8aff","observation_id":"74da8b45-edc1-4c74-897f-a14243688431","resolution":{"observed_at":"2026-08-06T05:02:24.737622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:26.123451Z","title":null,"venue":null,"work_id":"a50aec2f-5051-44f0-9f1d-6d5235cf1d3a","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.743337Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:34837f798758170a3a801efd08d1a00a5fa14f549a4c9cd2eb6a5a5fe5154f2a","observation_id":"cde85087-202c-4242-87b8-d29ff4cbc18a","resolution":{"observed_at":"2026-08-06T05:02:26.217538Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.932857Z","title":null,"venue":null,"work_id":"85ef9f4f-fcd4-4687-b221-57451b30fca4","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.755334Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:309ec2d37c186204f5bdc726fd84888c7eda9c6f170f29cef3fe12f08d53e045","observation_id":"917be28d-0b19-4dab-b624-cd745e496966","resolution":{"observed_at":"2026-08-06T05:02:26.031375Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.851001Z","title":null,"venue":null,"work_id":"af581acf-f8d9-4d89-b43c-4b4332d51af1","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.762492Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:3560b6dea934a467a846b68150d561989c20e19a733ae92eceb66ac44e8853ae","observation_id":"311dbcf4-fc63-4d0f-8ad0-e80cfbc0cb9b","resolution":{"observed_at":"2026-08-06T05:02:25.873698Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.810949Z","title":null,"venue":null,"work_id":"e4f4f239-720c-476d-ab58-ba01bd774b14","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.768191Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:d843705f4019c9f2771a98794dd28d17ebb8a9d037dede735a4b87bab087f786","observation_id":"abe15f6e-c07c-4049-80bb-ed134b901b3a","resolution":{"observed_at":"2026-08-06T05:02:25.826168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.773032Z","title":"Its core architecture follows the Thinker-Talker design","venue":null,"work_id":"36866562-2374-4d34-a9cc-74b7d4875f1d","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.773095Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:1769abe454cb61d0530eda6d0f5d38dd9e8542b234d1e51c41b8bd103e02eb52","observation_id":"99597bf0-f020-44c7-84c0-680b7b5a62ee","resolution":{"observed_at":"2026-08-06T05:02:25.786279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T05:02:25.731653Z","title":"Its key innovation lies in the ability to simultaneously process visual and speech information in human-centric scenes","venue":null,"work_id":"afefdd27-0493-46b5-b76a-f5b0889a8109","year":null},"citing_paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T05:02:24.778729Z"},"links":{"citing_paper":"/paper/2508.02429"},"observation_digest":"sha256:bdcd7d58b7212ce6232560cf0bfbea826f2d17cc04a307479b40d52c8632d604","observation_id":"27a231c1-e83b-44f8-b2fd-748b9bd889d0","resolution":{"observed_at":"2026-08-06T05:02:25.746097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.02429","last_updated":"2025-08-04T13:49:03Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-13T14:46:52.603763Z","submitted_at":"2025-08-04T13:49:03Z","title":"Multimodal Large Language Models for End-to-End Affective Computing: Benchmarking and Boosting with Generative Knowledge Prompting"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 2 inbound Pith citation observations for arXiv:2508.02429."}