{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:XDFWNYP3DVELQL5SOJAKZY3RIC","short_pith_number":"pith:XDFWNYP3","schema_version":"1.0","canonical_sha256":"b8cb66e1fb1d48b82fb27240ace371409b8feed96b8cd313026157589ab9a5bc","source":{"kind":"arxiv","id":"2412.02142","version":1},"attestation_state":"computed","paper":{"title":"Personalized Multimodal Large Language Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.IR"],"primary_cat":"cs.CV","authors_text":"Dang Nguyen, Franck Dernoncourt, Hanieh Deilamsalehy, Hanjia Lyu, Hongjie Chen, Huanrui Yang, Ishita Kumar, Jiebo Luo, Jiuxiang Gu, Joe Barrow, Julian McAuley, Junda Wu, Mehrnoosh Mirtaheri, Namyong Park, Nedim Lipka, Nesreen K. Ahmed, Ruiyi Zhang, Ryan A. Rossi, Subrata Mitra, Sungchul Kim, Tong Yu, Xiang Chen, Yue Zhao, Yu Wang, Yu Xia, Zhehao Zhang, Zhengmian Hu","submitted_at":"2024-12-03T03:59:03Z","abstract_excerpt":"Multimodal Large Language Models (MLLMs) have become increasingly important due to their state-of-the-art performance and ability to integrate multiple data modalities, such as text, images, and audio, to perform complex tasks with high accuracy. This paper presents a comprehensive survey on personalized multimodal large language models, focusing on their architecture, training methods, and applications. We propose an intuitive taxonomy for categorizing the techniques used to personalize MLLMs to individual users, and discuss the techniques accordingly. Furthermore, we discuss how such techniq"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2412.02142","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-12-03T03:59:03Z","cross_cats_sorted":["cs.AI","cs.CL","cs.IR"],"title_canon_sha256":"b77a21c4e2da8a61e74443d0c6da016f4462ed2474f1d02637996dbe6d9bbf99","abstract_canon_sha256":"f18f6f2146a3f9f4bf76308075f68a9f3a97d1eb53832da4335742667f271223"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:43:44.793483Z","signature_b64":"PoS4JguqRJ+IiwLzRTuvqfpFM+dJTmQaxdRjiuh5++h4DwU4smM5jnW/ay08ttyzqXzhdXI2bI35aOtzAZcJCQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"b8cb66e1fb1d48b82fb27240ace371409b8feed96b8cd313026157589ab9a5bc","last_reissued_at":"2026-07-05T09:43:44.792906Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:43:44.792906Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Personalized Multimodal Large Language Models: A Survey","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.IR"],"primary_cat":"cs.CV","authors_text":"Dang Nguyen, Franck Dernoncourt, Hanieh Deilamsalehy, Hanjia Lyu, Hongjie Chen, Huanrui Yang, Ishita Kumar, Jiebo Luo, Jiuxiang Gu, Joe Barrow, Julian McAuley, Junda Wu, Mehrnoosh Mirtaheri, Namyong Park, Nedim Lipka, Nesreen K. Ahmed, Ruiyi Zhang, Ryan A. Rossi, Subrata Mitra, Sungchul Kim, Tong Yu, Xiang Chen, Yue Zhao, Yu Wang, Yu Xia, Zhehao Zhang, Zhengmian Hu","submitted_at":"2024-12-03T03:59:03Z","abstract_excerpt":"Multimodal Large Language Models (MLLMs) have become increasingly important due to their state-of-the-art performance and ability to integrate multiple data modalities, such as text, images, and audio, to perform complex tasks with high accuracy. This paper presents a comprehensive survey on personalized multimodal large language models, focusing on their architecture, training methods, and applications. We propose an intuitive taxonomy for categorizing the techniques used to personalize MLLMs to individual users, and discuss the techniques accordingly. Furthermore, we discuss how such techniq"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.02142","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2412.02142/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2412.02142","created_at":"2026-07-05T09:43:44.792966+00:00"},{"alias_kind":"arxiv_version","alias_value":"2412.02142v1","created_at":"2026-07-05T09:43:44.792966+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.02142","created_at":"2026-07-05T09:43:44.792966+00:00"},{"alias_kind":"pith_short_12","alias_value":"XDFWNYP3DVEL","created_at":"2026-07-05T09:43:44.792966+00:00"},{"alias_kind":"pith_short_16","alias_value":"XDFWNYP3DVELQL5S","created_at":"2026-07-05T09:43:44.792966+00:00"},{"alias_kind":"pith_short_8","alias_value":"XDFWNYP3","created_at":"2026-07-05T09:43:44.792966+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.22741","citing_title":"GRADE: Graph Representation of LLM Agent Dependency and Execution","ref_index":113,"is_internal_anchor":false},{"citing_arxiv_id":"2605.28806","citing_title":"Personal Visual Memory from Explicit and Implicit Evidence","ref_index":27,"is_internal_anchor":false},{"citing_arxiv_id":"2603.26680","citing_title":"AlpsBench: An LLM Personalization Benchmark for Real-Dialogue Memorization and Preference Alignment","ref_index":51,"is_internal_anchor":false},{"citing_arxiv_id":"2604.13074","citing_title":"PersonaVLM: Long-Term Personalized Multimodal LLMs","ref_index":42,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12995","citing_title":"F-GRPO: Factorized Group-Relative Policy Optimization for Unified Candidate Generation and Ranking","ref_index":59,"is_internal_anchor":false},{"citing_arxiv_id":"2605.11169","citing_title":"OLIVIA: Online Learning via Inference-time Action Adaptation for Decision Making in LLM ReAct Agents","ref_index":78,"is_internal_anchor":false},{"citing_arxiv_id":"2605.08526","citing_title":"Skill-CMIB: Multimodal Agent Skill for Consistent Action via Conditional Multimodal Information Bottleneck","ref_index":73,"is_internal_anchor":false},{"citing_arxiv_id":"2605.02913","citing_title":"Generate, Filter, Control, Replay: A Comprehensive Survey of Rollout Strategies for LLM Reinforcement Learning","ref_index":135,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC","json":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC.json","graph_json":"https://pith.science/api/pith-number/XDFWNYP3DVELQL5SOJAKZY3RIC/graph.json","events_json":"https://pith.science/api/pith-number/XDFWNYP3DVELQL5SOJAKZY3RIC/events.json","paper":"https://pith.science/paper/XDFWNYP3"},"agent_actions":{"view_html":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC","download_json":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC.json","view_paper":"https://pith.science/paper/XDFWNYP3","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2412.02142&json=true","fetch_graph":"https://pith.science/api/pith-number/XDFWNYP3DVELQL5SOJAKZY3RIC/graph.json","fetch_events":"https://pith.science/api/pith-number/XDFWNYP3DVELQL5SOJAKZY3RIC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC/action/storage_attestation","attest_author":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC/action/author_attestation","sign_citation":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC/action/citation_signature","submit_replication":"https://pith.science/pith/XDFWNYP3DVELQL5SOJAKZY3RIC/action/replication_record"}},"created_at":"2026-07-05T09:43:44.792966+00:00","updated_at":"2026-07-05T09:43:44.792966+00:00"}