{"as_of":"2026-08-14T12:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b213effb3548fa9d4998be30c1cd996c6f20a556e17999cb5595ead4d7135909","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:16:58.754447Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:46:34.401485Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T12:45:52.393487Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03665","snapshot_observed_at":"2026-08-07T14:46:34.401485Z","title":"Personalizing multimodal large language models for image captioning: an experimental analysis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17768","last_updated":"2025-07-20T01:08:18Z","snapshot_observed_at":"2026-08-07T22:16:16.984171Z","submitted_at":"2025-05-23T11:41:26Z","title":"R-Genie: Reasoning-Guided Generative Image Editing","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:46:34.401485Z"},"links":{"cited_paper":"/paper/2412.03665","citing_paper":"/paper/2505.17768"},"observation_digest":"sha256:c42d71e154ba15c93cbbcf265703ca0359d570fbb9840db2177a949e651f613b","observation_id":"cf8fdaf7-4fae-4a8c-bbdb-27597834ea0e","resolution":{"observed_at":"2026-08-07T14:46:34.401485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"cited_work":{"arxiv_id":"2412.03665","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.03665","snapshot_observed_at":"2026-08-07T12:45:52.393487Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","venue":"cs.CV","work_id":"295c9fb1-d9c1-452b-a8d2-b1d46de1401b","year":2024},"citing_paper":{"arxiv_id":"2505.23693","last_updated":"2025-05-29T17:31:13Z","snapshot_observed_at":"2026-08-12T14:38:08.894823Z","submitted_at":"2025-05-29T17:31:13Z","title":"VF-Eval: Evaluating Multimodal LLMs for Generating Feedback on AIGC Videos","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:45:44.316344Z"},"links":{"cited_paper":"/paper/2412.03665","citing_paper":"/paper/2505.23693"},"observation_digest":"sha256:e3a603824e6e563112ccc705e17b853832a811cecc3d8c3bac3b365a80a77c78","observation_id":"939add0e-cde7-4d97-a8f7-4d8a88594e64","resolution":{"observed_at":"2026-08-07T12:45:52.476729Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.03665/citation-record","integrity":"/paper/2412.03665/integrity","json":"/paper/2412.03665/citation-record.json","paper":"/paper/2412.03665"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T22:16:58.573484Z","title":"arXiv preprint arXiv:2303.08774 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.573484Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:0effef65517c4bc1d8f063b66501b575fb0a0a7365c96cd139dd0d4004ecd139","observation_id":"88aff19c-47dd-4379-b481-3392b6cf10ce","resolution":{"observed_at":"2026-08-11T22:16:58.573484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.233699Z","title":"In: ICCV (2019) Personalizing Multimodal Large Language Models for Image Captioning 15","venue":null,"work_id":"289a299d-302b-4568-8ac6-fa91c1b5648c","year":2019},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.577275Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:ddba3bb661b24c00261b6ba2d4cd1352e894b1401960c2392de8f1d085db66d0","observation_id":"0f5c1fa7-5043-4211-b46d-1a118c9f3d00","resolution":{"observed_at":"2026-08-11T22:16:59.237009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.580202Z","title":"In: NeurIPS (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.580202Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:f3d914b564b083ce9b3af619b4c5fa98cc82f8efd7c1c381e0b107d881a5be7c","observation_id":"910e4384-33dd-4150-8624-aacdd8ee9700","resolution":{"observed_at":"2026-08-11T22:16:58.580202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.222449Z","title":"In: ECCV (2016)","venue":null,"work_id":"7a6ae9ed-b449-439a-8e1d-87ed44ff762d","year":2016},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.583048Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:b2d0554841adc0b8f84465b513a15866e7e9a0cca6e81f73c88f68c5fb3d6d20","observation_id":"cd854f97-112a-43e4-bc44-a205ad45c790","resolution":{"observed_at":"2026-08-11T22:16:59.225309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.586122Z","title":"In: CVPR (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.586122Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:c5574ff6ecbec293f8662a29274b5da89de1e7bf73c58e77c8f124074697cd40","observation_id":"3764e77d-439e-4868-a124-38ade9500983","resolution":{"observed_at":"2026-08-11T22:16:58.586122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T22:16:58.588905Z","title":"arXiv preprint arXiv:2312.11805 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.588905Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:fef90baa5a63ff9987a7bfe4773d75704b7b67f2f70dd38b418c6171fad9775f","observation_id":"e4f7a5e1-d867-4d2d-8453-68ea91ec47f0","resolution":{"observed_at":"2026-08-11T22:16:58.588905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01390","snapshot_observed_at":"2026-08-11T22:16:58.592925Z","title":"arXiv preprint arXiv:2308.01390 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.592925Z"},"links":{"cited_paper":"/paper/2308.01390","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:f6dcf6b8ebc6791aadc10e478ba9a07fed176e1255c27d0ff5ffc1c3c121af5e","observation_id":"995aa4ff-f4a5-4a0e-9190-2ec5bfeba01b","resolution":{"observed_at":"2026-08-11T22:16:58.592925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-11T22:16:58.595888Z","title":"arXiv preprint arXiv:2308.12966 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.595888Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:d4f934b2d0d3f8d8ea376596c48978bb24b25b70884e4a06ab3df9cc9e58d52e","observation_id":"3e3cabb5-00f7-43b4-a5e7-175db1906366","resolution":{"observed_at":"2026-08-11T22:16:58.595888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.210045Z","title":"In: ACL Workshops (2005)","venue":null,"work_id":"a7b7bd15-0a3a-4ba2-9751-50898b911c4c","year":2005},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.598756Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:1a0fea5d07d42ba301f73f679d2d830cd7ec7fd9da6693d68320b388df7e84bb","observation_id":"6ebf49cd-7a18-4a18-8b92-a1d61af78b4b","resolution":{"observed_at":"2026-08-11T22:16:59.213666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.202252Z","title":"In: CVPR Workshops (2022)","venue":null,"work_id":"9f829390-53f7-4bd0-b0e4-97b22e3cbd64","year":2022},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.601296Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:4e04c3620c42a7918c527e428db8950e554ec4339eb026126e865ea54d9ebd46","observation_id":"5754b34e-a594-4334-81a8-3065d9f07345","resolution":{"observed_at":"2026-08-11T22:16:59.205384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.194987Z","title":"In: ICCV (2023)","venue":null,"work_id":"3ac30896-d7cd-4e39-8bd8-f9a61ddb1336","year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.603791Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:c8aa980850c521e0f31f64025edf0aa677bc4f704691bb9ba4beca114cc4f838","observation_id":"86e52088-6dd4-419b-aeb1-4ab6bba63b3e","resolution":{"observed_at":"2026-08-11T22:16:59.197621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.187767Z","title":"In: NeurIPS (2020)","venue":null,"work_id":"16c16c99-6bf1-4fe1-b003-d04537221c36","year":2020},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.606382Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:8be81e5a1d3764008c412dad42a290b70aa4650b08bbdcb84243dae990a4e34f","observation_id":"cc4d6944-e606-463d-a5e6-d9b7746791d3","resolution":{"observed_at":"2026-08-11T22:16:59.190462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.180357Z","title":"In: ACL Findings (2024)","venue":null,"work_id":"a9d6df0d-c9eb-4ee4-96ee-234e2eba92ca","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.609023Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:7798993f4a5df1b46c0a57e438f2a711fa285add0461e76c04185e1feef7bc94","observation_id":"35e36477-59b0-4780-b077-34a7af105be3","resolution":{"observed_at":"2026-08-11T22:16:59.183321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.172836Z","title":"In: CVPR Workshops (2024)","venue":null,"work_id":"2778146b-fd7b-43e5-8120-939d9cd1253e","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.611471Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:4d4c69012d446aa583f00fe5788499b253e68a857a6d090d328ad0a4b8db47c6","observation_id":"2138525e-80f8-4c82-8cb0-8042c9a11ded","resolution":{"observed_at":"2026-08-11T22:16:59.175666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.165522Z","title":"In: CVPR (2024)","venue":null,"work_id":"a938ba47-94b6-47eb-a674-3aab8777b28f","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.613997Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:df351c905255678e8d055f6ba5b686199c3cb7efed82bdb7885ef5af7a0300f1","observation_id":"8a1b7b9c-7d17-479a-af75-df22f09efc9a","resolution":{"observed_at":"2026-08-11T22:16:59.168134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-11T22:16:58.616899Z","title":"arXiv preprint arXiv:2310.09478 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.616899Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:9a426616468b90d5850e5abaed43137223630e20133a39fb8300ec3d5adc65e4","observation_id":"a2bf7dea-865d-4ee1-9603-7fe25d30cfbc","resolution":{"observed_at":"2026-08-11T22:16:58.616899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.619616Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.619616Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:cc6b070ecade09fc1e842110b683319c0156737820ae7d50490ab42fd3924866","observation_id":"2151e4eb-b94b-46c7-befc-d70bd9392107","resolution":{"observed_at":"2026-08-11T22:16:58.619616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.154596Z","title":"In: NAACL (2022)","venue":null,"work_id":"7741587b-0704-4b3a-8d86-da5780fe1fa6","year":2022},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.621926Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:3d61a88de013b7d0e9bad0b93e09ad1620b5a8fedf6d4cab7cb555b8f71b5235","observation_id":"88470436-b342-4621-82b2-bf6a7ebf575a","resolution":{"observed_at":"2026-08-11T22:16:59.157081Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.147566Z","title":"In: ICRA (2020)","venue":null,"work_id":"402d0d7a-0809-4407-8402-07e6d55abcae","year":2020},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.624419Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:6a44437a7dc3e8ee8a8711b945eb4bc86412643310e6b245a11c3fbcfadc463e","observation_id":"d2582b90-0d09-4e29-86c2-5f976391ca3f","resolution":{"observed_at":"2026-08-11T22:16:59.150266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.140320Z","title":"AI Communications35(2), 111–129 (2022) 16 D","venue":null,"work_id":"444a041f-44c2-4e9d-848e-82347cad6669","year":2022},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.626806Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:a36da12ae7644d5bac877c9b20c6e9974aa3ed98c38fdaba2f1a93326176f152","observation_id":"9abdeb89-358e-4b48-9f75-bd6887b71352","resolution":{"observed_at":"2026-08-11T22:16:59.142930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.133410Z","title":"In: CVPR (2023)","venue":null,"work_id":"8e72edf7-65d8-4a4d-bffe-e6914a522944","year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.629271Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:e433cdeab6ef2d41dc1c9cfa1a1ec5c6980d55fca31dc2ea5a0829e022c45e25","observation_id":"7ed477d6-b019-43b3-8bfb-aa39aab00757","resolution":{"observed_at":"2026-08-11T22:16:59.135861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.126212Z","title":"In: NeurIPS (2023)","venue":null,"work_id":"98408d42-e045-434a-8a74-79998fc6ae67","year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.631690Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:5ce702b812d1a3141dbb72f100c120ef0872cdff4d36ebfbf417e3f7742aeb55","observation_id":"e79dbcf7-d40c-47c4-b121-b135fe6c5c1b","resolution":{"observed_at":"2026-08-11T22:16:59.128855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.15010","last_updated":"2023-04-28T17:59:25Z","snapshot_observed_at":"2026-08-12T23:40:42.885633Z","submitted_at":"2023-04-28T17:59:25Z","title":"LLaMA-Adapter V2: Parameter-Efficient Visual Instruction Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.15010","snapshot_observed_at":"2026-08-11T22:16:58.634119Z","title":"arXiv preprint arXiv:2304.15010 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.634119Z"},"links":{"cited_paper":"/paper/2304.15010","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:93c7c82ce85a8887ae4898b1b4d86dc566c72db8e13e8dc4dcbbfe42534e8f61","observation_id":"27d51029-679a-4be9-8767-3a5fe3267e12","resolution":{"observed_at":"2026-08-11T22:16:58.634119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.118867Z","title":"In: ECCV (2020)","venue":null,"work_id":"65925c3e-f266-4951-afa5-16fa77315f28","year":2020},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.637157Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:2b13919b33ff8a696ce07b25c7ddb6cedab85a71d63c2e267e23cafb62883c21","observation_id":"0ea61bf5-f009-4a01-9953-6a6494dbdd55","resolution":{"observed_at":"2026-08-11T22:16:59.121559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00121","last_updated":"2021-06-02T13:13:01Z","snapshot_observed_at":"2026-08-10T06:13:20.678193Z","submitted_at":"2021-01-01T00:41:03Z","title":"WARP: Word-level Adversarial ReProgramming","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00121","snapshot_observed_at":"2026-08-11T22:16:58.639576Z","title":"arXiv preprint arXiv:2101.00121 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.639576Z"},"links":{"cited_paper":"/paper/2101.00121","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:943a616e1d019ab8d9cc87848c801257a682aa3c967489a1ad3be4f39f4e90d9","observation_id":"9238119e-4856-41f7-b97e-9c28fbcadbc1","resolution":{"observed_at":"2026-08-11T22:16:58.639576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.111504Z","title":"In: EMNLP (2021)","venue":null,"work_id":"269b3ef7-a8ea-420c-8813-67ca8a3d2042","year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.643290Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:dc78d202bbcc2181f9c24570fb6738d25d74f5b7c8c06445ab2b6b251e026c62","observation_id":"a53b8984-6834-444b-a697-644b86da5462","resolution":{"observed_at":"2026-08-11T22:16:59.114545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.104349Z","title":"In: ICLR (2021)","venue":null,"work_id":"60ed3a69-a56c-414c-baf2-5e2cd32167db","year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.645828Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:cf05ca3f1650b15a98c2d00c594bb058c01c259830c05f890d2b8fad35cce631","observation_id":"7edc9b36-77b7-4f53-b0ea-dd5389aafefe","resolution":{"observed_at":"2026-08-11T22:16:59.106866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.097026Z","title":"In: ICCV (2019)","venue":null,"work_id":"e7e67a22-9a43-4fa8-b353-93f9b157ec64","year":2019},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.648340Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:ec0530e5568f537637bdc9f3a8cc38d6e13b72811fef9ca9ce073ff61aa9cd43","observation_id":"ebe83922-685f-43e9-98bc-44c951c2eea6","resolution":{"observed_at":"2026-08-11T22:16:59.099681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.089589Z","title":"In: ICML (2021)","venue":null,"work_id":"a6aa8f1a-c441-4c4d-8e05-94ff841ae7eb","year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.650869Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:e6c17ada8ab1791764d5e635d93a4038a45ae37583c8970876d761eab1abd175","observation_id":"206f6240-2aad-4a67-924f-f7c60e6fc1fb","resolution":{"observed_at":"2026-08-11T22:16:59.092595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.653354Z","title":"In: CVPR (2015)","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.653354Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:15c6111c7ca93797cab5e558fbf0dd3b40c6844835702a402471ece4f4e4fc5c","observation_id":"c9d05278-9a27-4641-9021-f5f92fc830f6","resolution":{"observed_at":"2026-08-11T22:16:58.653354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.078802Z","title":"In: ICCV (2023)","venue":null,"work_id":"2cbda015-2ed6-482f-82e2-9a3d2394ddfe","year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.655889Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:231cac220e191b2b2a5fa78382a0fcdd416ae1d0ccac86e5c60c5a4556c35a69","observation_id":"7a8bb973-d5a3-4de9-9ac8-31b0b0bb996a","resolution":{"observed_at":"2026-08-11T22:16:59.081314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.070842Z","title":"IJCV128(7), 1956–1981 (2020)","venue":null,"work_id":"ce13a8a2-dff6-4d99-99ef-c47747f8d9ff","year":2020},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.658296Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:f9579b48e8f53f0c1a3f470ba2f19e891bfe78e984f9cf510ec201d4f0f0a09a","observation_id":"391ecc13-847a-4d78-9b7d-b3fd59875024","resolution":{"observed_at":"2026-08-11T22:16:59.073698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.063172Z","title":"In: EMNLP (2021)","venue":null,"work_id":"7095379c-10b5-4c48-bf4c-9ef80e7d5776","year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.660800Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:b855e9f09649b020f9777d6adb1d07b940bc31f39dff6d8a4be1f87e453d8795","observation_id":"aee69a7a-4216-4aec-871d-b8fb996824a2","resolution":{"observed_at":"2026-08-11T22:16:59.066077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-08-12T12:01:54.105712Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-11T22:16:58.663763Z","title":"arXiv preprint arXiv:2301.12597 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.663763Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:6d2944aff0a4fed829761c7561046203679cc8ffbf8c6c087b532c3a02d4c877","observation_id":"d6592922-bfbe-4c72-a979-c1baa20be5ce","resolution":{"observed_at":"2026-08-11T22:16:58.663763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-11T22:16:58.666398Z","title":"arXiv preprint arXiv:2101.00190 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.666398Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:16c2f59d479cbab1d3d589cfcb2328f0d50ec79784f85be5102e919f167423fe","observation_id":"78590323-17ec-459b-aa7d-6c2fb6549981","resolution":{"observed_at":"2026-08-11T22:16:58.666398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.055886Z","title":"In: CVPR (2022)","venue":null,"work_id":"4f42b4d8-68cd-48e4-9bf4-bd145671e652","year":2022},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.669126Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:9f11bb65ceee04ae9f4a656acbabc318eea4cd019ec7c3fdacb4a940372852d3","observation_id":"a019a3fd-76a0-4199-95cc-cf7e4430cf55","resolution":{"observed_at":"2026-08-11T22:16:59.058485Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.048737Z","title":"In: ACL Workshops (2004)","venue":null,"work_id":"c19a9016-d8a0-48de-888b-df0616111740","year":2004},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.671741Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:518718c35c04578b257784a36953f23606eca9a414d540b42956890fc601c0d4","observation_id":"1f6004f9-19fe-4d08-89c9-a65cabb75b48","resolution":{"observed_at":"2026-08-11T22:16:59.051156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.041416Z","title":"In: ECCV (2014)","venue":null,"work_id":"afc0d9a0-aaf4-4f0a-8e37-53d06a8e09f4","year":2014},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.674167Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:c06fe21d5273ce84d175454302a07d3d40df43bdf4f5ba6ae69b673bbddac39f","observation_id":"27b982ec-3669-44fb-bede-41011964ecbf","resolution":{"observed_at":"2026-08-11T22:16:59.044016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07575","last_updated":"2023-11-13T18:59:47Z","snapshot_observed_at":"2026-08-13T14:59:44.917623Z","submitted_at":"2023-11-13T18:59:47Z","title":"SPHINX: The Joint Mixing of Weights, Tasks, and Visual Embeddings for Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07575","snapshot_observed_at":"2026-08-11T22:16:58.676660Z","title":"arXiv preprint arXiv:2311.07575 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.676660Z"},"links":{"cited_paper":"/paper/2311.07575","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:360904e3b5b6fe0bb4280fa9594c38244b09e131e7f2b38f13ff3f88c791be6c","observation_id":"ef243cb5-94ad-40e3-8a7b-da1589174f68","resolution":{"observed_at":"2026-08-11T22:16:58.676660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.034278Z","title":"In: ICLR (2024)","venue":null,"work_id":"27c0d054-4224-4eef-a666-dfbca3f00906","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.679335Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:23f374080ad95ab08146690f82200235b5df37402fe9ced187ee09afe32755fe","observation_id":"b2861bc2-a02a-4b35-8f5f-68d680d25a0c","resolution":{"observed_at":"2026-08-11T22:16:59.036899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.681591Z","title":"In: CVPR (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.681591Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:3bc487fd95a21f5d7e4b197205cf6d3e7438d016401b073b5a57376347be4539","observation_id":"5b8bb909-92ba-4f67-b342-362f2725b765","resolution":{"observed_at":"2026-08-11T22:16:58.681591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.023298Z","title":null,"venue":null,"work_id":"c3113919-1eab-47cb-806c-e9aea53c6b08","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.684009Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:e472fa6b930d5d13172fecbbc2d43c0a520bdc6e04e41973a9e1820ec16fb151","observation_id":"0fe19fdf-4aa8-4602-b57f-84859f0c300d","resolution":{"observed_at":"2026-08-11T22:16:59.025883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.686457Z","title":"In: NeurIPS (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.686457Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:57e1a9a474cd1e6f8ea47f408bfc2d9923ad85d1faf1b937982f17afbab157a7","observation_id":"e530ccb5-fe98-46d8-8257-28e9122ed245","resolution":{"observed_at":"2026-08-11T22:16:58.686457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.011815Z","title":"In: ICML (2024)","venue":null,"work_id":"54634eae-87e6-4e32-bf03-2fe959cd08a5","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.688999Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:29c28496e8e70c78a8ee43afb54956144d3f040df89b6561cd126162f309187c","observation_id":"08ef1a79-1e93-4578-988a-e78a6eefeadd","resolution":{"observed_at":"2026-08-11T22:16:59.014669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:59.004883Z","title":"AI Open (2023)","venue":null,"work_id":"0032244c-2e27-413b-8905-e93e2c42c533","year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.691389Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:1a594d6a30246818e863a78a66d8744a02822477173b68a26e1bc1857f756118","observation_id":"8af3cdca-f7f8-4231-8e3c-5050f44c865f","resolution":{"observed_at":"2026-08-11T22:16:59.007392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-13T13:33:48.501765Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-11T22:16:58.693911Z","title":"arXiv preprint arXiv:2111.09734 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.693911Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:19bf9732425ed48fbbf2eb45295195fb52029f015e771a1465200acec83a2bbc","observation_id":"d23ffe5e-79a5-40e2-83da-a342bb42bef7","resolution":{"observed_at":"2026-08-11T22:16:58.693911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.997594Z","title":"IEEE Intelligent Systems (2024)","venue":null,"work_id":"80502a6e-82a4-4bc2-9994-6801e7fbf49e","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.696458Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:39f6e8ddd7b364d393dd0ecfb739f9b785e873d47867e4b80517a3647c270496","observation_id":"f901596f-36d3-49be-96c8-b92059dd8d24","resolution":{"observed_at":"2026-08-11T22:16:59.000372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.989229Z","title":"In: BMVC (2024)","venue":null,"work_id":"a8a0d2c1-388e-436b-bc53-8b33debd9997","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.698802Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:5602d3488c2f27bf9551a48a6ff3cf4a6d8f8fa7df25960d46455bcc910efb63","observation_id":"c3834755-49ea-4860-b4f3-7e9272b9d0bf","resolution":{"observed_at":"2026-08-11T22:16:58.992730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.701174Z","title":"In: NeurIPS (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.701174Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:28cf464dc906a09d3fa5d5c94f30d52d8687a13eca5b8812bddfefe4b3cf8b8c","observation_id":"c83fb3cb-40e8-4d9e-8c93-dc2610e2dba9","resolution":{"observed_at":"2026-08-11T22:16:58.701174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.977929Z","title":"In: ACL (2002)","venue":null,"work_id":"01e4c009-ec44-4e87-92ec-e357a4434cd0","year":2002},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.703631Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:e6ea3e1f4fd3335d37780e8baf5f350fe8a61027521a3b1af3796d9159f9477d","observation_id":"5c70fbae-54eb-4f02-926c-c904bf16c1be","resolution":{"observed_at":"2026-08-11T22:16:58.980571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.706026Z","title":"In: ICML (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.706026Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:d1ae7e1132cc67897f122eabd0ebe77d922ab71892ae8e1109dcd41e8cc0ab73","observation_id":"a521a331-500c-417d-b8ba-dcd6158b7a0b","resolution":{"observed_at":"2026-08-11T22:16:58.706026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.966258Z","title":"In: CVPR (2023)","venue":null,"work_id":"39622078-0755-4e0c-bf54-287f82b196df","year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.708368Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:9c4145edf0fb1494841c0c20b5acca033415d2f8cd35702b4ddcb993ab784a53","observation_id":"f0df053e-ff07-4e7b-b4ea-aec08fd98c96","resolution":{"observed_at":"2026-08-11T22:16:58.968770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.957931Z","title":"In: CVPR (2017)","venue":null,"work_id":"831c2bea-6142-4947-851b-a3cb1690c835","year":2017},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.710872Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:198a4d07c398550fc7e57341cded29e6b087ffa862aee0003e1365fb15a42f35","observation_id":"e97c0f19-db0a-4dfe-8f09-a6fa0876f523","resolution":{"observed_at":"2026-08-11T22:16:58.960932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.950718Z","title":"In: CVPR (2023)","venue":null,"work_id":"7f499f58-ce28-4a1f-b151-257b10e090bc","year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.713286Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:9ba1d1f395e36d66fbe5ee2fe924e9d9527484271bd7a9fb7369ad364394b165","observation_id":"339dc2fa-210f-4bac-b13f-610edc63035b","resolution":{"observed_at":"2026-08-11T22:16:58.953356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.943678Z","title":"In: ECCV (2024)","venue":null,"work_id":"569cc177-1300-42b8-9292-7cba44ad7978","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.715603Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:3207ddafbbae27e9552063c78acd613b2a51bd2937ec358b2fc7a93fc7ad3475","observation_id":"272e898e-2b01-4670-9723-48f8a79a94f0","resolution":{"observed_at":"2026-08-11T22:16:58.946238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.935780Z","title":"In: ACL (2018)","venue":null,"work_id":"3f3cf39a-e3a1-493f-aa08-5764ed8c08df","year":2018},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.718001Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:43b7781da9bbcf859320b9bde699c65efd1464fa49727a3fbb736ae0ae7f9956","observation_id":"17f48872-303c-46c8-80c0-10583998400f","resolution":{"observed_at":"2026-08-11T22:16:58.938784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.928689Z","title":"In: ECCV (2020)","venue":null,"work_id":"0238009b-6494-4700-8151-6836549d197a","year":2020},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.720369Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:9fd48369436eaca2b74242033c1e17333917591e0dba54f9deaa9e2a9aa82d13","observation_id":"8da7e177-7d18-444e-a67c-0e9d320bc116","resolution":{"observed_at":"2026-08-11T22:16:58.931253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.921229Z","title":"In: CVPR (2010)","venue":null,"work_id":"2937d599-5087-4416-aead-8698e568ac51","year":2010},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.722862Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:b548753af639f3341968bb8d2666ebd4080a0d0da22dfeef6775dda3e8569bc2","observation_id":"adc2fd34-5175-46c3-b673-255457601811","resolution":{"observed_at":"2026-08-11T22:16:58.923858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-11T22:16:58.725267Z","title":"arXiv preprint arXiv:2406.16860 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.725267Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:8edc7494cf231a7069ce536b16ea02e5e0702d6cf32774d7dbdc1180d58a6afc","observation_id":"187fdc54-7bf0-4347-a9eb-796a5d6aa4cd","resolution":{"observed_at":"2026-08-11T22:16:58.725267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.727872Z","title":"In: CVPR (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.727872Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:9a6f9f8c914e87ff233bb98c748b3923fc60a45f836a55333d407ca8f2135661","observation_id":"324496d1-b198-4755-9f67-3bd2ddf9775f","resolution":{"observed_at":"2026-08-11T22:16:58.727872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-11T22:16:58.731179Z","title":"arXiv preprint arXiv:2302.13971 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.731179Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:b9da0672563945c02d716bc8f393834266c9604c64259f5a3a81cd449dc130fc","observation_id":"66ef6ac9-5a83-4d59-8b4c-de9e6c9a6a58","resolution":{"observed_at":"2026-08-11T22:16:58.731179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.908997Z","title":"In: CVPR (2015)","venue":null,"work_id":"fb478090-6ea3-4893-8e28-b520b93ef6ac","year":2015},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.734254Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:d39baf8f62b3f9a4831a9c96332ac2e9d17ab33b1ae74443c7da7bb1d48fec08","observation_id":"7151421f-b469-4715-a8b2-1c2ff8e6e526","resolution":{"observed_at":"2026-08-11T22:16:58.911614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.901644Z","title":"In: CVPR (2015) 18 D","venue":null,"work_id":"528ba1ba-09ff-49e1-84d9-b4fb490712b1","year":2015},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.736584Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:8cc01c4d844cbedb5e8afdf2bb2a26cfef884aaf9a5979894fd46d440e6500c1","observation_id":"ad689c1a-694b-41d6-b2ef-346c4ead1263","resolution":{"observed_at":"2026-08-11T22:16:58.904323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.894443Z","title":"In: AAAI (2024)","venue":null,"work_id":"8316509d-dc29-4b88-97ab-905db3c89b6d","year":2024},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.738957Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:204ecc9e440ce9b01c9f7ce3da90dff445c2c6a9ce322f47a15e237417ec77a8","observation_id":"2106f69c-6cf8-451a-9f0a-b415e65e0a57","resolution":{"observed_at":"2026-08-11T22:16:58.897106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-11T22:16:58.741333Z","title":"arXiv preprint arXiv:2311.03079 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.741333Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:1febfef650dd2c00f4eb1151d2ed7bf4395cd8328d76856d09c1881ed3134047","observation_id":"6146e7bc-49c0-40c8-8f60-38f6987a6fd9","resolution":{"observed_at":"2026-08-11T22:16:58.741333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.887168Z","title":"In: CVPR (2019)","venue":null,"work_id":"da27755f-6a34-4156-ae8e-671cfeb9bf05","year":2019},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.743980Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:c4a1e68234811c0ff3489d5ee31024605137ecfaa7850072ea47b216f4e6bbbd","observation_id":"7cd75297-620f-4325-8d9c-a94eaed1a975","resolution":{"observed_at":"2026-08-11T22:16:58.889719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:16:58.877899Z","title":"Proceedings of the IEEE98(8) (2010)","venue":null,"work_id":"9c876882-c7f0-4178-9d13-67d6d9f71100","year":2010},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.746357Z"},"links":{"citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:a7b5f772070f4dfaaedd58308283cb8216e391f80885bba78e784933e71593b8","observation_id":"2ad190ec-6c3a-4ad2-8675-2c52b3184f45","resolution":{"observed_at":"2026-08-11T22:16:58.881946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-11T22:16:58.748692Z","title":"arXiv preprint arXiv:2304.14178 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.748692Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:8b0e399c0d9e3672bfb2a43158972a4cd9b404f625ae03580186bfaea282e2c1","observation_id":"7c5c315c-baa8-4461-890b-879b7c2e9386","resolution":{"observed_at":"2026-08-11T22:16:58.748692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16045","last_updated":"2024-12-11T02:46:29Z","snapshot_observed_at":"2026-08-13T05:41:56.516364Z","submitted_at":"2023-10-24T17:58:07Z","title":"Woodpecker: Hallucination Correction for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16045","snapshot_observed_at":"2026-08-11T22:16:58.751793Z","title":"arXiv preprint arXiv:2310.16045 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.751793Z"},"links":{"cited_paper":"/paper/2310.16045","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:6957a98a561dc269b2d0e85eab2ab8550a83dcc99ea5171b77e3982ac8b404ef","observation_id":"61a90ef5-6057-4d49-8292-acf4db629436","resolution":{"observed_at":"2026-08-11T22:16:58.751793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-13T10:59:39.237521Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-11T22:16:58.754447Z","title":"arXiv preprint arXiv:2307.04087 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:16:58.754447Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2412.03665"},"observation_digest":"sha256:f9130c4eb200b838f3ff8b823e43918920458a0fde60c83c859a9f8006b035ed","observation_id":"262c8a4c-f739-4d70-b9f4-bd242d2fa1d1","resolution":{"observed_at":"2026-08-11T22:16:58.754447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.03665","last_updated":"2024-12-04T19:01:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:49:11.469914Z","submitted_at":"2024-12-04T19:01:06Z","title":"Personalizing Multimodal Large Language Models for Image Captioning: An Experimental Analysis"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 2 inbound Pith citation observations for arXiv:2412.03665."}