{"as_of":"2026-08-14T10:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f0999153e02539982a948a5cfcd2d5e11e6b5a4978ec49880956719267f6d5bb","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:35:52.480788Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:40:00.510742Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T16:27:09.401525Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"cited_work":{"arxiv_id":"2412.01289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01289","snapshot_observed_at":"2026-07-02T16:27:09.401525Z","title":"Enhancing perception capabilities of multimodal llms with training-free fusion","venue":null,"work_id":"5b6a06bb-7868-4d9c-ac4b-9e51accef9d4","year":2024},"citing_paper":{"arxiv_id":"2604.22823","last_updated":"2026-07-13T15:11:18Z","snapshot_observed_at":"2026-08-13T18:01:04.268818Z","submitted_at":"2026-04-18T09:38:03Z","title":"PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T07:04:54.909073Z"},"links":{"cited_paper":"/paper/2412.01289","citing_paper":"/paper/2604.22823"},"observation_digest":"sha256:e91882f6ef030a89af20e67749aaee4a8f45114d4326f0c83706d0ce4130d25e","observation_id":"81cc936d-1ccb-4918-be52-a8ad35fac335","resolution":{"observed_at":"2026-05-10T07:06:52.904006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"cited_work":{"arxiv_id":"2412.01289","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.01289","snapshot_observed_at":"2026-07-02T16:27:09.401525Z","title":"Enhancing perception capabilities of multimodal llms with training-free fusion","venue":null,"work_id":"5b6a06bb-7868-4d9c-ac4b-9e51accef9d4","year":2024},"citing_paper":{"arxiv_id":"2606.07289","last_updated":"2026-06-05T14:00:47Z","snapshot_observed_at":"2026-08-01T07:32:32.007503Z","submitted_at":"2026-06-05T14:00:47Z","title":"Closed-Form Spectral Regularization for Multi-Task Model Merging","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-27T22:40:00.510742Z"},"links":{"cited_paper":"/paper/2412.01289","citing_paper":"/paper/2606.07289"},"observation_digest":"sha256:ede0a314e07e161069bcbade628248c74f0f444a283c1407ec8e94419fceff8d","observation_id":"d395fd3b-2d8b-4ac5-9735-002f65d9c99b","resolution":{"observed_at":"2026-07-02T16:27:09.403073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.01289/citation-record","integrity":"/paper/2412.01289/integrity","json":"/paper/2412.01289/citation-record.json","paper":"/paper/2412.01289"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.917640Z","title":"Llama 3 model card","venue":null,"work_id":"25e47b2b-73ac-4088-ad7c-2cc888df0754","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.161969Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:67f3da7c40c4e2cadf7dd2d7f8372cb54d3c1fead933e682c84feacf0499a000","observation_id":"e5020a5b-2820-412e-922d-8a01dcd07960","resolution":{"observed_at":"2026-08-12T04:35:53.926092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.169246Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.169246Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:1865ed4da0362d60c4abae971031cd49eb611d5182866cb69fb8ca366e3a1ccd","observation_id":"579021a5-be40-4b14-b897-eb5b2b030ef5","resolution":{"observed_at":"2026-08-12T04:35:52.169246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-12T04:35:52.174871Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.174871Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:2cea8bf3e7ec581f160e6d1e933878f51193de716e2931e96c3b4c3be82b3831","observation_id":"93f85b83-c205-419c-af0b-3cd0ddf64249","resolution":{"observed_at":"2026-08-12T04:35:52.174871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-08-13T04:00:22.647615Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-08-12T04:35:52.180236Z","title":"To- ken merging: Your vit but faster","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.180236Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:b3afd16e3e2f0761251729faa97ee41532dbad32cc1bd22509a983e748424258","observation_id":"c84bf1a3-e5d7-4fe6-a94e-c2360674bb86","resolution":{"observed_at":"2026-08-12T04:35:52.180236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.885422Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":"23347b5a-23e0-4395-8b53-14160ab6a12b","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.185358Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:0d81358c69cb594e878f0087624af33bce4df95e94b9141014856f05d0881acf","observation_id":"ffb5b431-b27b-4176-90e4-5d67fb9a08d4","resolution":{"observed_at":"2026-08-12T04:35:53.891160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-12T04:35:52.190470Z","title":"Shikra: Unleashing multi- modal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.190470Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:c65db1799eead34f0158a382d2712b8631d1a81bbc7c26e7d8bff5b1a1b27e1c","observation_id":"578e2d59-2d4a-4796-888a-adb393df60e7","resolution":{"observed_at":"2026-08-12T04:35:52.190470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.866830Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models, 2024","venue":null,"work_id":"ec4964f8-ace2-4773-b73d-e8816fe61707","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.196430Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:434f86718ec6f1fa0c3d2e4edc31f147c42f626f41c12bb5cbb30588ea6eca38","observation_id":"89f70929-9fb2-4836-8a7c-a31a4843be58","resolution":{"observed_at":"2026-08-12T04:35:53.873075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.201755Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality, march","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.201755Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:aca3871fb9b5cb67efc31f69f3d9a069a2cd85023bcca633c6e10f58af17c6ed","observation_id":"3fd7e438-4b00-4406-ab26-73712da16cb6","resolution":{"observed_at":"2026-08-12T04:35:52.201755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03044","last_updated":"2022-04-06T18:54:48Z","snapshot_observed_at":"2026-08-13T16:07:23.235097Z","submitted_at":"2022-04-06T18:54:48Z","title":"Fusing finetuned models for better pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03044","snapshot_observed_at":"2026-08-12T04:35:52.206726Z","title":"Fusing finetuned models for better pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.206726Z"},"links":{"cited_paper":"/paper/2204.03044","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:9bdb3e0b18d0ac75d741e30ac342afe70e1683c469e8da9ca8ee32592c5605e7","observation_id":"55d157bb-c303-4343-a09c-d07f1ad997d5","resolution":{"observed_at":"2026-08-12T04:35:52.206726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16886","snapshot_observed_at":"2026-08-12T04:35:52.211989Z","title":"Mobilevlm: A fast, reproducible and strong vision language assistant for mobile devices","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.211989Z"},"links":{"cited_paper":"/paper/2312.16886","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:265a824fae922baa6bb18c2e47cb7b023509e0a89226dec738538cbebe3f3260","observation_id":"e3c46c07-88a7-4f99-a008-8230dc87b68f","resolution":{"observed_at":"2026-08-12T04:35:52.211989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.217289Z","title":"Instructblip: Towards general- purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.217289Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:601787b784d6437d9bd4f975af6e670ac087306eeedb64364ffbcaf990a7444d","observation_id":"1961de4f-e606-4566-904a-1bb5a3654107","resolution":{"observed_at":"2026-08-12T04:35:52.217289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09860","last_updated":"2023-05-18T02:24:56Z","snapshot_observed_at":"2026-08-13T11:40:38.498943Z","submitted_at":"2023-05-17T00:11:38Z","title":"Epsilon Sampling Rocks: Investigating Sampling Strategies for Minimum Bayes Risk Decoding for Machine Translation","version":2},"cited_work":{"arxiv_id":"2305.09860","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.09860","snapshot_observed_at":"2026-08-12T04:35:53.102436Z","title":"Epsilon Sampling Rocks: Investigating Sampling Strategies for Minimum Bayes Risk Decoding for Machine Translation","venue":"cs.CL","work_id":"b874cfbc-e789-41c9-b9ca-78d355641101","year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.222575Z"},"links":{"cited_paper":"/paper/2305.09860","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:4f0d90fbc030e0e8bef124049a0c1df73c6f61eccc2b31a03c13841fefa237cb","observation_id":"8dc888e9-7e0c-426d-ba46-4932d7dcc54f","resolution":{"observed_at":"2026-08-12T04:35:53.110880Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.815774Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"5648d79b-9200-4575-8f70-e660fd593fe5","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.229333Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:48a6b06eb23c2e03aaa0879f9d7af896ce488cfe908ca708958e5a85cd7f3c97","observation_id":"3736654f-5dd5-4490-a3db-223588607acf","resolution":{"observed_at":"2026-08-12T04:35:53.823105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15738","last_updated":"2024-05-24T17:34:15Z","snapshot_observed_at":"2026-08-14T04:30:40.908915Z","submitted_at":"2024-05-24T17:34:15Z","title":"ConvLLaVA: Hierarchical Backbones as Visual Encoder for Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15738","snapshot_observed_at":"2026-08-12T04:35:52.235865Z","title":"Con- vllava: Hierarchical backbones as visual encoder for large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.235865Z"},"links":{"cited_paper":"/paper/2405.15738","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:fb457e1b2bdce81d4f3db41eac55c87e04582ec45c6550f0aabbd47010d659d6","observation_id":"432abb0b-d338-4279-8de6-313248a04d2b","resolution":{"observed_at":"2026-08-12T04:35:52.235865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.792898Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"c95055bc-0cb8-4b71-8d64-f7ca6e66a1ad","year":2017},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.241613Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:d51042d4bc1c60e5f09bac1db6a73ab24b72058a14b387117ea7698f16b84078","observation_id":"932ccbd9-163f-4711-8a14-80f66a95fb4a","resolution":{"observed_at":"2026-08-12T04:35:53.800117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.767619Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"5a240e3c-90a0-4b66-89dc-82abf1490237","year":2017},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.247353Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:baaa1c3e0781ac46240a80f5c7011428e763549e4290bce4f098694ffc6ce4d5","observation_id":"0765a90e-1a92-4eb8-8f00-fd0f3af35a10","resolution":{"observed_at":"2026-08-12T04:35:53.774006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.747243Z","title":"Vizwiz grand challenge: Answering visual questions from blind people","venue":null,"work_id":"a291e513-35cc-491c-be96-2ebfb47f5dfa","year":2018},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.252591Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:7f1359ec2746f679b68ce00ecf47f0b130971c985e45a4b24108c6f06df13046","observation_id":"0014ba9e-0cad-4347-bf10-699e3e4c6b3c","resolution":{"observed_at":"2026-08-12T04:35:53.753151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.728817Z","title":"Onellm: One framework to align all modalities with language","venue":null,"work_id":"1eaace47-638c-4ed8-8a5e-1474f81f4b34","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.257413Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:3a3bad8c8ee829bc3f15c99874cd107d92483df4da3dd46dd1e445eef3ddcf74","observation_id":"36af12b2-109f-46e6-84e8-0ac063c7138f","resolution":{"observed_at":"2026-08-12T04:35:53.734724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.708950Z","title":"Editing models with task arithmetic","venue":null,"work_id":"4ca141ac-647b-465d-9fc4-51ef7eb354ab","year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.262529Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:f5bb8c437794fcbf5ebd96c736c6d602d36dc0b682a6983c363624dd1b1b494c","observation_id":"83921769-1cbc-4a52-a3ad-df5b70759392","resolution":{"observed_at":"2026-08-12T04:35:53.714807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.689662Z","title":"Editing models with task arithmetic","venue":null,"work_id":"55c282b5-a1ac-45d7-98a4-60fc0eaf1b3c","year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.267261Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:d2fd79d96df0c929cc7d1f5f271a1993a9643b85418269f9652e2b1a2f2ae948","observation_id":"11de87cf-3771-4388-8e95-300b97321891","resolution":{"observed_at":"2026-08-12T04:35:53.695652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02561","last_updated":"2023-06-30T21:39:54Z","snapshot_observed_at":"2026-08-13T11:24:39.612149Z","submitted_at":"2023-06-05T03:32:26Z","title":"LLM-Blender: Ensembling Large Language Models with Pairwise Ranking and Generative Fusion","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.02561","snapshot_observed_at":"2026-08-12T04:35:52.272424Z","title":"Llm- blender: Ensembling large language models with pair- wise ranking and generative fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.272424Z"},"links":{"cited_paper":"/paper/2306.02561","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:c343f4c9e9ca7541e41315dce04b8fc1ee65dd3c6f6423ad84204a742b336c07","observation_id":"9d214fd1-cbe8-4607-b7d8-87a6f45498ff","resolution":{"observed_at":"2026-08-12T04:35:52.272424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.669567Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"44f44b00-27a7-40ed-82ba-282f3a3ecc2a","year":2022},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.277765Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:58390316a0e7128c89ff6042a04301dae26cc3f94824bd6f292213741afc5155","observation_id":"802b26ba-707d-41ff-8c6b-aaeabe7dd343","resolution":{"observed_at":"2026-08-12T04:35:53.675911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.282873Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.282873Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:038ecc2d129444b9e851811beece4af408cd006d25159a076fcb88a7970192e4","observation_id":"7cd60cc8-56bf-4ac8-a293-760a515e2c89","resolution":{"observed_at":"2026-08-12T04:35:52.282873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.640596Z","title":"In- troducing idefics: An open reproduction of state-of-the-art visual language model, 2023","venue":null,"work_id":"ef2329f8-0331-4c5c-b198-b5866e39cd4b","year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.296757Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:041cfece492d7f518695639b20a198551554c6817ad7536b7be8caf9d4d14838","observation_id":"332759f4-3009-434c-955d-cdd30957e077","resolution":{"observed_at":"2026-08-12T04:35:53.646125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.302694Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.302694Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:e4e4330e836acad325c01d3536720f562aee5df1476b111ce57e45a99c79432f","observation_id":"e9980917-69d3-430b-9f95-603a1244ca12","resolution":{"observed_at":"2026-08-12T04:35:52.302694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-13T05:15:07.522678Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-12T04:35:52.307747Z","title":"Llama-vid: An image is worth 2 tokens in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.307747Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:e6b81cf8ed617528a527edde2a659a3a3ae632b84050780693b41e7d67452c34","observation_id":"5e915f62-38f3-4445-8129-ccf5dee9a37b","resolution":{"observed_at":"2026-08-12T04:35:52.307747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-12T04:35:52.313670Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.313670Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:23a998cf0a7d3a037e2d5011415142a8c6c5854d927cc8177cca6f943a534a99","observation_id":"3f797669-e749-44a5-bdc2-08af6022129b","resolution":{"observed_at":"2026-08-12T04:35:52.313670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-12T04:35:52.321158Z","title":"Video-llava: Learning united visual represen- tation by alignment before projection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.321158Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:0b509ee31d5fac084230c4bebc49fff1202de87cd622a682678c5a8e788bafee","observation_id":"2998fcce-700e-4121-b0b2-7cd9735a91ba","resolution":{"observed_at":"2026-08-12T04:35:52.321158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.604778Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"44445f9e-1653-4e16-b5dd-67f3c1d7d9b3","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.326881Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:50f2be331ad9eb5623e85970f5d0e403c5b0b64727ce17ff94e48a95e347f594","observation_id":"031776af-ef46-435a-b03c-2f7c4bfe9e85","resolution":{"observed_at":"2026-08-12T04:35:53.611660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.332753Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.332753Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:1f57da6ccb6bfd450a589c02d2c6245e4b509f3afb6f52d2eb727b9504313f79","observation_id":"8bc5a57e-f4ea-4e02-8cd2-d4d1b5d11ab2","resolution":{"observed_at":"2026-08-12T04:35:52.332753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.572043Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning","venue":null,"work_id":"f099f9b2-f31d-4f65-8b02-28bb2134b792","year":null},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.339639Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:6dedf5646fda9830654c0aab4b0ed8ec161581c8b45e5e6a6f4d6b2da70adc87","observation_id":"96d2cefd-2f49-4e5a-a952-a525211d076b","resolution":{"observed_at":"2026-08-12T04:35:53.577821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.553692Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"d7157eef-5a1b-4940-bc92-b98802fbab1a","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.346028Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:31cbbbd655f2dbf9848f560f0bb06231d4d31342f8895f103687cf70bda9a0ed","observation_id":"e449a05d-4bb9-40ba-b126-78193aa34fc0","resolution":{"observed_at":"2026-08-12T04:35:53.559725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.394482Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"efb8bbca-8a56-432c-8525-71bf3e62e7a4","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.350752Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:65d83d61ad26c6fcf7c761503cb1c0acfa67bb88edc5236136d530b17cae4afa","observation_id":"6d7f0d48-151c-4fb3-a4e6-ce8c87379131","resolution":{"observed_at":"2026-08-12T04:35:53.400194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.374076Z","title":"Visual instruction tuning","venue":null,"work_id":"c6e96d91-67c8-4137-8ab9-592d08c21f42","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.356248Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:5dc9a31abd8bfd152ce495fc4297d98aa6525031b465d936c90eb718321a82a8","observation_id":"0073817c-eee9-4e9e-bb05-9a1b029e7253","resolution":{"observed_at":"2026-08-12T04:35:53.380245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10193","last_updated":"2024-10-13T20:42:37Z","snapshot_observed_at":"2026-08-13T04:18:04.658813Z","submitted_at":"2024-02-15T18:50:06Z","title":"BitDelta: Your Fine-Tune May Only Be Worth One Bit","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10193","snapshot_observed_at":"2026-08-12T04:35:52.361915Z","title":"Bitdelta: Your fine-tune may only be worth one bit","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.361915Z"},"links":{"cited_paper":"/paper/2402.10193","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:ec36daae66e10152def35bf3d133760e57ac37b03a48fbe08defc7bf2a962ac6","observation_id":"300eb4da-51a2-4cc8-b6dd-493e0edca866","resolution":{"observed_at":"2026-08-12T04:35:52.361915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-12T04:35:52.368597Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.368597Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:3684114188311bbe351787c26bb886aa52fa554ee3d9be3eaaa8e12b67c26c76","observation_id":"99d3f12d-3706-4a72-8c75-50782528f299","resolution":{"observed_at":"2026-08-12T04:35:52.368597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-12T04:35:52.374335Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.374335Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:50834c611c7dd30a7084aede3a77a2e3f89fb0efa1cdce0ea0b84e32ca5b1812","observation_id":"2df3300e-0170-4a34-a7f2-adac24513433","resolution":{"observed_at":"2026-08-12T04:35:52.374335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.09958","last_updated":"2023-09-18T17:30:46Z","snapshot_observed_at":"2026-08-13T10:10:39.691607Z","submitted_at":"2023-09-18T17:30:46Z","title":"An Empirical Study of Scaling Instruct-Tuned Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.09958","snapshot_observed_at":"2026-08-12T04:35:52.380002Z","title":"An empirical study of scal- ing instruct-tuned large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.380002Z"},"links":{"cited_paper":"/paper/2309.09958","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:8e1bc53d422819980eff9cfa8e868211885f68850b1d5f0d6e2114b128ff64ed","observation_id":"d97a5506-0c4f-4577-87f1-af88335367f4","resolution":{"observed_at":"2026-08-12T04:35:52.380002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.385690Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.385690Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:b1800379773d9d46406db9c705ce69d6b7518f4742d987c14c71810177c61cb6","observation_id":"d6c2f7b5-19f5-46c5-aa8e-c34aa7e9cb31","resolution":{"observed_at":"2026-08-12T04:35:52.385690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15998","last_updated":"2025-03-02T23:41:37Z","snapshot_observed_at":"2026-08-12T22:55:41.155703Z","submitted_at":"2024-08-28T17:59:31Z","title":"Eagle: Exploring The Design Space for Multimodal LLMs with Mixture of Encoders","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15998","snapshot_observed_at":"2026-08-12T04:35:52.390853Z","title":"Eagle: Exploring the design space for multimodal llms with mixture of encoders","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.390853Z"},"links":{"cited_paper":"/paper/2408.15998","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:9d85dda814f6b0932172fbdb14fe9587f0698115202cfc3c9eec352b3398bd36","observation_id":"a6cc9117-80e7-49c2-b2af-c2da7fac13b2","resolution":{"observed_at":"2026-08-12T04:35:52.390853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.332293Z","title":"Animating rotation with quaternion curves","venue":null,"work_id":"6c1c8449-91f9-4a79-8f69-c33baf88ac31","year":1985},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.396328Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:74d5ee2255e09cc3ab83b85c6d7c78b20f8227154800ee550324400ee3d6f0b4","observation_id":"b82fd9ad-d49f-40bb-b243-f5d0d3416c85","resolution":{"observed_at":"2026-08-12T04:35:53.340341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.305993Z","title":"Towards vqa models that can read","venue":null,"work_id":"332b24f6-f2f5-451f-8f95-ebf869ef2c1b","year":2019},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.403028Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:a775cf5ffb38c011493a5af227a977c890bf4f260368fe04014bc0e4d3f57da7","observation_id":"4d0d2f25-67e1-4bf3-bd8f-22e13d25057e","resolution":{"observed_at":"2026-08-12T04:35:53.312247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.286346Z","title":"Visualizing data using t-sne","venue":null,"work_id":"a3f62bd8-b057-416a-b37b-983be8fdeb46","year":2008},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.408981Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:d6d14fd5b5b8d6d6bdba30d7240d2a5fab348e2584bccd8b87848cb29b3a8ee3","observation_id":"b4bce915-5b0a-4100-9b43-9b89da4f8f55","resolution":{"observed_at":"2026-08-12T04:35:53.292775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10491","last_updated":"2024-01-22T17:16:37Z","snapshot_observed_at":"2026-08-14T02:25:46.836991Z","submitted_at":"2024-01-19T05:02:46Z","title":"Knowledge Fusion of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10491","snapshot_observed_at":"2026-08-12T04:35:52.415298Z","title":"Knowledge fusion of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.415298Z"},"links":{"cited_paper":"/paper/2401.10491","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:e96c78b767106afef2fed5d2c4404f97e85a7e2af91ff96942c47b4fdb35bf5f","observation_id":"174fae8c-ad11-4a6c-895d-cc5a8550ca61","resolution":{"observed_at":"2026-08-12T04:35:52.415298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.262058Z","title":"Grok-1.5 Vision Preview, 2024","venue":null,"work_id":"5f01488f-60a6-45c4-b86a-b6085429e64f","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.421218Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:b6b5448c667ec84b08a41590ff8f8b6e70d81569aac6f6fb59f86b9df1177150","observation_id":"56d56766-116b-49ec-b54f-7c8135a8682b","resolution":{"observed_at":"2026-08-12T04:35:53.268461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16994","last_updated":"2024-04-29T14:52:02Z","snapshot_observed_at":"2026-08-13T20:40:43.794560Z","submitted_at":"2024-04-25T19:29:55Z","title":"PLLaVA : Parameter-free LLaVA Extension from Images to Videos for Video Dense Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16994","snapshot_observed_at":"2026-08-12T04:35:52.426778Z","title":"Pllava: Parameter-free llava extension from images to videos for video dense captioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.426778Z"},"links":{"cited_paper":"/paper/2404.16994","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:53cd5ef535a7db92a769402c592cec7ee98e47bd65def893e3dfb3b363317865","observation_id":"d522b4b3-3f60-491e-a3bd-ff52039a38aa","resolution":{"observed_at":"2026-08-12T04:35:52.426778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01708","last_updated":"2023-10-27T01:09:31Z","snapshot_observed_at":"2026-08-13T15:23:54.677158Z","submitted_at":"2023-06-02T17:31:32Z","title":"TIES-Merging: Resolving Interference When Merging Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.01708","snapshot_observed_at":"2026-08-12T04:35:52.432601Z","title":"Resolving interference when merging models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.432601Z"},"links":{"cited_paper":"/paper/2306.01708","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:7805805ac359bb074a2bf934fc64f132af63b96fb4d1fa73b3cac87492938c9c","observation_id":"6429dc0b-6a57-4882-b451-55182ee5fb1a","resolution":{"observed_at":"2026-08-12T04:35:52.432601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:52.438373Z","title":"Law of vision represen- tation in mllms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.438373Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:a0651b21248c38645dc9a20273f5866eb0744d8ae4e610ed0be770d35c941182","observation_id":"d6bd0b00-1e4d-4529-9caf-f9b31182c94c","resolution":{"observed_at":"2026-08-12T04:35:52.438373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-12T04:35:52.444166Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.444166Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:e9766042b8298f01c22326b123ce14703a320a2f5772633b0c7dc61e36fc140a","observation_id":"b2605e8c-5450-46e0-a93d-1563c818a0da","resolution":{"observed_at":"2026-08-12T04:35:52.444166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13549","snapshot_observed_at":"2026-08-12T04:35:52.450553Z","title":"A survey on multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.450553Z"},"links":{"cited_paper":"/paper/2306.13549","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:a70b746c0aa07838e9251a1c8a24844b772804e82ca8d9e153235895cbb9c794","observation_id":"5a448751-c2b9-4eca-96e4-baba4f97c04c","resolution":{"observed_at":"2026-08-12T04:35:52.450553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.245234Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"b70c22e5-e35d-4489-ad82-710d8de797df","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.455827Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:2447dcba48123a3a47097d750689d5173bfd4778bed821af88dca8614de2262e","observation_id":"5486dcd6-2b10-486f-9432-c81a8ef32a2d","resolution":{"observed_at":"2026-08-12T04:35:53.250350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T04:35:53.225892Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":"77b85027-c8f7-47dd-b78b-0d266079f17c","year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.460798Z"},"links":{"citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:66e01c9d9756442f653b35b7a2565e3faa0b36fa03f84066a9e4fd79593ea8f9","observation_id":"ba3966b2-3d3e-4c1e-922a-3b6331e1f0c1","resolution":{"observed_at":"2026-08-12T04:35:53.232358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.17107","last_updated":"2024-02-02T19:44:14Z","snapshot_observed_at":"2026-08-13T11:05:54.841341Z","submitted_at":"2023-06-29T17:08:16Z","title":"LLaVAR: Enhanced Visual Instruction Tuning for Text-Rich Image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.17107","snapshot_observed_at":"2026-08-12T04:35:52.465577Z","title":"Llavar: Enhanced visual instruction tuning for text-rich image understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.465577Z"},"links":{"cited_paper":"/paper/2306.17107","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:7230594b48e37dd9520ce674f5a502f1d09018a840f302599c745a612c423dc7","observation_id":"558f1a50-6dac-4dea-b57e-712b593cedeb","resolution":{"observed_at":"2026-08-12T04:35:52.465577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-12T23:44:15.418450Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-12T04:35:52.470510Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.470510Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:c46f23c860be86bb3a88bb93e5b5535618971482d7135bec5d58fbf3e2a541d7","observation_id":"2293816a-e9c4-45b7-9785-2041aec0a79d","resolution":{"observed_at":"2026-08-12T04:35:52.470510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04087","last_updated":"2023-12-28T16:01:36Z","snapshot_observed_at":"2026-08-13T10:59:39.237521Z","submitted_at":"2023-07-09T03:25:14Z","title":"SVIT: Scaling up Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04087","snapshot_observed_at":"2026-08-12T04:35:52.475515Z","title":"Svit: Scaling up visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.475515Z"},"links":{"cited_paper":"/paper/2307.04087","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:d9295e109c226a2ea39929134da098a72a31e49e6c00ac673435b066dab422ca","observation_id":"af8029f1-3b68-4ea6-857e-e5fb67d7643a","resolution":{"observed_at":"2026-08-12T04:35:52.475515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-12T04:35:52.480788Z","title":"Sparsity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T04:35:52.480788Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2412.01289"},"observation_digest":"sha256:b96cbde1ba100c1dbff170d79e4f70decc74e2bed5cabb6c98651e0558991dce","observation_id":"35fc70fc-8ca2-46a9-8ed4-77b774c000ba","resolution":{"observed_at":"2026-08-12T04:35:52.480788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.01289","last_updated":"2024-12-04T09:51:16Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T09:25:53.779363Z","submitted_at":"2024-12-02T09:02:28Z","title":"Enhancing Perception Capabilities of Multimodal LLMs with Training-Free Fusion"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":23},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 2 inbound Pith citation observations for arXiv:2412.01289."}