{"as_of":"2026-08-22T00:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bd262bf0c83e373cf9f27756d669cbd450ba09630ca5b35912aa0fec55edf486","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:52:09.476244Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T04:57:29.460876Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":"2505.17316","doi":"10.48550/arxiv.2505.17316","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analyzing","venue":"arXiv (Cornell University)","work_id":"ab03f708-44f5-403a-afb0-a7b9cfad03e0","year":2025},"citing_paper":{"arxiv_id":"2604.21343","last_updated":"2026-08-04T21:50:05Z","snapshot_observed_at":"2026-08-08T23:09:28.589207Z","submitted_at":"2026-04-23T06:58:08Z","title":"Latent Denoising Improves Visual Alignment in Large Multimodal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T23:07:54.806529Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2604.21343"},"observation_digest":"sha256:b9380b82ed24236be1baede0dfbd9eda8b8c263de119f503837bcb82b80a8a29","observation_id":"016138de-0e18-46f9-a76b-1f2029ae70c9","resolution":{"observed_at":"2026-05-09T23:09:26.689929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":"2505.17316","doi":"10.48550/arxiv.2505.17316","metadata_source":"arxiv_reference","pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Analyzing","venue":"arXiv (Cornell University)","work_id":"ab03f708-44f5-403a-afb0-a7b9cfad03e0","year":2025},"citing_paper":{"arxiv_id":"2605.17187","last_updated":"2026-05-16T22:52:11Z","snapshot_observed_at":"2026-08-16T02:45:35.338739Z","submitted_at":"2026-05-16T22:52:11Z","title":"PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-20T14:05:14.737146Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2605.17187"},"observation_digest":"sha256:c3ed76b5f3e39a7cdf477b99ff72b966b327b9f15f178c0fde1a5c33a7c5af6e","observation_id":"9c925f13-3f9d-4834-b9d5-bd95ebda16bf","resolution":{"observed_at":"2026-05-20T14:08:20.436198Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:08.460289+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-07-12T04:35:49.701061Z","title":"arXiv preprint arXiv:2505.17316 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03143","last_updated":"2026-07-03T09:32:01Z","snapshot_observed_at":"2026-08-21T00:36:49.039436Z","submitted_at":"2026-07-03T09:32:01Z","title":"Text as Partial Constraint: Core-Residual Alignment for Robust Vision-Language Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-07-12T04:35:49.701061Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2607.03143"},"observation_digest":"sha256:e55f7e83ff254edc7e97755b760455919afcd954139803a82f207f357f438bff","observation_id":"5774306e-2e1f-44d5-b230-98bb897ca4f1","resolution":{"observed_at":"2026-07-12T04:35:49.701061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17316","snapshot_observed_at":"2026-08-12T04:57:29.460876Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.11167","last_updated":"2026-08-11T17:28:52Z","snapshot_observed_at":"2026-08-18T01:15:25.484197Z","submitted_at":"2026-08-11T17:28:52Z","title":"MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-12T04:57:29.460876Z"},"links":{"cited_paper":"/paper/2505.17316","citing_paper":"/paper/2608.11167"},"observation_digest":"sha256:b3c85945e9fa1cdba94ac39ff1457949249d8e9ac19f833af5c94ae70d21b33c","observation_id":"d6ac425d-f669-4b50-ae94-43c4517bc5f7","resolution":{"observed_at":"2026-08-12T04:57:29.460876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.17316/citation-record","integrity":"/paper/2505.17316/integrity","json":"/paper/2505.17316/citation-record.json","paper":"/paper/2505.17316"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:14.354120Z","title":"Visual instruction tuning,","venue":null,"work_id":"d8769989-5111-4001-a64b-58ec321f3036","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.097733Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:a2834b37e92140c4fe2e0bc4b413589a1b0e0b188cea0e063170d0ac34e49bda","observation_id":"fadc0ca7-aeda-4650-b84f-c888ac9a3105","resolution":{"observed_at":"2026-08-07T14:52:14.433783Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:14.243308Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"f33458ad-dfd4-4f4f-b254-b8668461279d","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.208405Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:9ab05e53cd10cfdddd56faaf07eeee3795ddc45dc0e1b36b21346e65963b4474","observation_id":"29de9b4f-7a6c-45b0-ba66-65863a79d134","resolution":{"observed_at":"2026-08-07T14:52:14.277054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:04.379623Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.379623Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:a7c3224216b2ad770d37cd054f66ad8f541bc4f602898af34a7e88f559fc1153","observation_id":"208045f1-7904-41c4-a316-77bcd68edc2c","resolution":{"observed_at":"2026-08-07T14:52:04.379623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:04.539750Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.539750Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:3a9602d36bbc081e7e2fb0e5ac8457cca036f0e203e411a65ae39bbdc705984a","observation_id":"70584995-12c7-48a0-89ce-68f725df6f8d","resolution":{"observed_at":"2026-08-07T14:52:04.539750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T14:52:04.677406Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.677406Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:44cf990276de561137f818c6b3b9b3610b3174fd0f09eeca4ebdb6adc986618a","observation_id":"5db061ba-bb92-4291-80e2-ec1c3ab061f2","resolution":{"observed_at":"2026-08-07T14:52:04.677406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:04.770528Z","title":"Flamingo: a visual language model for few-shot learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.770528Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:0ff63bbe85669f5b9bd7210936a770a8844748da08e49cb18e341c1054d6f30e","observation_id":"98609cdd-071d-48fc-a888-967810b5d0dd","resolution":{"observed_at":"2026-08-07T14:52:04.770528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:14.067492Z","title":"Language is not all you need: Aligning perception with language models,","venue":null,"work_id":"2cb29810-019d-4bf1-9f0b-2abd09c0f6b4","year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:04.917798Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:bbbc4b38636b630f4c9a5c45eb477d215ae200b895cc9ee54e9044157b3fa49c","observation_id":"bc4869a1-3879-4476-9c1f-272048cb17a6","resolution":{"observed_at":"2026-08-07T14:52:14.117267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.00923","last_updated":"2024-05-20T06:43:48Z","snapshot_observed_at":"2026-08-21T19:00:44.723890Z","submitted_at":"2023-02-02T07:51:19Z","title":"Multimodal Chain-of-Thought Reasoning in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.00923","snapshot_observed_at":"2026-08-07T14:52:05.094450Z","title":"Multimodal chain-of-thought reasoning in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.094450Z"},"links":{"cited_paper":"/paper/2302.00923","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:abf5c01c22cbf3bf517bfa6a7103900fe0b651c9dcf8d26f82a30ee2d83ddea6","observation_id":"47117c81-1b56-4a5b-aae9-9bfb30599547","resolution":{"observed_at":"2026-08-07T14:52:05.094450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.902303Z","title":"Kimi k1.5: Scaling reinforcement learning with llms,","venue":null,"work_id":"05af62b5-b0a5-4ba6-855d-a06e7e339f33","year":2025},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.186005Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:4744e5edf743975941b8171fd0aeba77e3d6fa4932114213df3fd79405eebd5e","observation_id":"09fdddc4-ddbc-4e47-8c00-b13a5032e0aa","resolution":{"observed_at":"2026-08-07T14:52:13.964943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.758602Z","title":"Multimodal transformer with multi-view visual representation for image captioning,","venue":null,"work_id":"e81e84f0-8853-481c-b474-663049108abd","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.270372Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:d0aa9d66019783e3fa80acec773c318fc3f5dabd9a0c2e42919837d1f643765f","observation_id":"61a44add-9445-4537-aaa6-470852bb6cc7","resolution":{"observed_at":"2026-08-07T14:52:13.839155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:05.384694Z","title":"Vqa: Visual question answering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.384694Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:1a602660575068809399313d68d51723e253bf6863149ecf0494a25f549131ab","observation_id":"12569a1d-b954-4dba-951a-aa8085cbd105","resolution":{"observed_at":"2026-08-07T14:52:05.384694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:05.476390Z","title":"Eyes wide shut? exploring the visual shortcomings of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.476390Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ac1b0bda095cbecec9f5d8f25ea76394da877b8dc46c721e3f5450f9dd105ae0","observation_id":"8bb64434-aec4-491f-8c0d-89bf212f3a5b","resolution":{"observed_at":"2026-08-07T14:52:05.476390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03601","last_updated":"2025-06-12T00:15:18Z","snapshot_observed_at":"2026-08-19T05:13:34.535041Z","submitted_at":"2023-07-07T13:43:44Z","title":"GPT4RoI: Instruction Tuning Large Language Model on Region-of-Interest","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03601","snapshot_observed_at":"2026-08-07T14:52:05.597599Z","title":"Gpt4roi: Instruction tuning large language model on region-of-interest,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.597599Z"},"links":{"cited_paper":"/paper/2307.03601","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:c79b06906c74f6be169c4231a909ee8d5f0298640b316cdb08eb93aaa3a75071","observation_id":"cc12dd15-7ac6-46de-a797-54b4ce1bddf1","resolution":{"observed_at":"2026-08-07T14:52:05.597599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T14:52:05.690123Z","title":"Kosmos-2: Grounding multimodal large language models to the world,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.690123Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:09796741a9ebb4d2cb8ed2202b1d74c86405a86226b9eb7cebab023cba827153","observation_id":"53446d3c-8f1f-4f37-b759-51d558bf7049","resolution":{"observed_at":"2026-08-07T14:52:05.690123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.579479Z","title":"Glamm: Pixel grounding large multimodal model,","venue":null,"work_id":"b095c8c1-ddeb-4833-a678-e44cfdcea8b2","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.769581Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2e0edc537c0775530717facc86b7b20dfea15bb1af1d235d4f66ca2e9acb6cf4","observation_id":"29156912-f77a-44c8-ac02-3ef445607f04","resolution":{"observed_at":"2026-08-07T14:52:13.659627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-07T14:52:05.858115Z","title":"Hallucination of multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:05.858115Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:f8dd4a4e5908bef3f05bd47bf38dc5736d72f974d53852d82433a6b8a6278086","observation_id":"099610fd-b9dd-44de-855d-e0271fb59288","resolution":{"observed_at":"2026-08-07T14:52:05.858115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.414430Z","title":"Honeybee: Locality-enhanced projector for multi- modal llm,","venue":null,"work_id":"3ec49ecd-4654-4720-a06e-d7482d736f9b","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.013664Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:219db7bae7ed790b4545274953aada15fc4fc921d97e74ffdb560546771d4b58","observation_id":"d751b048-6e58-4c5e-9b9d-f1acb8e9589a","resolution":{"observed_at":"2026-08-07T14:52:13.495833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07987","last_updated":"2024-07-25T09:33:50Z","snapshot_observed_at":"2026-08-06T11:02:06.607024Z","submitted_at":"2024-05-13T17:58:30Z","title":"The Platonic Representation Hypothesis","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07987","snapshot_observed_at":"2026-08-07T14:52:06.128909Z","title":"The platonic representation hypothesis,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.128909Z"},"links":{"cited_paper":"/paper/2405.07987","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2383f596338e16a5d5ecc0451267c3be97c4fdbc30f1b4b6b8f16ec7dd8c2be8","observation_id":"3bcaf127-cac2-4f33-aa77-d8a119ec9186","resolution":{"observed_at":"2026-08-07T14:52:06.128909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.254793Z","title":"von Neumann,Mathematische Grundlagen der Quantenmechanik","venue":null,"work_id":"402f9222-4088-4c79-87f8-ffa217f4d22f","year":null},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.209608Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:455235112480bc783a8914eeba4ed7d3ff57bacded9cc0186ddd665d373f0a40","observation_id":"29f11f75-9d76-409a-8d86-51f6192b84f6","resolution":{"observed_at":"2026-08-07T14:52:13.345684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.952624Z","title":"Linear algebraic structure of word senses, with applications to polysemy,","venue":null,"work_id":"b69d8f4d-aa32-49ef-839a-711c8f2b990a","year":2018},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.426208Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:118e802dc45cb9b50ea23570bad67137648379871a9ff5ce3e365068017a50ea","observation_id":"1cd1b476-c3c0-49af-a2cf-202ca427a365","resolution":{"observed_at":"2026-08-07T14:52:13.022576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.15949","last_updated":"2023-04-04T06:43:19Z","snapshot_observed_at":"2026-08-17T13:04:26.585781Z","submitted_at":"2021-03-29T20:51:33Z","title":"Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.15949","snapshot_observed_at":"2026-08-07T14:52:06.502588Z","title":"Transformer visualization via dictionary learning: contextualized embedding as a linear superposition of transformer factors,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.502588Z"},"links":{"cited_paper":"/paper/2103.15949","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:5ed09977ac86fbfc60412f89aada7c54ab5a07b5885f60ee923445bb06827b2e","observation_id":"ced2b0b2-19d7-456f-875c-eeb48feff724","resolution":{"observed_at":"2026-08-07T14:52:06.502588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.796586Z","title":"Signal recovery from random measurements via orthogonal matching pursuit,","venue":null,"work_id":"13a94d90-4b86-4f01-9710-e82ed11f0356","year":2007},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.619408Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:79658499585bff0b45237f91ed3467288b092c93ec721d93b52a37867f405871","observation_id":"ba7c44c2-883e-48e9-96ee-9444c5df2e11","resolution":{"observed_at":"2026-08-07T14:52:12.858259Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.604309Z","title":"Recognize anything: A strong image tagging model,","venue":null,"work_id":"97e4d2d5-8eb0-4a8f-8e2e-d16b3c7198fd","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.690111Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:8af7312ac4809f30f0f18dfa49fa2723e33358ecc31333b051b2842e9339c085","observation_id":"bc3cf9d0-2f91-4990-82cc-56bd5650f420","resolution":{"observed_at":"2026-08-07T14:52:12.717265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.414347Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection,","venue":null,"work_id":"0e5651f3-12de-4953-9ede-f5135ada925a","year":2025},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.753385Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:519dac0b996fe1b439e647d4090d176a179c339eb784bd15886cf8b9f0722cd3","observation_id":"8fedc27c-4a1b-4068-8304-468498f53fef","resolution":{"observed_at":"2026-08-07T14:52:12.505247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:06.817193Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.817193Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:cc166454f44ee7c54fd5eba93689d009af997386da1cc3dea886c5e2adb71c93","observation_id":"69cb3100-d9ea-4117-95a9-8016afa821b8","resolution":{"observed_at":"2026-08-07T14:52:06.817193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-07T14:52:06.857116Z","title":"Llava-next-interleave: Tack- ling multi-image, video, and 3d in large multimodal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.857116Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:8fdb58debde9826b54fea80943afbf1a1f8e673b5599d6259b88de1ca5e63ffd","observation_id":"f5cf6810-da43-4cd8-81d0-acd914e552a2","resolution":{"observed_at":"2026-08-07T14:52:06.857116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-08-13T18:58:34.541884Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-07T14:52:06.924738Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning. arxiv 2023,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.924738Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:a0980c8e4eef2ab6edf2a7a6216fac890ec85b8a1b3f0d44b0c631670715dd6f","observation_id":"26a3b850-f28d-414e-a021-fcf65bd986ea","resolution":{"observed_at":"2026-08-07T14:52:06.924738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-08-16T15:25:23.093007Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T14:52:06.984546Z","title":"Mimic-it: Multi-modal in-context instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.984546Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:30500df0b9010c3f6b804fbf275849281d1a9fc8d155842bb1ab06df32b24d1b","observation_id":"a61da63f-e94a-4644-8fe6-02badd35fdaa","resolution":{"observed_at":"2026-08-07T14:52:06.984546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-07T14:52:07.035989Z","title":"mplug- owl: Modularization empowers large language models with multimodality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.035989Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:d3de8525473062c285165c113740f6b7dfe73e08c0f673cf493a8004959dc5a0","observation_id":"a07487ff-fff9-47ec-8cc0-69e5657edb1b","resolution":{"observed_at":"2026-08-07T14:52:07.035989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07865","last_updated":"2024-05-30T13:08:48Z","snapshot_observed_at":"2026-08-19T23:42:33.827817Z","submitted_at":"2024-02-12T18:21:14Z","title":"Prismatic VLMs: Investigating the Design Space of Visually-Conditioned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07865","snapshot_observed_at":"2026-08-07T14:52:07.161010Z","title":"Prismatic vlms: Investigating the design space of visually-conditioned language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.161010Z"},"links":{"cited_paper":"/paper/2402.07865","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:3b8051aa759531dfe8f609e44734f5bfc6eecba3a91415636917615875583012","observation_id":"294bd963-4843-4895-a63b-ea8567de710b","resolution":{"observed_at":"2026-08-07T14:52:07.161010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-07T14:52:07.253612Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.253612Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:08c35ca03ec8e34e73b2e7d000e9aeaba6bc8eef593f8457729bde2d2316c921","observation_id":"410e58b5-1c87-450d-9d58-7086b04f6ba4","resolution":{"observed_at":"2026-08-07T14:52:07.253612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2408.16357","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:09.788755Z","title":"Law of vision representation in mllms,","venue":null,"work_id":"5c5bbc01-718c-49b0-9345-0c43812621bd","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.363562Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:c52e83ad1fd73c82da100939b6afde7d5f8243c9f6f662190672235ff7a86b8c","observation_id":"f78e1c9d-00dd-436e-bc06-0b9b921d9ed9","resolution":{"observed_at":"2026-08-07T14:52:09.875483Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.264580Z","title":"Learning transferable visual models from natural language supervi- sion,","venue":null,"work_id":"8e915332-5b53-485b-afd3-15c042677080","year":2021},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.459692Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ae4a520704b54c5ffb080ef30d8c48ef3057c78dc37296f25447fb536b9e01ed","observation_id":"58d0ae74-b066-4fa9-8c35-3430164cc0ef","resolution":{"observed_at":"2026-08-07T14:52:12.324474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07167","last_updated":"2024-10-16T07:23:03Z","snapshot_observed_at":"2026-08-16T13:10:59.354278Z","submitted_at":"2024-10-09T17:59:04Z","title":"Deciphering Cross-Modal Alignment in Large Vision-Language Models with Modality Integration Rate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07167","snapshot_observed_at":"2026-08-07T14:52:07.553797Z","title":"Deciphering cross-modal alignment in large vision-language models with modality integration rate,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.553797Z"},"links":{"cited_paper":"/paper/2410.07167","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:fc77e6d1ff349bd0a6edab11bcd9c27d4a0c88af96526b05facb5634ee1340ed","observation_id":"afd9b67a-ee7f-4db6-a5d8-cecc6819e3b2","resolution":{"observed_at":"2026-08-07T14:52:07.553797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-20T02:39:35.450758Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T14:52:07.702315Z","title":"Towards interpreting visual information processing in vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.702315Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:f1a1763e7e47689b7605e4aa01b1d89299b974139d43e70bf88769dd18bc334a","observation_id":"d5c0e1f4-08fa-4fae-a4d5-f324eebe1557","resolution":{"observed_at":"2026-08-07T14:52:07.702315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09691","last_updated":"2024-11-14T18:57:07Z","snapshot_observed_at":"2026-08-18T13:55:45.506821Z","submitted_at":"2024-11-14T18:57:07Z","title":"Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09691","snapshot_observed_at":"2026-08-07T14:52:07.801312Z","title":"Advancing fine-grained visual understanding with multi-scale alignment in multi-modal models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.801312Z"},"links":{"cited_paper":"/paper/2411.09691","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:08300e5959e10720f981806d020b8106dec700f74ff1e70669262ad7704b8976","observation_id":"258e03ae-c032-4490-886e-02438a42f2c5","resolution":{"observed_at":"2026-08-07T14:52:07.801312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11813","last_updated":"2025-09-05T07:15:34Z","snapshot_observed_at":"2026-08-18T00:33:52.656288Z","submitted_at":"2024-08-21T17:58:02Z","title":"SEA: Supervised Embedding Alignment for Token-Level Visual-Textual Integration in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11813","snapshot_observed_at":"2026-08-07T14:52:07.914884Z","title":"Sea: Supervised embedding alignment for token-level visual-textual integration in mllms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:07.914884Z"},"links":{"cited_paper":"/paper/2408.11813","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:939b64739c3bb4b39caa8b58baf7103d2fde036640b2d4655d324b7a47a0577f","observation_id":"15f7dcb8-de70-4ef8-a31d-a938af74c5c5","resolution":{"observed_at":"2026-08-07T14:52:07.914884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:12.124738Z","title":"Honeybee: Locality-enhanced projector for multimodal llm,","venue":null,"work_id":"bbd710c4-8d04-48c7-8e2d-4041e560e741","year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.003998Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ec3edd602611584524a4cf3d1a293b3efbb9b2e30afdd7a266c1a3c7d14b1335","observation_id":"ffb7bfab-4a76-425f-9254-89705a2460c8","resolution":{"observed_at":"2026-08-07T14:52:12.176356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:08.137009Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.137009Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:3f382f320bd78601f2dc33d7c40c74bcc42357d52084e7bc271c781f9341679c","observation_id":"a4e8b62b-1cb5-45b0-aee7-596158711fb4","resolution":{"observed_at":"2026-08-07T14:52:08.137009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.906471Z","title":"Referitgame: Referring to objects in photographs of natural scenes,","venue":null,"work_id":"97175ee9-b64c-4a83-a369-254438ce4ba5","year":2014},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.278205Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:8b4a9e1d779538ad3a058c0f050f0b4aea99b34b658e0eb2f15b09cf2b3f5ba6","observation_id":"66925e60-7f15-4ea4-b05c-42d93478d3d6","resolution":{"observed_at":"2026-08-07T14:52:11.991080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.703927Z","title":"Generation and comprehension of unambiguous object descriptions,","venue":null,"work_id":"b62d5ee2-765f-4f49-8704-55d91f579d3c","year":2016},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.425913Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:944fc1b2020f919d97708dad6655b2ffddaddcd6c7b6f990f7b8d0e98d8228de","observation_id":"766fa7c7-55c0-4cef-81ca-9e6e07e5deed","resolution":{"observed_at":"2026-08-07T14:52:11.792342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T14:52:08.552384Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.552384Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:e7affe13d6f7e6e28069fca5867b9a6928839eeb69141ed7772b30529604e6bc","observation_id":"519e912a-9cd7-48be-99a7-28ddc9d0707c","resolution":{"observed_at":"2026-08-07T14:52:08.552384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.426261Z","title":"Introducing idefics: An open reproduction of state-of-the-art visual language model,","venue":null,"work_id":"a808e0c2-0209-4051-8183-1325e676bdfa","year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.630284Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2799af3d220dccb46ec052ee3167bcb2cabf564f5d9523c4c62bf41998b1ee45","observation_id":"94b6ad84-73b1-435c-aefb-38348b595dfe","resolution":{"observed_at":"2026-08-07T14:52:11.567486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T14:52:08.711601Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.711601Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:d353afe138908bda261b193cb1ce1cdb31c9cc804480474b602fb3c3941105bc","observation_id":"aebb9424-4cd8-4cc6-9db1-d85de7550613","resolution":{"observed_at":"2026-08-07T14:52:08.711601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-08-16T13:26:40.822276Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-07T14:52:08.800402Z","title":"Instruction tuning with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.800402Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:a93aea6f2efdc4f753993e68a1a9bb269f345bf174a58a3dc42bfd1494b792e2","observation_id":"3ee107fa-bfd8-4446-bb2a-7f31b967b7e0","resolution":{"observed_at":"2026-08-07T14:52:08.800402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:52:08.905998Z","title":"The llama 3 herd of models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:08.905998Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:2760b233ddaf7348c0e177f93565c48bc8e7fccd2a92e4a6c1d8ddf946a98890","observation_id":"da6a0ac9-3e8b-4782-b358-5e15b6c0d4cf","resolution":{"observed_at":"2026-08-07T14:52:08.905998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:11.177375Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":"376c5298-53a9-4f70-b073-839f005f173a","year":2023},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.039392Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:0c8ea1135c852a7183b405df3268b848afb85c5ac57d9702a33f90ddc4044e79","observation_id":"55246c22-573a-4a8c-a38f-94e1528d6620","resolution":{"observed_at":"2026-08-07T14:52:11.305627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.934882Z","title":"Towards vqa models that can read,","venue":null,"work_id":"35b65749-409f-4c3f-a8b2-889a194a9a16","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.193236Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:266f12dff055c7ab06ef3a9330c9819a515de14aadc35b34a1eee9db5785196d","observation_id":"717aab0c-5678-414b-b5a8-09c0685b4fdd","resolution":{"observed_at":"2026-08-07T14:52:11.043224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.697469Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering,","venue":null,"work_id":"ee40da22-49c9-46b0-be18-62888090fff8","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.291633Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:a61055e15afc2d8da52b1875a0363b985668478e0bba88f5b6079261eea682ee","observation_id":"b5e92fd3-23ec-473a-ba67-f160ea063043","resolution":{"observed_at":"2026-08-07T14:52:10.787542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.441381Z","title":"Ocr-vqa: Visual question answering by reading text in images,","venue":null,"work_id":"5e87f358-a64a-4fc6-8954-1775eab68e21","year":2019},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.394927Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:5851a77581eb7eb19748792b7c4acb4b2d76b67f3df40ae4500d945f8379507f","observation_id":"9143f5af-b801-45d4-b5fa-ced2989a23a3","resolution":{"observed_at":"2026-08-07T14:52:10.559675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:10.199829Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations,","venue":null,"work_id":"56453923-ca62-4d81-8369-b39a9a27eb92","year":2017},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:09.476244Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:07acabd495e1c315e01c9d7dcf8530ab6ad94f1e2632cf1d21f11151d5062ce4","observation_id":"894462a2-6627-4fe4-a7f7-ad0abbf5ec84","resolution":{"observed_at":"2026-08-07T14:52:10.298358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:52:13.082593Z","title":null,"venue":null,"work_id":"11d5f461-bb33-40b0-9569-eb1e10702e2b","year":1955},"citing_paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models","version":1},"reference_index":1932,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:06.306580Z"},"links":{"citing_paper":"/paper/2505.17316"},"observation_digest":"sha256:ea490e807328b00269860cc84b311b6b626fa5927f992855c903feece6e01bc5","observation_id":"81ffb6bc-c061-4c86-96d1-c38e50e59701","resolution":{"observed_at":"2026-08-07T14:52:13.179783Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17316","last_updated":"2025-05-22T22:10:27Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T13:56:45.490662Z","submitted_at":"2025-05-22T22:10:27Z","title":"Analyzing Fine-Grained Alignment and Enhancing Vision Understanding in Multimodal Language Models"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":1,"verified_fuzzy":22},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 4 inbound Pith citation observations for arXiv:2505.17316."}