{"as_of":"2026-08-17T23:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5ce4ba184e9b49c44bf68f70b6ec9feba696fcc2fedd9832b973d40559849046","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:13:03.169164Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T02:36:26.526436Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"reference_index":126,"source":"pdf_text","source_observed_at":"2026-05-12T20:58:58.849040Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2404.16821"},"observation_digest":"sha256:184e4a2b54ab9baacde50b69f13288f52de5da9a1dd2fd6cc103821bd7658319","observation_id":"7dc71625-7470-4bd5-9191-21555ca9f18b","resolution":{"observed_at":"2026-05-12T20:58:59.266253Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"reference_index":158,"source":"pdf_text","source_observed_at":"2026-05-17T10:46:28.447347Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2407.03320"},"observation_digest":"sha256:5e34351053bb6ba561df6608fc5e5b588d6b9ad9842c943f66bb66063e716902","observation_id":"4160050a-63f9-4da2-a747-14b2a3401ff5","resolution":{"observed_at":"2026-05-17T10:46:28.791681Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-10T21:07:31.387726Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2408.01800"},"observation_digest":"sha256:939edce60ed8526b458d3c5359842623548ed232b71a5f768826460ad10d3d24","observation_id":"7eb48ea3-aab4-46d7-89a3-843fd6901bcf","resolution":{"observed_at":"2026-05-10T21:07:32.061335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:c1f89113aa92095d9ef84ddddf3d326496ff86dd985dbd98216bd8985cb5efcb","observation_id":"2a176405-3573-42a4-9762-43da5b515c7e","resolution":{"observed_at":"2026-05-16T07:59:32.722067Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2410.17247","last_updated":"2025-02-27T11:16:33Z","snapshot_observed_at":"2026-08-12T14:42:48.682739Z","submitted_at":"2024-10-22T17:59:53Z","title":"PyramidDrop: Accelerating Your Large Vision-Language Models via Pyramid Visual Redundancy Reduction","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-15T12:12:14.613620Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2410.17247"},"observation_digest":"sha256:a195fe4ee0d1568e6d2e9336384815c424de224a2eb384d7649ad2827691b109","observation_id":"bff25321-8cc8-4f57-ac0e-fab80c0b6773","resolution":{"observed_at":"2026-05-15T12:12:14.716016Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T20:27:20.055623Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09691","last_updated":"2024-11-14T18:57:07Z","snapshot_observed_at":"2026-08-12T20:20:39.448843Z","submitted_at":"2024-11-14T18:57:07Z","title":"Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T20:27:20.055623Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.09691"},"observation_digest":"sha256:8e73b273498a0ed77e332612b079f3d66a2c71695fd811fb5128606b046a6fa7","observation_id":"4c9380e0-8f64-479a-9a71-12683b17e959","resolution":{"observed_at":"2026-08-12T20:27:20.055623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T17:37:54.873349Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12787","last_updated":"2025-07-01T11:18:54Z","snapshot_observed_at":"2026-08-15T16:38:25.900123Z","submitted_at":"2024-11-19T11:03:09Z","title":"From Holistic to Localized: Local Enhanced Adapters for Efficient Visual Instruction Fine-Tuning","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T17:37:54.873349Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.12787"},"observation_digest":"sha256:4c9a2e22d1bb6d3fe4f6ef3bc029da9c06cf3d4ab133de70c39f38a360ce5960","observation_id":"6aee29cb-5595-4836-be2c-d468dbc7c14c","resolution":{"observed_at":"2026-08-12T17:37:54.873349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T17:00:24.637561Z","title":"LLaV A-UHD: an lmm perceiving any aspect ratio and high- resolution images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13033","last_updated":"2024-11-20T04:43:37Z","snapshot_observed_at":"2026-08-14T22:04:06.870296Z","submitted_at":"2024-11-20T04:43:37Z","title":"LMM-driven Semantic Image-Text Coding for Ultra Low-bitrate Learned Image Compression","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:00:24.637561Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.13033"},"observation_digest":"sha256:f82a075a0cb4889a836b8afbb2e3fd56affe3faad74917973ea7c79a67fc5822","observation_id":"b5ccce93-dd71-4f15-af6e-bde51b409499","resolution":{"observed_at":"2026-08-12T17:00:24.637561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T15:28:37.486326Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14228","last_updated":"2024-11-21T15:37:52Z","snapshot_observed_at":"2026-08-13T13:07:22.672801Z","submitted_at":"2024-11-21T15:37:52Z","title":"FocusLLaVA: A Coarse-to-Fine Approach for Efficient and Effective Visual Token Compression","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:28:37.486326Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.14228"},"observation_digest":"sha256:d603fa89d2f758c4f27837860f21c0ebf1713ccb897782b0df628866e9156b50","observation_id":"adf3e0c0-7b68-4965-945b-5221e8622735","resolution":{"observed_at":"2026-08-12T15:28:37.486326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T15:17:06.921149Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14432","last_updated":"2025-05-02T16:03:31Z","snapshot_observed_at":"2026-08-17T16:49:55.394145Z","submitted_at":"2024-11-21T18:59:55Z","title":"Insight-V: Exploring Long-Chain Visual Reasoning with Multimodal Large Language Models","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:17:06.921149Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.14432"},"observation_digest":"sha256:fa4bb424bfe5ff01d6ff9d47bbf44ff7eb0c0e769aacdb40a894d8bb1eb8892c","observation_id":"243f9db7-0ee0-452f-875f-e68730c06957","resolution":{"observed_at":"2026-08-12T15:17:06.921149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T15:16:27.913904Z","title":"LLaV A-UHD: an lmm perceiving any aspect ratio and high- resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14522","last_updated":"2025-03-27T15:24:29Z","snapshot_observed_at":"2026-08-16T07:36:40.507887Z","submitted_at":"2024-11-21T18:59:36Z","title":"GMAI-VL & GMAI-VL-5.5M: A Large Vision-Language Model and A Comprehensive Multimodal Dataset Towards General Medical AI","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T15:16:27.913904Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.14522"},"observation_digest":"sha256:e27e98b18a842e6f4eeabe83f62d57920dbeb68f39f4f5fa2dc864f0a36fe13b","observation_id":"e2fd5e40-6ffa-47b7-a945-2e14b621c775","resolution":{"observed_at":"2026-08-12T15:16:27.913904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T14:21:34.872391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15453","last_updated":"2024-11-23T05:03:32Z","snapshot_observed_at":"2026-08-17T18:06:37.262645Z","submitted_at":"2024-11-23T05:03:32Z","title":"Enhancing Instruction-Following Capability of Visual-Language Models by Reducing Image Redundancy","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T14:21:34.872391Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.15453"},"observation_digest":"sha256:18f06fdc608266eb5f1dc0c6c0af46d3503c23b2a09670cda91ed3166b67a1f2","observation_id":"ef32f889-edb0-484f-86f7-91a1467a4adb","resolution":{"observed_at":"2026-08-12T14:21:34.872391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T11:19:33.866411Z","title":"Llava-uhd: an LMM perceiving any aspect ratio and high-resolution images.arXiv: 2403.11703, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-17T20:39:44.009790Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T11:19:33.866411Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.18363"},"observation_digest":"sha256:a73111ab891b07cc324e2665bc0b2b1a7681eadcccc2527ee4bf69c532808b8b","observation_id":"33b7389b-5513-4a1d-9481-c34d3bcb9e98","resolution":{"observed_at":"2026-08-12T11:19:33.866411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T05:52:39.162003Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution im- ages","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19774","last_updated":"2025-04-04T20:29:02Z","snapshot_observed_at":"2026-08-17T21:03:57.165285Z","submitted_at":"2024-11-29T15:20:29Z","title":"PerLA: Perceptive 3D Language Assistant","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T05:52:39.162003Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2411.19774"},"observation_digest":"sha256:08ef145cc1e195d0e0dd1bed1297eb32b11d08893333e7fb870d94d78c9badfc","observation_id":"5647cc14-a07e-43cd-b4f1-8ea8d72e7d65","resolution":{"observed_at":"2026-08-12T05:52:39.162003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T05:21:10.945578Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.00556","last_updated":"2024-12-08T04:41:32Z","snapshot_observed_at":"2026-08-15T14:21:56.324890Z","submitted_at":"2024-11-30T18:54:32Z","title":"Accelerating Multimodal Large Language Models by Searching Optimal Vision Token Reduction","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T05:21:10.945578Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.00556"},"observation_digest":"sha256:d8d6f8e4c9883c7645fa237f92da3a3c26a588326323cc0ad2723da23aa1daed","observation_id":"d9beaaad-9d20-4101-9fe7-7fbb08b79fcd","resolution":{"observed_at":"2026-08-12T05:21:10.945578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-12T00:57:32.547350Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01818","last_updated":"2025-05-11T17:45:02Z","snapshot_observed_at":"2026-08-17T07:14:12.508584Z","submitted_at":"2024-12-02T18:57:40Z","title":"Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T00:57:32.547350Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.01818"},"observation_digest":"sha256:ce9bc012afde466f02bba3928098c6de62574841d4f17fba4e49158f234a3654","observation_id":"54a415b3-819d-41fb-977b-ce08a5b70f4b","resolution":{"observed_at":"2026-08-12T00:57:32.547350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T16:10:29.030128Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10342","last_updated":"2025-02-03T15:23:02Z","snapshot_observed_at":"2026-08-16T21:29:45.287256Z","submitted_at":"2024-12-13T18:40:10Z","title":"Iris: Breaking GUI Complexity with Adaptive Focus and Self-Refining","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T16:10:29.030128Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.10342"},"observation_digest":"sha256:11e052271429866c59a34b1d87e06bca45b5868aa63ef8841891ea5ece14023a","observation_id":"a0472031-8831-4bed-a82c-bec1764fb727","resolution":{"observed_at":"2026-08-11T16:10:29.030128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T10:49:08.371099Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16158","last_updated":"2025-02-09T05:35:18Z","snapshot_observed_at":"2026-08-15T07:37:36.527948Z","submitted_at":"2024-12-20T18:59:59Z","title":"HoVLE: Unleashing the Power of Monolithic Vision-Language Models with Holistic Vision-Language Embedding","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-08-11T10:49:08.371099Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.16158"},"observation_digest":"sha256:e178ea0eda0bf1cc79ea7e18126f7aab844ec3edb3944bae1c0eaf87be661a97","observation_id":"dbb3d671-2012-410a-884e-ad8830cd6e8c","resolution":{"observed_at":"2026-08-11T10:49:08.371099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T10:43:08.309295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.16364","last_updated":"2024-12-20T21:55:15Z","snapshot_observed_at":"2026-08-15T05:20:03.750113Z","submitted_at":"2024-12-20T21:55:15Z","title":"A High-Quality Text-Rich Image Instruction Tuning Dataset via Hybrid Instruction Generation","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T10:43:08.309295Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.16364"},"observation_digest":"sha256:041323f3f1fe1846843da2791f2c61897ea6e89403c19a3d8e7dd8b802f57190","observation_id":"bd986c29-9567-499f-ab33-9bc948658b71","resolution":{"observed_at":"2026-08-11T10:43:08.309295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-11T00:21:52.300528Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.19509","last_updated":"2025-03-21T06:01:23Z","snapshot_observed_at":"2026-08-16T19:45:19.464261Z","submitted_at":"2024-12-27T07:55:36Z","title":"MBQ: Modality-Balanced Quantization for Large Vision-Language Models","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T00:21:52.300528Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2412.19509"},"observation_digest":"sha256:6f6ba8c5b6e0f2d30d6b4fcc80f4de506418c543179857facf1a805cf9bb3cfe","observation_id":"ca19e749-1942-4d8e-87fb-4d3f901b9cce","resolution":{"observed_at":"2026-08-11T00:21:52.300528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-10T22:17:28.060042Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-14T06:27:37.289549Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:28.060042Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:3d3d6878138315c4cf871135aff8b013d5f1a96d84272bb4bd19d1a5693ae28a","observation_id":"6bfcd838-d87c-49f2-bbd7-cf1f88539ebb","resolution":{"observed_at":"2026-08-10T22:17:28.060042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-10T19:28:28.962345Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.10011","last_updated":"2025-01-17T07:48:37Z","snapshot_observed_at":"2026-08-13T19:19:31.433906Z","submitted_at":"2025-01-17T07:48:37Z","title":"Mitigating Hallucinations on Object Attributes using Multiview Images and Negative Instructions","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T19:28:28.962345Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2501.10011"},"observation_digest":"sha256:e0b6fd1c4f7435374fcc19f764eb5b84bd4360df42a74b57bcf7e3c70197e143","observation_id":"97733769-5075-41b0-9ffd-ae8eb34423ac","resolution":{"observed_at":"2026-08-10T19:28:28.962345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-10T18:04:34.961445Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"reference_index":216,"source":"pdf_text","source_observed_at":"2026-08-10T18:04:34.961445Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2501.14818"},"observation_digest":"sha256:a26b9e737af0c2418f5d697605f1e2d01d1d01bda45ed1f5c1cd96e10a8840c4","observation_id":"641d1f68-7aca-4ac3-b248-8dcc02586bb5","resolution":{"observed_at":"2026-08-10T18:04:34.961445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-08T14:25:55.962910Z","title":"Llava-uhd: an LMM perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06788","last_updated":"2025-07-24T10:29:52Z","snapshot_observed_at":"2026-08-09T02:10:24.105469Z","submitted_at":"2025-02-10T18:59:58Z","title":"EVEv2: Improved Baselines for Encoder-Free Vision-Language Models","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-08T14:25:55.962910Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2502.06788"},"observation_digest":"sha256:968c90ee110302ff8d29a934309c772f7368e1482b75ba8d2836cde745550dad","observation_id":"c73ca218-7d4b-46d1-83c3-fb6010d0fa22","resolution":{"observed_at":"2026-08-08T14:25:55.962910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-16T01:01:03.854216Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02413","last_updated":"2025-05-05T07:18:47Z","snapshot_observed_at":"2026-08-17T11:44:54.795639Z","submitted_at":"2025-05-05T07:18:47Z","title":"Task-Oriented Semantic Communication in Large Multimodal Models-based Vehicle Networks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T01:01:03.854216Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2505.02413"},"observation_digest":"sha256:cdad26b32ce449c99de3d2898493aec4f0219cba534573b0bd003136440469de","observation_id":"5b74ac38-e830-468f-a941-ae1a69344cba","resolution":{"observed_at":"2026-08-16T01:01:03.854216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-16T04:13:03.169164Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02867","last_updated":"2025-05-03T15:19:20Z","snapshot_observed_at":"2026-08-17T16:46:32.484219Z","submitted_at":"2025-05-03T15:19:20Z","title":"RESAnything: Attribute Prompting for Arbitrary Referring Segmentation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:13:03.169164Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2505.02867"},"observation_digest":"sha256:4ff5ca52b8211cf85f41e8011ae998f03249cb742e1081303d77f9b84fe91251","observation_id":"4207f9a5-e042-4533-96ab-33b5cfcdf685","resolution":{"observed_at":"2026-08-16T04:13:03.169164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2505.15436","last_updated":"2025-12-05T05:44:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T12:18:15Z","title":"Adaptive Chain-of-Focus Reasoning via Dynamic Visual Search and Zooming for Efficient VLMs","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-17T05:35:13.118221Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2505.15436"},"observation_digest":"sha256:78f9f681c769216a0a527a406801cdff79b1095e5cdb7cdb491ab89dba47c623","observation_id":"2a7fd5c2-e049-4bdb-8a1d-5184c95a36b1","resolution":{"observed_at":"2026-05-17T05:35:13.220175Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-07T10:27:08.624340Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05344","last_updated":"2025-07-05T15:40:51Z","snapshot_observed_at":"2026-08-17T12:09:47.821225Z","submitted_at":"2025-06-05T17:59:55Z","title":"SparseMM: Head Sparsity Emerges from Visual Concept Responses in MLLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:08.624340Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2506.05344"},"observation_digest":"sha256:4d8fe4699a57d82544b7ccc038e993e0ed01a615cdb3c404d0a23ceb43f2163b","observation_id":"a948cb9a-ed4a-49d7-a9c0-9c532f81ba55","resolution":{"observed_at":"2026-08-07T10:27:08.624340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-07T04:34:09.966497Z","title":"Llava-uhd: an LMM perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10395","last_updated":"2025-07-12T20:42:24Z","snapshot_observed_at":"2026-08-10T06:38:42.241345Z","submitted_at":"2025-06-12T06:37:34Z","title":"Pisces: An Auto-regressive Foundation Model for Image Understanding and Generation","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T04:34:09.966497Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2506.10395"},"observation_digest":"sha256:54c1cbe160a546400a696cf41e397b71cec9dd5206d88882a3954e5908f3cd72","observation_id":"d30a2810-ca8f-4506-841d-cab57a499d09","resolution":{"observed_at":"2026-08-07T04:34:09.966497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-06T21:19:45.114851Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00505","last_updated":"2025-07-04T13:15:34Z","snapshot_observed_at":"2026-08-15T20:28:40.863571Z","submitted_at":"2025-07-01T07:20:11Z","title":"LLaVA-SP: Enhancing Visual Representation with Visual Spatial Tokens for MLLMs","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:19:45.114851Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2507.00505"},"observation_digest":"sha256:bebbafd1b09ed21dd3906d23e29ee13893a8155995cf5479a394df74d267b97c","observation_id":"04f360b7-f5ba-4a69-b6cf-8a1077010caa","resolution":{"observed_at":"2026-08-06T21:19:45.114851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-06T19:25:02.946036Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.06272","last_updated":"2025-08-09T05:40:33Z","snapshot_observed_at":"2026-08-14T06:43:24.703110Z","submitted_at":"2025-07-08T07:46:26Z","title":"LIRA: Inferring Segmentation in Large Multi-modal Models with Local Interleaved Region Assistance","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T19:25:02.946036Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2507.06272"},"observation_digest":"sha256:4d11468b15dce6a4f38241c192d25625159654c0866041b5325edf43bf1949ac","observation_id":"8a51f921-683d-4c95-aaa1-d22e69acf980","resolution":{"observed_at":"2026-08-06T19:25:02.946036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-15T18:00:46.494815Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21167","last_updated":"2025-08-06T14:05:00Z","snapshot_observed_at":"2026-08-16T10:50:56.150877Z","submitted_at":"2025-07-25T13:30:14Z","title":"ChartM$^3$: Benchmarking Chart Editing with Multimodal Instructions","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T18:00:46.494815Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2507.21167"},"observation_digest":"sha256:24a394212c3c4686a0021b10b2992491f772ea2c9f598f28b06b538520065516","observation_id":"c856420f-0375-4530-bb92-9893575ac663","resolution":{"observed_at":"2026-08-15T18:00:46.494815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-08-03T20:57:33.650037Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images.arXiv preprint arXiv:2403.11703, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17731","last_updated":"2026-06-30T21:37:31Z","snapshot_observed_at":"2026-08-14T07:35:41.065056Z","submitted_at":"2025-11-21T19:30:24Z","title":"VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T20:57:33.650037Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2511.17731"},"observation_digest":"sha256:95ae9d47b180ab7f3a7d35168954ca364e5343fab8644bc59dda1490ac99498c","observation_id":"1e2f5763-d0fa-42bd-93e6-b8142f783d72","resolution":{"observed_at":"2026-08-03T20:57:33.650037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2512.10362","last_updated":"2026-04-27T05:32:18Z","snapshot_observed_at":"2026-08-11T17:18:31.926681Z","submitted_at":"2025-12-11T07:22:54Z","title":"Visual Funnel: Resolving Contextual Blindness in Multimodal Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T23:47:08.562575Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2512.10362"},"observation_digest":"sha256:1b570e5cc337b650ab57d03d14ca9edeada9d65cddce9444a7d5d425c9ebac83","observation_id":"ee24e842-e62e-47ed-ac14-e8fe6817bf62","resolution":{"observed_at":"2026-05-16T23:48:41.926907Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-13T09:40:35.631188Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images.arXiv preprint arXiv:2403.11703, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.04834","last_updated":"2026-06-30T15:42:53Z","snapshot_observed_at":"2026-08-15T06:37:28.519818Z","submitted_at":"2026-04-06T16:35:57Z","title":"E-VLA: Event-Augmented Vision-Language-Action Model for Dark and Blurred Scenes","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-13T09:40:35.631188Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2604.04834"},"observation_digest":"sha256:9c38a5bf0e5487c7309f3c583c98d4f3c13b98cd9df6d9ebf14c6fe239fc5ca9","observation_id":"1877bc03-d0cb-490a-927b-beb65ecab6fa","resolution":{"observed_at":"2026-07-13T09:40:35.631188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2604.04838","last_updated":"2026-04-07T10:14:44Z","snapshot_observed_at":"2026-08-11T17:47:12.506874Z","submitted_at":"2026-04-06T16:41:19Z","title":"Less Detail, Better Answers: Degradation-Driven Prompting for VQA","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T20:17:01.867903Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2604.04838"},"observation_digest":"sha256:0d5e121aca481116794da1dac0ed0cba08f1b50f4d2df9d9cb688a3b187a7c50","observation_id":"653deced-ed06-4e0f-b05e-96b9ec49eb7f","resolution":{"observed_at":"2026-05-10T22:05:47.957190Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2605.16359","last_updated":"2026-05-09T13:13:04Z","snapshot_observed_at":"2026-08-13T05:59:38.627123Z","submitted_at":"2026-05-09T13:13:04Z","title":"How Many Visual Tokens Do Multimodal Language Models Need? Scaling Visual Token Pruning with F^3A","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-20T22:52:28.333209Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2605.16359"},"observation_digest":"sha256:e6565ea9dd9e2c47730950a791b43ff4f902c082ff2dbe0fbfe05524a744bc5e","observation_id":"7d1d40ee-1341-44cb-abad-283d687a1dc1","resolution":{"observed_at":"2026-05-20T22:53:49.169616Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2605.25343","last_updated":"2026-05-25T01:57:43Z","snapshot_observed_at":"2026-07-06T23:35:16.647496Z","submitted_at":"2026-05-25T01:57:43Z","title":"Toward Native Multimodal Modeling: A Roadmap","version":1},"reference_index":209,"source":"pdf_text","source_observed_at":"2026-06-29T22:58:38.610609Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2605.25343"},"observation_digest":"sha256:3e01e3a7bf53f1652e1eb151355d204759e0da18a82d6c570f0d43b1d00fadcd","observation_id":"9de7d28e-7dd8-4052-8e29-2b5b9566c68d","resolution":{"observed_at":"2026-06-29T23:04:01.689687Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2605.28741","last_updated":"2026-05-27T17:01:39Z","snapshot_observed_at":"2026-08-12T14:08:47.746952Z","submitted_at":"2026-05-27T17:01:39Z","title":"Self-Prophetic Decoding to Unlock Visual Search in LVLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-29T12:53:40.783281Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2605.28741"},"observation_digest":"sha256:a7e7aaa97d838547ea513452a8603ccf3fb83a1b3017d503ca49338360b02ea6","observation_id":"08aafe95-02e6-4d43-93a5-4bcb90d34c15","resolution":{"observed_at":"2026-06-29T13:03:26.895231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2403.11703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-02T02:36:26.526436Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":"25282c73-bd39-4fb1-96c3-62fa18aa151a","year":2024},"citing_paper":{"arxiv_id":"2606.03569","last_updated":"2026-06-02T12:36:24Z","snapshot_observed_at":"2026-08-15T05:36:49.314849Z","submitted_at":"2026-06-02T12:36:24Z","title":"When Attention Collapses: Stage-Aware Visual Token Pruning from Structure to Semantics","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:51:38.455604Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2606.03569"},"observation_digest":"sha256:28903b85f1b6d77e3aa86f4a23f9f4da97bc9f7063f6de33ba74fee645499fc9","observation_id":"e7bdc8b3-0d3d-42e5-bd3d-270ddb991127","resolution":{"observed_at":"2026-07-02T02:36:26.528104Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-12T04:17:40.198357Z","title":"arXiv preprint arXiv:2403.11703 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03184","last_updated":"2026-07-03T10:42:34Z","snapshot_observed_at":"2026-08-05T15:07:18.952856Z","submitted_at":"2026-07-03T10:42:34Z","title":"BVS: Bayesian Visual Search with Multimodal Large Language Model for Fine-grained Perception","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-07-12T04:17:40.198357Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2607.03184"},"observation_digest":"sha256:7dd68234047cd8acf49ebdf284c32632ba44df08c6a0a1c93d1e77d2ae8ace7a","observation_id":"d0d2ec27-054d-4647-b706-b20d7448e68f","resolution":{"observed_at":"2026-07-12T04:17:40.198357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-31T15:16:36.341288Z","title":"LLaV A-UHD: An LMM perceiving any aspect ratio and high-resolution images.arXiv preprint arXiv:2403.11703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-14T14:32:41.303512Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.341288Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:44705bbdbd7ee9178678568e7ac671686da221f5a3dbd8787e1a2602e6e2e53c","observation_id":"c955fe02-0de6-4385-83ac-b075f505bd63","resolution":{"observed_at":"2026-07-31T15:16:36.341288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-31T02:56:58.293552Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28590","last_updated":"2026-07-30T17:43:46Z","snapshot_observed_at":"2026-08-10T13:40:32.070762Z","submitted_at":"2026-07-30T17:43:46Z","title":"VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-07-31T02:56:58.293552Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2607.28590"},"observation_digest":"sha256:9e9c0a68adf63e7527856d3205d16f0546febe1733f61f757c00e5380af5012c","observation_id":"ba25bc3d-d543-41ea-ba6b-fe2f83f6904b","resolution":{"observed_at":"2026-07-31T02:56:58.293552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.11703/citation-record","integrity":"/paper/2403.11703/integrity","json":"/paper/2403.11703/citation-record.json","paper":"/paper/2403.11703"},"outbound":[],"paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T14:08:50.290302Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2403.11703."}