{"as_of":"2026-08-10T04:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94e887902f1215b67e4457f1873926af0eac838d8115fc61225dc071c7887fa9","coverage":[{"denominator":74,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":74,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:40:57.963146Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T13:24:17.538850Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T15:09:55.338873Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2605.02730","last_updated":"2026-05-04T15:31:11Z","snapshot_observed_at":"2026-08-02T14:48:33.210016Z","submitted_at":"2026-05-04T15:31:11Z","title":"Perceptual Flow Network for Visually Grounded Reasoning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-08T18:40:55.753827Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2605.02730"},"observation_digest":"sha256:d2ac54db191c69b04053f8e84eee044f801f9808c9e628884e4d11b06752c326","observation_id":"9868b5db-7fe2-451f-b3ad-670da9d701f7","resolution":{"observed_at":"2026-05-09T06:15:38.906515Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-20T10:58:01.621488Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:1b9fe71ac5a791548510ea87708ad530c4d503084ed4eccc7f2eb089173d8f9e","observation_id":"21821802-1710-4230-af71-ed63661cdd3e","resolution":{"observed_at":"2026-05-20T10:58:13.465339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2605.18740","last_updated":"2026-06-02T16:34:00Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:57:04Z","title":"Vision-OPD: Learning to See Fine Details for Multimodal LLMs via On-Policy Self-Distillation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-30T18:28:21.605646Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2605.18740"},"observation_digest":"sha256:fecb8f03b44c59b2497db90d36c8a19e9d8bef45d916d11ce843ba53aa6c2965","observation_id":"e1e983bc-ebd2-4237-8dfa-6156a944dcb8","resolution":{"observed_at":"2026-07-01T14:55:48.539600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2605.27960","last_updated":"2026-05-27T04:54:07Z","snapshot_observed_at":"2026-08-03T00:24:19.442122Z","submitted_at":"2026-05-27T04:54:07Z","title":"Mags-RL: Wearing Multimodal LLMs a Magnifying Glass via Agentic Reinforcement Learning For Complex Scene Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-29T13:38:01.819121Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2605.27960"},"observation_digest":"sha256:5c06591b34cf87e29f7f2c5534ad1c4e7474ef40364d7841da5e2453700148af","observation_id":"73bd0da4-65a6-45c9-8aea-a993e3567ffe","resolution":{"observed_at":"2026-06-29T13:43:28.983723Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2606.00562","last_updated":"2026-05-30T06:33:24Z","snapshot_observed_at":"2026-08-02T17:36:55.980170Z","submitted_at":"2026-05-30T06:33:24Z","title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-28T18:44:39.545911Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2606.00562"},"observation_digest":"sha256:4b147eb899a2a68b2cf2745b7e3a8def7a410cb908b7887c4631e8a8689bcd78","observation_id":"ee861032-4467-4f75-a999-7ab0da331cb7","resolution":{"observed_at":"2026-06-28T20:22:37.728141Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2606.26196","last_updated":"2026-06-24T15:20:32Z","snapshot_observed_at":"2026-07-07T00:00:31.981360Z","submitted_at":"2026-06-24T15:20:32Z","title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","version":1},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-06-26T01:50:54.242508Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2606.26196"},"observation_digest":"sha256:8132922c1e36882572352bebee2d03572dd99be2d28aa1940fdfc2a42061dc01","observation_id":"8c912615-7240-44c2-bdf9-0a1a1cb58bb8","resolution":{"observed_at":"2026-07-04T15:09:55.340686Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2606.30288","last_updated":"2026-06-29T13:30:17Z","snapshot_observed_at":"2026-07-07T00:04:10.492340Z","submitted_at":"2026-06-29T13:30:17Z","title":"VisReflect: Latent Visual Reflection for Fine-Grained Perception in Long Visual Context","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:49.904752Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2606.30288"},"observation_digest":"sha256:ae5d631149f20bee50ac44c090645377e8957f288b14034a7a9bf2382bbd829d","observation_id":"6cdee9f2-199e-463c-a468-e0352d01435a","resolution":{"observed_at":"2026-06-30T06:04:21.312749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"cited_work":{"arxiv_id":"2506.01663","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01663","snapshot_observed_at":"2026-07-04T15:09:55.338873Z","title":"Zoom-refine: Boosting high-resolution multimodal understanding via localized zoom and self-refinement","venue":null,"work_id":"16a051cf-1957-46dc-9115-24532466a089","year":2025},"citing_paper":{"arxiv_id":"2607.01191","last_updated":"2026-07-01T17:24:26Z","snapshot_observed_at":"2026-08-02T15:51:49.700376Z","submitted_at":"2026-07-01T17:24:26Z","title":"Perceive-to-Reason: Decoupling Perception and Reasoning for Fine-Grained Visual Reasoning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-07-02T13:24:17.538850Z"},"links":{"cited_paper":"/paper/2506.01663","citing_paper":"/paper/2607.01191"},"observation_digest":"sha256:32e0fdc680da6519a27af454cb4f8e982bd8e91575529a69f2d7f592486674c6","observation_id":"ba875588-6208-4359-8884-f766a96d17ba","resolution":{"observed_at":"2026-07-02T13:26:58.472521Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01663/citation-record","integrity":"/paper/2506.01663/integrity","json":"/paper/2506.01663/citation-record.json","paper":"/paper/2506.01663"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:15.783087Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":"07f24720-81d6-47e7-9696-b03892626208","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:47.327341Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:62bab6a862659c23a28b6cb5f98dd62b77900a304c9d76a338cd71e2ed8d0fcc","observation_id":"45c38f8e-d3ce-48bd-ba4b-8707c222c4be","resolution":{"observed_at":"2026-08-07T11:41:15.910483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:15.463966Z","title":"Qwen technical report","venue":null,"work_id":"38236c28-b97b-4871-91e2-9c67fac4572f","year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:47.436133Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:18c4c7b04ad86f5270325368261d2dfb6c18c230ea4c6e03caec54ee192a45bd","observation_id":"21388ee8-55fa-40a8-a688-794109a643c0","resolution":{"observed_at":"2026-08-07T11:41:15.658076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:39:47.496339Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:47.496339Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:83225fbbc7cac3b4f51fea85b283fe7aa3d23819ca3b8d137ce23d54703bb59c","observation_id":"76b437c0-1477-4cef-99da-25e08e82863f","resolution":{"observed_at":"2026-08-07T11:39:47.496339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14767","last_updated":"2024-02-22T18:26:02Z","snapshot_observed_at":"2026-08-09T12:50:00.939240Z","submitted_at":"2024-02-22T18:26:02Z","title":"DualFocus: Integrating Macro and Micro Perspectives in Multi-modal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14767","snapshot_observed_at":"2026-08-07T11:39:47.677291Z","title":"Dualfocus: Integrat- ing macro and micro perspectives in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:47.677291Z"},"links":{"cited_paper":"/paper/2402.14767","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:c2708d2db851783a2edecf6ba7cf09f9412be80d41894a48f57c4b5a0dfef175","observation_id":"3692d56d-5932-4216-8d21-bc4b56c42684","resolution":{"observed_at":"2026-08-07T11:39:47.677291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T11:39:49.596369Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:49.596369Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:6217181807c1e5f2bcef6427bc2f1c550838b3deb2f395bf038b1e0805968c68","observation_id":"334684bc-b081-41e7-ac79-568dc72da4c9","resolution":{"observed_at":"2026-08-07T11:39:49.596369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:39:51.790506Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:51.790506Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:bf0a26e1228af060c0a31679f75b0d71b4ad87fe0e7852a6aeb8376727d47ba9","observation_id":"4887c136-36cd-4ac4-abbc-6bf9f3025d34","resolution":{"observed_at":"2026-08-07T11:39:51.790506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T11:39:51.883143Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:51.883143Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:f6db3aea4d72c0e7f9757405de20765849daadcbdc45e7a363b6cda35cd9cb2c","observation_id":"665676c7-b8e3-4351-8709-731161ae88a9","resolution":{"observed_at":"2026-08-07T11:39:51.883143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:15.147029Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":"25b06e31-a505-4c8d-8be4-5fe651d7ccbe","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:51.999902Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:0fddcafc45d8e09f040658b9944013d9a5747dab22198b346f67030d1934cfef","observation_id":"32bca65c-6b13-4103-9b7f-e8af1db770fa","resolution":{"observed_at":"2026-08-07T11:41:15.286495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:39:52.101099Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.101099Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:d0118de98083c2574fa30f5334aa9e18215b172bb542b2a70f5492da858ddeb6","observation_id":"3d43ec70-be5b-486a-8192-5cd6012f69af","resolution":{"observed_at":"2026-08-07T11:39:52.101099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.838050Z","title":"Chain-of-verification reduces hallucination in large language models","venue":null,"work_id":"3b8758b0-a12a-4513-9a6c-b569a64dec5c","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.179476Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:3ece2d7a7091a00629ca3c71de65591692fe8d5e4e8332b01c92bca320e50a3b","observation_id":"c4d04e08-e5a8-4602-bb1a-6b7f10711d09","resolution":{"observed_at":"2026-08-07T11:41:14.972620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.661177Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model","venue":null,"work_id":"f717044a-65a5-4ff2-9d9c-e6ce97d4acf6","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.260843Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:3882969cca74d4d639159e47735865c1dc39f4de1d0a574797dffa1de99145a3","observation_id":"f61066cc-98dd-4a66-8559-fed13358bda7","resolution":{"observed_at":"2026-08-07T11:41:14.746866Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.490198Z","title":null,"venue":null,"work_id":"ffa13c96-dd7d-4b2d-8989-327a82d2b7c2","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.330821Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:5d00c149fdede656558658cb5adf24d2e3b3d74ddfa89c1548196258861bf063","observation_id":"0013e321-7f3e-43e4-b1af-7a9c19f08130","resolution":{"observed_at":"2026-08-07T11:41:14.577533Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.307971Z","title":"Active vision: The psychology of looking and seeing","venue":null,"work_id":"b4ecef7d-08ee-427b-858d-40452833e62d","year":2003},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.400563Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:2130eac8cb89435670d1b87cd4678734be9e2d8931b9ffc59aef31254d62b14a","observation_id":"7294c1b8-4b96-4bbf-b770-25084a9a1065","resolution":{"observed_at":"2026-08-07T11:41:14.394762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:14.150318Z","title":"Small language model can self-correct","venue":null,"work_id":"c5df23ac-c5dd-40d3-8063-e8066f02140f","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.465294Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:82b3b9c6c104a160977aa1432f29b4192844dcc1fa86e38383407aa79ab6660f","observation_id":"7586c170-250b-4a29-ba4a-6c91de48c5ee","resolution":{"observed_at":"2026-08-07T11:41:14.225832Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.940767Z","title":"Eye movements in natural behavior","venue":null,"work_id":"a888c551-23ac-4c93-bf29-38cff30771d7","year":2005},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.555428Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:beb96d2e480b7067ded0670fcf156ce5c548d0209271de886669065d04f16201","observation_id":"d8daadd2-8b5b-4aae-a3e5-1c645ef670c0","resolution":{"observed_at":"2026-08-07T11:41:14.018823Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.765446Z","title":"Human gaze control during real-world scene perception.Trends in cognitive sciences, 7(11):498–504, 2003","venue":null,"work_id":"668ee32b-af0d-4d99-982b-ea3d6c25c870","year":2003},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.777140Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:923622dbd0f71e9c7f92460d7ce2b37863928cc0b5dd8e5f85eedc5d9be14ffc","observation_id":"c30b6367-8779-4ae2-a245-70b18d5a1b9f","resolution":{"observed_at":"2026-08-07T11:41:13.874662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-07T11:39:52.921977Z","title":"Cogvlm2: Visual language models for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:52.921977Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:705f7081281a7bfa91abd7b589cafa6a99fb2be5f5c96dabc815e6f9ca405ba6","observation_id":"33795074-5261-4f2d-a544-74a39440397d","resolution":{"observed_at":"2026-08-07T11:39:52.921977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12895","last_updated":"2024-03-19T16:48:40Z","snapshot_observed_at":"2026-08-07T02:52:27.054968Z","submitted_at":"2024-03-19T16:48:40Z","title":"mPLUG-DocOwl 1.5: Unified Structure Learning for OCR-free Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12895","snapshot_observed_at":"2026-08-07T11:39:53.021225Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:53.021225Z"},"links":{"cited_paper":"/paper/2403.12895","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:6b0057011a7b0f50e69fc254f3d56a33effe529a9d3ff53623efd0ea7aab277c","observation_id":"25624c85-eccc-45a0-a88a-5a25ead4f616","resolution":{"observed_at":"2026-08-07T11:39:53.021225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-07T11:39:53.103982Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:53.103982Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:e33979453b97a0bdc9fb0c6224f2bdf4d0038a284aed89d1b409e17c691c7f58","observation_id":"d3b73bc6-8def-4a2e-a70e-bd96ec54c53e","resolution":{"observed_at":"2026-08-07T11:39:53.103982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.652727Z","title":"Ma- tryoshka query transformer for large vision-language models","venue":null,"work_id":"df7e93ec-9f1f-40df-8535-415de24e5bf6","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:53.214626Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:2eacc5609b617462a1d29b28c7046b475951e019789fd7f3ebd209afa31890a3","observation_id":"6bd05da0-5767-45c1-a096-ec6091e15086","resolution":{"observed_at":"2026-08-07T11:41:13.683219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.480698Z","title":"Aggregate-and-adapt natural language prompts for downstream generalization of clip","venue":null,"work_id":"8b6bb479-7648-4fc3-a909-8f7b9cede33a","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:53.375408Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:9e1ac95e7fa95e536ba823ee4c5a4cdfec43bfa075ce4857570066d48b345b30","observation_id":"5d96b365-9739-4cf7-8d02-28482aa219f5","resolution":{"observed_at":"2026-08-07T11:41:13.573799Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:07.103123Z","title":"Large language models cannot self-correct reasoning yet","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:07.103123Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:2714ef326bb31b018b72bcd61dd57e297fc7552be36287b7cb3ed5e554e22e32","observation_id":"9b0380ac-9b30-4c9e-8040-fa3c11b07d07","resolution":{"observed_at":"2026-08-07T11:40:07.103123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:40:08.965384Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:08.965384Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:67bc10c912dc096aa14bf5d4041a3cd1406dd7a8d882956eccaa1cd75f17700b","observation_id":"21a94415-319b-4bb7-a817-e02e381b4212","resolution":{"observed_at":"2026-08-07T11:40:08.965384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.245369Z","title":"Maven: An effective multi-granularity hybrid visual encoding framework for multimodal large language model","venue":null,"work_id":"4cd609e5-7436-4ba7-8914-82dba323929c","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.529263Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:6db9c94660a70e0f1a0fedaf0d6d39b0189319f01f1e994de405a6553fbb343b","observation_id":"0392638f-e796-4657-9068-5aea7dfe2cac","resolution":{"observed_at":"2026-08-07T11:41:13.335877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:13.035101Z","title":"When can LLMs actually correct their own mistakes? a critical survey of self-correction of LLMs","venue":null,"work_id":"f2e54668-1448-4886-8ffc-aa9d2176a57a","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.725443Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:6d156336ae1f73cb100ee13730fea094fece990681b81b3a7c0211b5db0fae9c","observation_id":"512ac1f3-7669-4d76-a8f4-3eb2c4078c43","resolution":{"observed_at":"2026-08-07T11:41:13.149890Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.801764Z","title":"Language models can solve computer tasks","venue":null,"work_id":"bf660192-5236-4cad-aad6-afc1798b6279","year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.823903Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:2021fd2ecb08cf9b199e4d6fe6c478877cc2064cf6d87f9835258e3428614c68","observation_id":"72cb6998-059e-4966-8f19-ba19b769d6a5","resolution":{"observed_at":"2026-08-07T11:41:12.926936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.587409Z","title":"Training language models to self-correct via reinforcement learning","venue":null,"work_id":"df14442f-3267-4a62-99b8-04d644df135c","year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.886914Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:f7edd7632feefa0297bcfb8848ceff275108e23cde0b15e68ccd55c9bc1565f1","observation_id":"287cf32b-7167-4fbb-94c5-96fe62a9704e","resolution":{"observed_at":"2026-08-07T11:41:12.711503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:12.355776Z","title":"What matters when building vision-language models? Advances in Neural Information Processing Systems, 37:87874–87907, 2024","venue":null,"work_id":"36a2f742-ad42-4748-99b1-6d286693bb5f","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.909382Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:241419a40201793721feca2905d5c2113782bad35c2ad105750acf2623264e1c","observation_id":"8b5917de-feb5-493f-a3f4-011f9e3d746a","resolution":{"observed_at":"2026-08-07T11:41:12.451868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.964973Z","title":"Llava-next: Stronger llms supercharge multimodal capabilities in the wild","venue":null,"work_id":"f8ead300-730e-4b89-8472-bea6ead51144","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:09.939325Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:2f2115a4afdeb4f484fd6392057b3fc156a0819ef652ddc6a6836d99511f5f75","observation_id":"686006e4-f2dd-40fa-b86d-8ae837c87679","resolution":{"observed_at":"2026-08-07T11:41:12.244196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.03726","snapshot_observed_at":"2026-08-07T11:40:10.032358Z","title":"Otter: A multi-modal model with in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:10.032358Z"},"links":{"cited_paper":"/paper/2305.03726","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:3c5806e48248e92288aa14cf08cf4b1ee996f70adef326abf35dbd6f25545921","observation_id":"4634c676-34a9-4239-8107-53d9cc6d8430","resolution":{"observed_at":"2026-08-07T11:40:10.032358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14920","last_updated":"2025-04-21T07:39:29Z","snapshot_observed_at":"2026-08-07T16:00:39.397386Z","submitted_at":"2025-04-21T07:39:29Z","title":"DyFo: A Training-Free Dynamic Focus Visual Search for Enhancing LMMs in Fine-Grained Visual Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14920","snapshot_observed_at":"2026-08-07T11:40:11.502823Z","title":"Dyfo: A training-free dynamic fo- cus visual search for enhancing lmms in fine-grained visual understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.502823Z"},"links":{"cited_paper":"/paper/2504.14920","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:6a96d4bed31059d2f9acf5e04e5383c36ff7d4fdd3286d58b1a0f06d7f2c4aaf","observation_id":"ca30a7ad-6ad2-4fd2-92f0-9978ef0cbcd1","resolution":{"observed_at":"2026-08-07T11:40:11.502823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.513604Z","title":"Cumo: Scaling multimodal llm with co-upcycled mixture-of-experts","venue":null,"work_id":"d6dde73e-e9f9-4ba2-b248-0bf270bb8182","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.701774Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:c9c266aecc1701e00f3e20843c3aafa06700edb2efcc4ed973f3e7ad42f6a344","observation_id":"4a47c34b-7eec-4c16-82b3-8439b44816ff","resolution":{"observed_at":"2026-08-07T11:41:11.710677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:11.081920Z","title":"Hrvqa: A visual question answering benchmark for high-resolution aerial images","venue":null,"work_id":"6a8dc94a-34a3-4219-b770-405e7f5adc29","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.808104Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:48a3cd2f07762ae34ab2129262d17058d9da99bfe4f962430942d00c1db7a347","observation_id":"b92f1c4f-9973-4e2e-97ba-4a759a90d28b","resolution":{"observed_at":"2026-08-07T11:41:11.280283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.674902Z","title":"When hindsight is not 20/20: Testing limits on reflective thinking in large language models","venue":null,"work_id":"6f0b258d-4e33-421b-a2f4-db22a268c6ad","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.883233Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:74064775d10e04a31dc010b6c0f99b3c6e7928513fcef163c18210a5d773b54f","observation_id":"f22effdc-6b0a-420f-ab2e-5fbf73395dd8","resolution":{"observed_at":"2026-08-07T11:41:10.860720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.358031Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":"22099113-498c-4c53-b27f-3135726188b3","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.956210Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:1774aa99e4c0fd273a9c56c1bcd5c14df3532d620862766e8f4189c82d5f81d9","observation_id":"e62d103a-67ea-41fc-bcea-d92ef42eb996","resolution":{"observed_at":"2026-08-07T11:41:10.502308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06607","last_updated":"2024-08-26T06:57:51Z","snapshot_observed_at":"2026-08-05T16:46:37.436149Z","submitted_at":"2023-11-11T16:37:41Z","title":"Monkey: Image Resolution and Text Label Are Important Things for Large Multi-modal Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06607","snapshot_observed_at":"2026-08-07T11:40:11.979543Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.979543Z"},"links":{"cited_paper":"/paper/2311.06607","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:dc87838d072f38e95a98793fb868b40f341dff5417e35d49cd2a8c00534bccb5","observation_id":"8c015068-9151-440b-b307-0fba713fcd06","resolution":{"observed_at":"2026-08-07T11:40:11.979543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:11.995784Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:11.995784Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:86281d78ac5b1103ad6786e5ba806e59ab52484b2174b087765490da2273339a","observation_id":"c2d1b6cf-dd28-42b1-ad6a-2b21150e6076","resolution":{"observed_at":"2026-08-07T11:40:11.995784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:10.131665Z","title":"Visual anchors are strong information aggregators for multimodal large language model","venue":null,"work_id":"ee07bb87-c573-4af4-8d11-d58693cb6311","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.012509Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:69042c398f90152633695e3d1b248c180239f8ffbf90fa2474b3db787dda8549","observation_id":"91980365-2df3-49ee-a963-527143961fc3","resolution":{"observed_at":"2026-08-07T11:41:10.222132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:12.037557Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.037557Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:7a443de5a974af9c66cc685c973820aa57d8e56ade0e20ed54d3ccb846509ef4","observation_id":"93631198-2d5c-4fcf-beb6-697d249952ac","resolution":{"observed_at":"2026-08-07T11:40:12.037557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.895061Z","title":"Llava-next: improved reasoning, ocr, and world knowledge (2024)","venue":null,"work_id":"e268dbbe-2f40-4152-a3a7-563c149f3ebc","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.062045Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:395c3986438cd55703fc7c3b95ee37aeecc25410d573240a8ccfdcce375eb31f","observation_id":"9f3c7515-4b67-40c4-9bf5-5d175824de0e","resolution":{"observed_at":"2026-08-07T11:41:10.003029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:12.097104Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.097104Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:b4d8d519f169c3084c80960096dc819eda9229458e4f48c1669fe60e6e107012","observation_id":"00e4b129-d5d7-472c-aba8-8778e2700f68","resolution":{"observed_at":"2026-08-07T11:40:12.097104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-09T20:40:14.205704Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-07T11:40:12.120767Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.120767Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:abf81690de8524faab0b40147ca03009e6d36245ac992501e3ec3736b09e27c4","observation_id":"afe2df36-233b-4b4b-8ef6-4474a7ff8dfb","resolution":{"observed_at":"2026-08-07T11:40:12.120767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-07T11:40:12.167451Z","title":"Deepseek-vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.167451Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:27e128be87b2e0a04ce28cca2425b3b36f9f37e289833d7b82e38da5a45b106a","observation_id":"94f934a8-1323-4fa7-93f5-d281f039bb05","resolution":{"observed_at":"2026-08-07T11:40:12.167451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.683564Z","title":"Task-to-instance prompt learning for vision-language models at test time","venue":null,"work_id":"6ab3cdad-bcd9-4ed1-9cc4-21aa0f0a7700","year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.227399Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:8653aa5478e357686862df98bc842b6316a2704951cd7de6706ec30e54b623d4","observation_id":"9a24f198-bdbf-43fe-b694-f2d496b58f50","resolution":{"observed_at":"2026-08-07T11:41:09.758140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09797","last_updated":"2024-04-15T13:54:35Z","snapshot_observed_at":"2026-08-09T19:46:42.652537Z","submitted_at":"2024-04-15T13:54:35Z","title":"TextCoT: Zoom In for Enhanced Multimodal Text-Rich Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09797","snapshot_observed_at":"2026-08-07T11:40:12.313744Z","title":"Textcot: Zoom in for enhanced multimodal text-rich image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:12.313744Z"},"links":{"cited_paper":"/paper/2404.09797","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:1eb042bd19f236d54de8937575bc4cc277e96069cff24a1ab93bfcb4a69d889d","observation_id":"c86508c6-2314-49f8-aa28-9a37f1f5abea","resolution":{"observed_at":"2026-08-07T11:40:12.313744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.421261Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":"dfaee389-cf3a-44d7-ad91-89d7a36461b2","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:23.084530Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:e192ca75410baffbbadc1864bc975f8e2a8ad702efedd1a3fe56c2e37c2aaaac","observation_id":"2867ea04-cbad-4032-8c42-81fbca559218","resolution":{"observed_at":"2026-08-07T11:41:09.532909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:23.398609Z","title":"Self-refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:23.398609Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:4231ee5193986dcea8aaf89220150dbaeffa3c8c86132ed0cba0bc733a256cec","observation_id":"abb0e6ed-2781-46e2-b6a9-a5564a20848d","resolution":{"observed_at":"2026-08-07T11:40:23.398609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:41:09.166450Z","title":"Gpt-4v(ision) system card","venue":null,"work_id":"f147576d-8d18-4cd5-bdf3-fda8ab16470f","year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:23.659485Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:905c07c6c25bee28dcfe3a7b2432b6e5a4864235b711bc36f0a95d8e43a68903","observation_id":"6a1d21a7-d9c7-4166-b330-aaf67753a2ba","resolution":{"observed_at":"2026-08-07T11:41:09.290415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.984999Z","title":"Automatically correcting large language models: Surveying the landscape of diverse automated correction strategies","venue":null,"work_id":"37b67595-ef0a-4356-ba56-9267ed1580b1","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:24.131642Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:4d1f5e3c5a8cae0b7061a5fdb10373b29b013d2a0bbc3780b9a687c86af64a9a","observation_id":"65f80211-1a44-4583-b83f-d1d8bb65a67b","resolution":{"observed_at":"2026-08-07T11:41:08.736476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.850275Z","title":"Orienting of attention","venue":null,"work_id":"ff709d59-2d98-4b06-a94b-66b0764bbc91","year":1980},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:31.438152Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:c0d7cb12bee620f0c48d0ce779343db6f955f816f99f422205072a419142a874","observation_id":"4455c1e7-ce09-4d99-a68d-c76918055fbc","resolution":{"observed_at":"2026-08-07T11:40:59.914294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:32.884746Z","title":"Zoomer: Adaptive image focus optimization for black-box mllm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:32.884746Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:6933914e9f307832a722234af5ea64f05703f0354b824f2be0ed75d2bf09ecf6","observation_id":"5b6a1295-b337-4ebf-b08c-5bc9c626abce","resolution":{"observed_at":"2026-08-07T11:40:32.884746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06682","last_updated":"2024-10-16T23:19:46Z","snapshot_observed_at":"2026-08-09T03:34:21.327905Z","submitted_at":"2024-05-05T18:56:46Z","title":"Self-Reflection in LLM Agents: Effects on Problem-Solving Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06682","snapshot_observed_at":"2026-08-07T11:40:34.931637Z","title":"Self-reflection in llm agents: Effects on problem-solving performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:34.931637Z"},"links":{"cited_paper":"/paper/2405.06682","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:73c56d689ffce9f9076658f2ca3b619e407f6a26c9cd7ac8501ec623aa03b340","observation_id":"5ae2e871-eccd-4eeb-95d6-0cdc5fddfa96","resolution":{"observed_at":"2026-08-07T11:40:34.931637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:35.724614Z","title":"Visual cot: Advancing multi-modal language models with a comprehen- sive dataset and benchmark for chain-of-thought reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:35.724614Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:bea8591c2c0a779c1d677e0187bdc06727245f326e4dfdfc63e4e7b7ef45d315","observation_id":"74a5a5f2-1872-4cd6-9c98-002717c1c428","resolution":{"observed_at":"2026-08-07T11:40:35.724614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.16044","last_updated":"2025-09-01T02:39:51Z","snapshot_observed_at":"2026-07-06T19:56:17.117739Z","submitted_at":"2024-11-25T02:15:30Z","title":"ZoomEye: Enhancing Multimodal LLMs with Human-Like Zooming Capabilities through Tree-Based Image Exploration","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.16044","snapshot_observed_at":"2026-08-07T11:40:35.885152Z","title":"Zoomeye: Enhancing multimodal llms with human-like zooming capabilities through tree-based image exploration","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:35.885152Z"},"links":{"cited_paper":"/paper/2411.16044","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:484f733444e11c5bb4a4bf3d9d12c23a1d37f1d580120075c21dec1df4e188f5","observation_id":"4440d2ba-e57c-45c3-94bf-08cbf63fdc6d","resolution":{"observed_at":"2026-08-07T11:40:35.885152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:35.947540Z","title":"Reflexion: Language agents with verbal reinforcement learning.Advances in Neural Information Processing Systems, 36:8634–8652, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:35.947540Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:1a7159057bd4f3141d89c4ee0b4957d122a8cb2f830a04ebecb37a06779472ff","observation_id":"02828600-11bf-4813-bdbd-0c7d797acf12","resolution":{"observed_at":"2026-08-07T11:40:35.947540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T11:40:36.023592Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:36.023592Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:eae66b8b44a3e574450b2ad341d8d1a5be2d5e4cf4321b4d2d4b9c52dee5389b","observation_id":"66162ec5-8ac7-4456-aadc-a8731e1eb92b","resolution":{"observed_at":"2026-08-07T11:40:36.023592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:36.060732Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:36.060732Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:dfd3dc05f561d58f5a601b3f334eef94f01a5e7cf7fe2ffc20da77b3c4d5cb03","observation_id":"0fbc42b6-179f-4d12-882c-11916fca7544","resolution":{"observed_at":"2026-08-07T11:40:36.060732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.674620Z","title":"LLMs cannot find reasoning errors, but can correct them given the error location","venue":null,"work_id":"e85045d0-5924-4d6b-a455-92be311377fa","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:45.359104Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:9f2808c8b2bdcf5b98b5953f9ed8de4f6f9b58036729e2b79d9e37fa9f5bd2f1","observation_id":"f7416fb6-828b-4b77-929d-edacb27efd05","resolution":{"observed_at":"2026-08-07T11:40:59.734979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.518039Z","title":"Lever- aging visual tokens for extended text contexts in multi-modal learning","venue":null,"work_id":"5f52b611-72e5-4efe-a0f1-21e0eef8615c","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:53.229790Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:7e545c72329d1b6d86bf71a7e7b90db6be19281957926bf781f4eed21399d5fa","observation_id":"71067d3b-6c02-484e-9bcd-25fc548b3be8","resolution":{"observed_at":"2026-08-07T11:40:59.605872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00249","last_updated":"2024-08-30T20:40:28Z","snapshot_observed_at":"2026-08-09T04:35:01.996722Z","submitted_at":"2024-08-30T20:40:28Z","title":"The dark days are overcast: Iron-bearing clouds on HD 209458 b and WASP-43 b can explain low dayside albedos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00249","snapshot_observed_at":"2026-08-07T11:40:54.884572Z","title":"MME- RealWorld: A Challenging Benchmark towards Real-World Multimodal Understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:54.884572Z"},"links":{"cited_paper":"/paper/2409.00249","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:22e41bf3ef971c6937bb6a8428252a0f611d2d35f2f7b3f2015a894b3f64d5f0","observation_id":"d9328b18-c20f-4bdd-9f52-cda4009c3eda","resolution":{"observed_at":"2026-08-07T11:40:54.884572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T11:40:55.542706Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.542706Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:a4149ab2a8e4ad60380e7d4bcbb4ab705648ef5b91d832537246f580ba0bbab0","observation_id":"df6afcfc-3157-495e-9f19-70f11b2885d3","resolution":{"observed_at":"2026-08-07T11:40:55.542706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:55.871118Z","title":"Cogvlm: Visual expert for pretrained language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.871118Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:71d51f5c205590b974c15a3f4948c343ecda679db65e238a2832bb62e5801dbc","observation_id":"e386970a-a070-4514-8af6-c3a44be88688","resolution":{"observed_at":"2026-08-07T11:40:55.871118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.388657Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":"cc7e0ad4-c374-4230-935b-1c825e48e1ba","year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.914770Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:9a29df3c952a2b2c6abacd66b0ec0efc63cf816a980c088c3d5a14b49be5e184","observation_id":"a4ac4896-052e-41bf-9282-a694a9887d5a","resolution":{"observed_at":"2026-08-07T11:40:59.434842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:55.924464Z","title":"Visionllm v2: An end-to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.924464Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:fd492ccd2d3e81958e88497b6cab6d20b8989d8c8d3df8a9fcdae42f2bea5a5b","observation_id":"01d0dbda-89ac-45ec-a669-c6cc4003d3a5","resolution":{"observed_at":"2026-08-07T11:40:55.924464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.251570Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"cac80bd3-f184-41d6-b693-f35d626515c2","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:55.953486Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:887cd5bd536473142efc2f25778cc6ee9132c040ca4d74978c8ee8bf33da7174","observation_id":"e6b5bb8f-f7ee-4c4e-a119-32592b238f36","resolution":{"observed_at":"2026-08-07T11:40:59.302336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.214065Z","title":"Large language models can self-correct with key condition verification","venue":null,"work_id":"daaf6431-446d-4e16-b293-629f578d0d25","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:56.018805Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:93e9d8c3fa435741c975d9024d5702bdbe87e4d1adf92b5044576267ffc1e5a5","observation_id":"5220909d-b610-42d8-b132-db6725d818af","resolution":{"observed_at":"2026-08-07T11:40:59.220091Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:59.089186Z","title":"Graph- based unsupervised disentangled representation learning via multimodal large language models","venue":null,"work_id":"9c5f07e1-cb03-4bc1-866e-2da96268b975","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.065875Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:ade85675e3d541ea0e154e3418f40fb751a6266b10badce9f85ad59cfd1c3fd5","observation_id":"c6cd0429-912b-4186-b656-91bc683d6c52","resolution":{"observed_at":"2026-08-07T11:40:59.165808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:58.906219Z","title":"mPLUG-2: A modularized multi-modal foundation model across text, image and video","venue":null,"work_id":"babbaf7c-7a99-4b0d-837f-15e970441097","year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.688044Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:6f4ab1da2dac36ad0a87ed35e856e56e7dd1b664d8d256441d50d0cd2a2fa660","observation_id":"208476fa-b365-4ac9-acdf-1f97ce4381b6","resolution":{"observed_at":"2026-08-07T11:40:58.992755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:58.731817Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":"a41ff5c3-c2b0-4ac5-ab00-b510f2f422a7","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.733682Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:624618a6c1e4a01e860740415de6c16a2082c47d75bba72feb76e18114389c66","observation_id":"71d2c1b3-0784-455e-a21a-b735f55ceba6","resolution":{"observed_at":"2026-08-07T11:40:58.810469Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13035","last_updated":"2024-06-17T15:24:29Z","snapshot_observed_at":"2026-08-03T08:35:39.994785Z","submitted_at":"2024-02-20T14:23:23Z","title":"Learning to Check: Unleashing Potentials for Self-Correction in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13035","snapshot_observed_at":"2026-08-07T11:40:57.775441Z","title":"Learning to check: Unleashing potentials for self-correction in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.775441Z"},"links":{"cited_paper":"/paper/2402.13035","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:cc62d122b7055c4266f90b7a200d8cc8120536a62388f37c5d4ceff9d8a62b0e","observation_id":"8f38b95d-d9c2-471f-b671-55de3805bb75","resolution":{"observed_at":"2026-08-07T11:40:57.775441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-07-06T16:23:57.143116Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-07T11:40:57.810777Z","title":"Internlm-xcomposer: A vision- language large model for advanced text-image comprehension and composition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.810777Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:94a658e7fca410e94e8bebfbf9c599e29b701b0de5c00fa96f93976c0c90b552","observation_id":"4db93dbb-ef84-4fd0-b971-c203f35a4d55","resolution":{"observed_at":"2026-08-07T11:40:57.810777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:58.650589Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":"da5f6df3-d11c-492e-8c0e-01520f2b9003","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.861871Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:ad204073693b02f3207cba4682f36b2cd37ca1b87e7546e04fa088986c47bd31","observation_id":"a6dccc8c-113e-4639-aa31-360a77cd65aa","resolution":{"observed_at":"2026-08-07T11:40:58.656533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:40:58.493384Z","title":"Wings: Learning multimodal llms without text-only forgetting","venue":null,"work_id":"6ef8e3cc-13cb-4b8b-a75c-14c79b21ce7a","year":2024},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.905024Z"},"links":{"citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:e31550c5e95a41ceb9613dca7b5efb2720987a82dc90ac404bb6a049d892e39e","observation_id":"f0c9d9eb-6e6f-4cae-b789-a64b09108131","resolution":{"observed_at":"2026-08-07T11:40:58.543281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T11:40:57.963146Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T11:40:57.963146Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.01663"},"observation_digest":"sha256:99c7f869073a3c646b316f343573f1ef2be6c42d2d0408380c3dd2e334f34bc5","observation_id":"24a627c5-91d6-4e12-86c9-66262efea867","resolution":{"observed_at":"2026-08-07T11:40:57.963146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01663","last_updated":"2025-08-11T07:25:46Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T13:51:16.763672Z","submitted_at":"2025-06-02T13:32:35Z","title":"Zoom-Refine: Boosting High-Resolution Multimodal Understanding via Localized Zoom and Self-Refinement"},"reference_resolution":{"displayed":74,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":38},"total_outbound_references":74},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 74 of 74 outbound references and 8 inbound Pith citation observations for arXiv:2506.01663."}