{"as_of":"2026-08-10T10:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e23b0a1ec9afcf72dbfc30400bcedbcfd919b1f098973d42f64e91a29e80c2c2","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:40:40.290572Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T20:30:58.091365Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-19T14:27:24.213919Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.10202","snapshot_observed_at":"2026-08-02T20:30:58.091365Z","title":"A training-free, task- agnostic framework for enhancing mllm performance on high-resolution images,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.00171","last_updated":"2026-05-30T15:21:48Z","snapshot_observed_at":"2026-08-08T05:48:48.902254Z","submitted_at":"2026-02-26T15:41:26Z","title":"LookWise: Knowing When and Where to Look for Fine-Grained Visual Reasoning in Multimodal Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T20:30:58.091365Z"},"links":{"cited_paper":"/paper/2507.10202","citing_paper":"/paper/2603.00171"},"observation_digest":"sha256:58a63d6e2a93d5b3d704ccdca2c986872accda75071a8ba015f4f70a2cde178e","observation_id":"4e58942a-f5e4-4b74-93c2-ab7e7c0e8702","resolution":{"observed_at":"2026-08-02T20:30:58.091365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"cited_work":{"arxiv_id":"2507.10202","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.10202","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A training-free, task-agnostic framework for enhancing mllm performance on high-resolution images","venue":null,"work_id":"8e70a226-2da7-4f15-b01b-098e7639526b","year":2025},"citing_paper":{"arxiv_id":"2605.15542","last_updated":"2026-05-15T02:27:41Z","snapshot_observed_at":"2026-08-01T22:59:27.797060Z","submitted_at":"2026-05-15T02:27:41Z","title":"DRS-GUI: Dynamic Region Search for Training-Free GUI Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-19T14:24:48.938948Z"},"links":{"cited_paper":"/paper/2507.10202","citing_paper":"/paper/2605.15542"},"observation_digest":"sha256:800ee639db323f4da9c2d4c6e64f13b3fb0f9c55548acfe591dccdb3b40c6107","observation_id":"058f0829-90fb-46e2-aaf3-6ba1586c3262","resolution":{"observed_at":"2026-05-19T14:27:24.215449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.10202/citation-record","integrity":"/paper/2507.10202/integrity","json":"/paper/2507.10202/citation-record.json","paper":"/paper/2507.10202"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T17:40:34.116748Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:34.116748Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:d0b46113f0d5b6f338004f7406690e5e8949d3cbe35ab7ae150e241551522677","observation_id":"851cbd77-5559-4208-8134-c10a629ff47c","resolution":{"observed_at":"2026-08-06T17:40:34.116748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.177712Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.177712Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:d26b4f3e4cb60001ca2abbdbd8bb7e50f521dc9bffca8f765aa5cfe7354606c3","observation_id":"c9606cab-eb93-46b2-b7b9-3a150b16005e","resolution":{"observed_at":"2026-08-06T17:40:40.177712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.183319Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.183319Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:af3485296fb67e20d03dfb1c2ea96a9f81bf6cbd647cfc4009b953aead6e763a","observation_id":"e6b6550d-3f4b-4a44-b865-a89967a88b5e","resolution":{"observed_at":"2026-08-06T17:40:40.183319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.762745Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"5a328554-1046-4015-9fdc-3aa1357b3efe","year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.189046Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:2bf1b9e2a90a5104ff86f53def891ea6180c85b0cb66bf3da5f088ae7a9da087","observation_id":"9c6bd09c-3ad6-419c-84ac-49eb1fbe995f","resolution":{"observed_at":"2026-08-06T17:40:40.767037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10935","last_updated":"2024-02-23T04:36:51Z","snapshot_observed_at":"2026-08-08T03:28:12.161766Z","submitted_at":"2024-01-17T08:10:35Z","title":"SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10935","snapshot_observed_at":"2026-08-06T17:40:40.195059Z","title":"Seeclick: Har- nessing gui grounding for advanced visual gui agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.195059Z"},"links":{"cited_paper":"/paper/2401.10935","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:ddba56467b8945a36a92fd773d08d9eb4e8fc294ce931eb6e5e91796e0a0e48e","observation_id":"5fcf4a7d-c972-46ca-980c-90db114f6b68","resolution":{"observed_at":"2026-08-06T17:40:40.195059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.745018Z","title":"Palm: Scaling language modeling with pathways","venue":null,"work_id":"907505b9-9c62-4013-b1bb-7e24174a79ad","year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.200279Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:766f8710e27c0d69f96b9481133eecddaf5eff80c5976981807f63d3c1bb17fb","observation_id":"62070ed8-9b1d-41c4-bde5-dcaef039002a","resolution":{"observed_at":"2026-08-06T17:40:40.750712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.727972Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high- resolution images, 2024","venue":null,"work_id":"3474d8da-d1ce-41ec-8033-6ee82c8bd24c","year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.205362Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:c23be91c03b7f88912937aaa1c308082cba42cd733127ec569487f29c39a946e","observation_id":"8519e9a4-b332-4971-bb49-87a39693aade","resolution":{"observed_at":"2026-08-06T17:40:40.732322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T17:40:40.210305Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.210305Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:4eedaaf6a5eef258ddce5c613597a2d235a917a826a86fe57ccdafaa44387bdd","observation_id":"e48fe762-3355-4422-ad46-75249e10b127","resolution":{"observed_at":"2026-08-06T17:40:40.210305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.709023Z","title":"Screenspot-pro: Gui grounding for professional high- resolution computer use, 2025","venue":null,"work_id":"6214656f-beb8-4a19-84e3-b408db256d05","year":2025},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.215124Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:9bbe661a07a44de901c3016c70866f222c1ecd37851be96cfb49da285b9e4506","observation_id":"499b9c21-a768-4a9a-ad3c-35bb8e1c4779","resolution":{"observed_at":"2026-08-06T17:40:40.714507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.692971Z","title":"Visual instruction tuning","venue":null,"work_id":"2effa538-9c6e-4b2d-aa63-7ec75da6f137","year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.219197Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:73fdd43ed05f5da755fd77a654a99f8f93dfd4a0da5f1842efe2c0b414c9238f","observation_id":"c92f28e4-58b9-4c27-b487-cc5733b7bae1","resolution":{"observed_at":"2026-08-06T17:40:40.697299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01487","last_updated":"2024-03-03T11:39:41Z","snapshot_observed_at":"2026-08-05T00:56:14.682059Z","submitted_at":"2024-03-03T11:39:41Z","title":"InfiMM-HD: A Leap Forward in High-Resolution Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01487","snapshot_observed_at":"2026-08-06T17:40:40.225281Z","title":"Infimm-hd: A leap forward in high-resolution multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.225281Z"},"links":{"cited_paper":"/paper/2403.01487","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:07a05f543d1d26ab1035194a04096de5b9581cd572e2c70ad7e8fcfebb92a2be","observation_id":"b02df333-5030-4d93-a675-c96a714e8558","resolution":{"observed_at":"2026-08-06T17:40:40.225281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-07-06T17:39:53.791209Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-06T17:40:40.230169Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.230169Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:a5c00d1655cc55696a3d192292abbf61f6442094f9fd7d0c5a12d68b64b21521","observation_id":"04f92453-e9e4-4bf9-8fd9-dafccf4c7bdc","resolution":{"observed_at":"2026-08-06T17:40:40.230169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16198","last_updated":"2024-07-23T06:02:30Z","snapshot_observed_at":"2026-07-06T18:50:31.528338Z","submitted_at":"2024-07-23T06:02:30Z","title":"INF-LLaVA: Dual-perspective Perception for High-Resolution Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16198","snapshot_observed_at":"2026-08-06T17:40:40.235754Z","title":"Inf-llava: Dual- perspective perception for high-resolution multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.235754Z"},"links":{"cited_paper":"/paper/2407.16198","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:aaa32e250dc4e6f87b4a3c7fdcfcbfcde53d358f92138c53389103aacba41e4d","observation_id":"66d49876-07ef-42ef-8be7-b7c6ef2ba733","resolution":{"observed_at":"2026-08-06T17:40:40.235754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.672228Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"a3ade9ab-f303-4c9d-a952-c09d915090d3","year":2021},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.240963Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:2f0aaa74984c2c5bd2e9d04c10394900fd7170256457a9789c00b94875bd529d","observation_id":"683aaed2-2f3e-4711-80e6-a086e56633b6","resolution":{"observed_at":"2026-08-06T17:40:40.679550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.654224Z","title":"Divide and conquer: High-resolution industrial anomaly de- tection via memory efficient tiled ensemble","venue":null,"work_id":"4c73183a-e0f3-42bd-a481-6e8842df0475","year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.244930Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:6109c9a8ddc322d8e09ca7f3b6415bad3e52e0b25f0029e28eebb84e5456f58b","observation_id":"bd70a414-2818-4b9c-a681-e26a7def89d4","resolution":{"observed_at":"2026-08-06T17:40:40.658842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T17:40:40.251610Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.251610Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:285a4eeacfdf98ee1b476561a871008b0eed3cba0f4c5d523a897f8f93ec06b0","observation_id":"127f03cd-3421-4825-a581-56623e3d8213","resolution":{"observed_at":"2026-08-06T17:40:40.251610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.638175Z","title":"Fixing the train-test resolution discrepancy.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"9be3598e-d0b7-4500-aa6f-939ca6496de6","year":2019},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.256814Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:c86126e223c02fd3d850e5b2caa8e9343709831aa453e9f04a95252be8596c2a","observation_id":"6a15456b-100f-4342-8ffe-776f179f7449","resolution":{"observed_at":"2026-08-06T17:40:40.643180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T17:40:40.261877Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.261877Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:c5a11fa6dbba642515af6ec46d8290ffebe89e34c7e1843b75139973b4657591","observation_id":"40b55d28-a80c-4212-86e1-64cb93d305b8","resolution":{"observed_at":"2026-08-06T17:40:40.261877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T17:40:40.266695Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.266695Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:87a15dd6ce80e9131fd330dd7926b9e31ee179d644ac19b2e8f7a091096ebe07","observation_id":"54d99456-7761-4120-999a-633afa533ff2","resolution":{"observed_at":"2026-08-06T17:40:40.266695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-08-06T20:48:41.058327Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-08-06T17:40:40.270764Z","title":"Divide, conquer and combine: A training-free framework for high-resolution im- age perception in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.270764Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:2a68ab68ea5a1d62390eb7fc3c4ecafe925ac50a6a55280a7e0d802df4933843","observation_id":"fd65673c-bd1a-4940-8b85-dd4bc318fbda","resolution":{"observed_at":"2026-08-06T17:40:40.270764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23218","last_updated":"2024-10-30T17:10:19Z","snapshot_observed_at":"2026-08-05T06:30:40.974506Z","submitted_at":"2024-10-30T17:10:19Z","title":"OS-ATLAS: A Foundation Action Model for Generalist GUI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23218","snapshot_observed_at":"2026-08-06T17:40:40.276025Z","title":"Os-atlas: A foundation action model for generalist gui agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.276025Z"},"links":{"cited_paper":"/paper/2410.23218","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:9ae2ed2b161b7978d1fcf2fe77cccc551871b55ac58ca6bcfa89363ed441ef33","observation_id":"260882ba-87f2-4e7b-a439-4db25da6134c","resolution":{"observed_at":"2026-08-06T17:40:40.276025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:40:40.620348Z","title":"Omg-llava: Bridging image-level, object-level, pixel-level reasoning and understanding","venue":null,"work_id":"dd64b9ca-30f8-4e34-9014-282f1f361284","year":2025},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.280786Z"},"links":{"citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:fa5ebac5d50e999f85f179fa7d72ff80226511087c46c8d321643f6aeb499d90","observation_id":"fa3342fe-f379-4b64-8168-773eb6a7445d","resolution":{"observed_at":"2026-08-06T17:40:40.626256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03882","last_updated":"2024-02-22T01:40:35Z","snapshot_observed_at":"2026-08-06T19:10:47.693909Z","submitted_at":"2023-09-07T17:44:56Z","title":"Large Language Models Are Not Robust Multiple Choice Selectors","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03882","snapshot_observed_at":"2026-08-06T17:40:40.285125Z","title":"Large language models are not robust multi- ple choice selectors","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.285125Z"},"links":{"cited_paper":"/paper/2309.03882","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:63c0576c0f97a016a05f30e51b96133a014bd723534d65a77c79985cc19ec171","observation_id":"cde3fcfd-ef63-43be-8f42-583d70769997","resolution":{"observed_at":"2026-08-06T17:40:40.285125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.14776","last_updated":"2024-11-27T15:26:41Z","snapshot_observed_at":"2026-08-08T06:54:14.452418Z","submitted_at":"2024-08-27T04:45:53Z","title":"MROVSeg: Breaking the Resolution Curse of Vision-Language Models in Open-Vocabulary Image Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.14776","snapshot_observed_at":"2026-08-06T17:40:40.290572Z","title":"Mrovseg: Breaking the resolution curse of vision-language models in open-vocabulary seman- tic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T17:40:40.290572Z"},"links":{"cited_paper":"/paper/2408.14776","citing_paper":"/paper/2507.10202"},"observation_digest":"sha256:4dda3f59b25921cbfbc12a22fb1f58796d77afab613a6a0d28c3aca13ebe6b7d","observation_id":"350fa9db-b1dc-409a-8387-d220a0c7aefb","resolution":{"observed_at":"2026-08-06T17:40:40.290572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.10202","last_updated":"2025-07-14T12:14:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T08:48:57.097426Z","submitted_at":"2025-07-14T12:14:53Z","title":"A Training-Free, Task-Agnostic Framework for Enhancing MLLM Performance on High-Resolution Images"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2507.10202."}