{"as_of":"2026-08-19T22:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9cb61974a83f641b4caa36b017b772b8426a5cbb2e94f2d000b53127066733d3","coverage":[{"denominator":84,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":84,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T10:22:52.691595Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.18406/citation-record","integrity":"/paper/2504.18406/integrity","json":"/paper/2504.18406/citation-record.json","paper":"/paper/2504.18406"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.389235Z","title":"12 Kucherlapati Raju 13, Genome data analysis: Baylor College of Medicine Creighton Chad J","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.389235Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:734da4b3bff79e3083dcff2a291e08da6064463840821520d81166e219137d8c","observation_id":"f9b1899d-2417-4785-8d5f-28b113856ef8","resolution":{"observed_at":"2026-08-16T10:22:52.389235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-16T10:22:52.393488Z","title":"Phi-3 technical report: A highly capable language model locally on your phone, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.393488Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:42eef140f57aea601b47b95a145db9ddfc195f19227c04bfc58d81b0dc3f12ee","observation_id":"4d0c885f-e035-4a56-9bb4-5492d0030c35","resolution":{"observed_at":"2026-08-16T10:22:52.393488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T10:22:52.397322Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.397322Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:6b5b6c70432c9b916b6a85410b6602f807758b87d76a88526ba0cc57b3bdaab1","observation_id":"1175f303-e6a7-4395-97ef-3c9cd122ee9e","resolution":{"observed_at":"2026-08-16T10:22:52.397322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.401320Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.401320Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:84cbba4ab6174906c01da7a12fc07bae939b801f3734ce8559345a55a8787ffb","observation_id":"cbc5567b-d8f4-429e-9f34-44a9c47784e2","resolution":{"observed_at":"2026-08-16T10:22:52.401320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.404867Z","title":"Bach: Grand challenge on breast cancer histology im- ages","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.404867Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:b7153b5a7faad81a0ea8837dc43f4bf1d48a0f7dbb60948bc3bbb7fc4a818b93","observation_id":"15c957c5-8cd7-4cd8-bd1a-b94bde5faa64","resolution":{"observed_at":"2026-08-16T10:22:52.404867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.408735Z","title":"Jauregui, and Juan Andr ´es Cardoso","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.408735Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:8855e1cb503d59eaa3e06e15a0e07c784cf05d5d11f175978d20a170d16e78c3","observation_id":"dd92b8e1-1e15-4332-b442-9ff0bc14226d","resolution":{"observed_at":"2026-08-16T10:22:52.408735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.678960Z","title":"Ef- ficient high-resolution deep learning: A survey","venue":null,"work_id":"d61ff504-1ea2-4464-a38c-c0284047050f","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.412513Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:a6084cc6fc7981754fd26cd0d96713ca174bea7460c95b893b7fe3e14739af01","observation_id":"d3a4f4f7-944b-474c-995c-f7149645fcae","resolution":{"observed_at":"2026-08-16T10:22:53.682253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.669478Z","title":"Effi- cient high-resolution deep learning: A survey.ACM Comput","venue":null,"work_id":"86e9334a-96b1-4da3-a086-76c5e90f716e","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.416326Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:679dc1962b2945f778459d80063e2ffe79dc42f1862f235781ea8ac7917f5cf6","observation_id":"19bb4625-5def-4fbf-9d05-ce0b6ba78736","resolution":{"observed_at":"2026-08-16T10:22:53.672630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17811","last_updated":"2025-01-29T18:00:19Z","snapshot_observed_at":"2026-08-12T12:44:22.350068Z","submitted_at":"2025-01-29T18:00:19Z","title":"Janus-Pro: Unified Multimodal Understanding and Generation with Data and Model Scaling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17811","snapshot_observed_at":"2026-08-16T10:22:52.419841Z","title":"Janus- pro: Unified multimodal understanding and generation with data and model scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.419841Z"},"links":{"cited_paper":"/paper/2501.17811","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:63412a6f6e7b65f317ece799e9dc44887299423a704aa2f0215c13846e4f3db6","observation_id":"e944eaa2-510a-49db-9955-3c21580f39a6","resolution":{"observed_at":"2026-08-16T10:22:52.419841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-16T10:22:52.423560Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test- time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.423560Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:bfd8c9134f888ddfdcde95f3a1a25042b31dc4d7076abaf6659e854c25037065","observation_id":"888b5071-0d94-441c-bd07-3b0a4ffc64c3","resolution":{"observed_at":"2026-08-16T10:22:52.423560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-08-17T14:16:52.244007Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-16T10:22:52.427409Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.427409Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:95898c4c5124473a1b036510f1a1d7cc00f82f7f1745c93c4fd3d2a6feb84405","observation_id":"e6070e0a-7b27-4f7e-a792-7a5bf964a236","resolution":{"observed_at":"2026-08-16T10:22:52.427409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.659538Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"afb7eb0b-05bd-46b4-91d8-68e3aea73185","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.431192Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:96aba8c391c33d64b44cc6db3af3efca4fc48987e0d2dcfb20ace86b8ae96796","observation_id":"e97359c0-4da3-485b-8341-aa52329fbaa5","resolution":{"observed_at":"2026-08-16T10:22:53.663099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.649563Z","title":"Functional map of the world","venue":null,"work_id":"28dbb943-9c6a-4465-a61f-1f47f652c4b0","year":2018},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.434724Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:0fd3773a5995ffadeb1797596289884725053cd0d80f685587c5dad5a23312d8","observation_id":"16647775-f89e-440e-b7ef-ec1659f534dd","resolution":{"observed_at":"2026-08-16T10:22:53.652996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.639574Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"c4a1cbfd-4cbc-4626-a227-9980e748daa0","year":2016},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.438441Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:ccf154fc44b269a879a6c21556efc8c519cb5cca3bd4736cf984b2eee30abd03","observation_id":"c6c8c29c-eb5e-4f8d-89e7-bfb21486adfd","resolution":{"observed_at":"2026-08-16T10:22:53.642930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-16T10:22:52.441852Z","title":"Molmo 9 and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.441852Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:6a69ddc855b59a20bb69a635bca19362164fa6ef95ccee2703dd831988c3a64f","observation_id":"57a333d4-255e-4b52-86fb-ddd5aea2bf8f","resolution":{"observed_at":"2026-08-16T10:22:52.441852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.628760Z","title":"LungHist700: A dataset of histological images for deep learning in pulmonary pathology","venue":null,"work_id":"0ef9a1bf-a535-40e1-b58b-5492bd2a2c43","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.445363Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:ba6bc3101512d09146b875d3e5c453c47680c285dab2832547997e3e96de425b","observation_id":"e34ee8a0-b7f5-476e-b3ed-e84af2704903","resolution":{"observed_at":"2026-08-16T10:22:53.632512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.618484Z","title":"LungHist700: A dataset of histological images for deep learning in pulmonary pathology","venue":null,"work_id":"bfffa778-c71c-471c-99e4-34e397865e61","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.448580Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:68d4260fb3491f997f39ef3d0021237eb4371ec3d198e5e9c65b9ae5d501e0f4","observation_id":"b299ab0e-d64d-4bbd-87ba-8cadd9c49f01","resolution":{"observed_at":"2026-08-16T10:22:53.621966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.608218Z","title":"Internlm-xcomposer2-4khd: A pioneer- ing large vision-language model handling resolutions from 336 pixels to 4k HD","venue":null,"work_id":"552051b8-d801-4448-9ff2-ec47f55fc616","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.451866Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:eb37f07022012fdf3219c5ca354ea3ef5d3dcb30dc3e20d897970fe729c509ab","observation_id":"ab042208-0d94-4f79-8ecc-e81ad17c7e34","resolution":{"observed_at":"2026-08-16T10:22:53.611682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T10:22:52.455103Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.455103Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:ac7e37a6f1610cd864d5d0cccefc6516ef777f7c15b8324eb79f344022811fce","observation_id":"a263f2d1-568b-4dbf-b65f-3d6ffda9c112","resolution":{"observed_at":"2026-08-16T10:22:52.455103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.597230Z","title":"Describing differences in image sets with natural language","venue":null,"work_id":"ae74dbf3-2e68-40ce-ac99-38389ec7e562","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.458785Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:423f6082ea45366bfb710ad8a5eeae4a38e6bd45c833347ca71846348524f845","observation_id":"3543c1bb-b91e-41ad-a5a0-6f8843f862db","resolution":{"observed_at":"2026-08-16T10:22:53.601042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.586503Z","title":"Floorplancad: A large-scale cad draw- ing dataset for panoptic symbol spotting","venue":null,"work_id":"9e2bb4f5-8d97-4e2b-8b8a-c9543465117f","year":2021},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.462320Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:90e52aa2b33e068dc222bab22317dacd0c0385ffa383806c1114289ac076f0ef","observation_id":"f65c327e-f379-4aad-89a6-efc6604d2669","resolution":{"observed_at":"2026-08-16T10:22:53.590413Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16261","last_updated":"2024-11-07T15:35:52Z","snapshot_observed_at":"2026-08-16T13:07:17.334724Z","submitted_at":"2024-10-21T17:58:20Z","title":"Mini-InternVL: A Flexible-Transfer Pocket Multimodal Model with 5% Parameters and 90% Performance","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16261","snapshot_observed_at":"2026-08-16T10:22:52.465714Z","title":"Mini-internvl: A flexible-transfer pocket multimodal model with 5% parameters and 90% perfor- mance","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.465714Z"},"links":{"cited_paper":"/paper/2410.16261","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:98672e8f1752a4b965c3c64d39b4cff9514c3e2c5bdf45c296619c39ef03a1bb","observation_id":"b33ecc19-b636-4868-807b-f9f156c0d2a3","resolution":{"observed_at":"2026-08-16T10:22:52.465714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.576067Z","title":"Making the v in vqa matter: Elevating the role of image understanding in visual question answer- ing","venue":null,"work_id":"ee47256c-a253-4d0e-a4db-25b292d92a39","year":2017},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.469307Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:9aa90a9fc101d9fba8cd17a6579f8e6826250594dcfb4d3e9935987d767801a4","observation_id":"67467734-d1fc-46cc-8cea-14e87c0e9ea4","resolution":{"observed_at":"2026-08-16T10:22:53.579762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.565519Z","title":"Llava-uhd: An LMM perceiving any aspect ratio and high- resolution images","venue":null,"work_id":"aebedb45-9aa5-4bb8-a2c1-c9ae2505cdcf","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.472689Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:c80b0fb535932c82c78b85dd6fb0072babd0573ded3143c19ccc547be171eb32","observation_id":"5dae7f81-ff1f-428d-8965-120282bb8756","resolution":{"observed_at":"2026-08-16T10:22:53.569489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.555384Z","title":"Cogagent: A visual lan- guage model for GUI agents","venue":null,"work_id":"d0deb064-02d5-46c1-b390-2ccb80638f41","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.476218Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:afc87806ef5119d8f69c254f7df644630b4bed0d2d38285ead37165a6e5905f2","observation_id":"a7cb86e0-1b89-49ee-8103-6ee52159a44f","resolution":{"observed_at":"2026-08-16T10:22:53.558847Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.544444Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":"3c59ec85-0936-491a-b1bc-3b74cf536166","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.479535Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:c025b8f644855e93ea936840e8296d0b7d1cceaf54ccde75c67c9f36c54c9f06","observation_id":"e71e3d52-d4ac-49ac-bb8c-d59361ed0628","resolution":{"observed_at":"2026-08-16T10:22:53.548052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-16T13:21:07.303548Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-16T10:22:52.483040Z","title":"mplug-docowl2: High-resolution compressing for ocr- free multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.483040Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:ccf6e4f28f28c3e279154b8cd497afab01073929d37d56dd5c39bfaca678bdab","observation_id":"c82a385b-598a-4c8f-87ef-8d3fcbdbcdda","resolution":{"observed_at":"2026-08-16T10:22:52.483040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.534516Z","title":"Novachart: A large- scale dataset towards chart understanding and generation of multimodal large language models","venue":null,"work_id":"61989a84-4b4f-4cfc-bf00-5e272d9c50e4","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.486969Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:2a402654e1b0e082a1667cf80a4ec36198dbc7e4adf01622877f544a1e6595e9","observation_id":"694fe1a0-1e68-4e9d-a306-5ab338b52b13","resolution":{"observed_at":"2026-08-16T10:22:53.538004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.524331Z","title":"High reso- lution image quality database","venue":null,"work_id":"382a7c00-6f12-46c1-9734-49411202699f","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.490267Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:660338793818792e98ab8ed4a5f69eada5146a4663ccdbe6404118557d02debf","observation_id":"320bb115-4ebc-421b-a50b-ed91ba62d796","resolution":{"observed_at":"2026-08-16T10:22:53.527667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.514127Z","title":"Mini-monkey: Alleviating the semantic saw- tooth effect for lightweight MLLMs via complementary im- age pyramid","venue":null,"work_id":"dc7e6477-ef58-4244-8446-267aad0a2c00","year":2025},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.493634Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:97c63edb4975780b8b8ab93d6bf513f96453226c180a02b2bd16580a48898ac8","observation_id":"dbd2eaae-922f-4a31-b77a-d201cdb248a9","resolution":{"observed_at":"2026-08-16T10:22:53.517732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.503887Z","title":"The apolloscape dataset for autonomous driving","venue":null,"work_id":"4b71578e-45e8-4cc2-806f-d8123e0d3ac4","year":2018},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.496876Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:569337c75cb6c830587c8d349cbed766caf021a22fac120b63fb8c96468af265","observation_id":"a3c99a96-fffb-4241-a0cb-e6cceaf6ca5c","resolution":{"observed_at":"2026-08-16T10:22:53.507439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-16T10:22:52.500288Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.500288Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:f1e4dfe14a9e47cf355cd5d0b839e702cb6998ca574a8599cba5ea0cbcd0aaf6","observation_id":"f5021136-94e3-4344-99ca-29f1255b301d","resolution":{"observed_at":"2026-08-16T10:22:52.500288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.492857Z","title":"Multi-source multi-scale counting in extremely dense crowd images","venue":null,"work_id":"ef4751d4-1c04-42fa-8e01-621bafdf2a08","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.503899Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:d371c0c63dead2d43d4143aec71378e12bc87abb1c73e81963d3b5b99e2c5117","observation_id":"47e467f5-93b5-46f2-8aa4-3c00497d8f1d","resolution":{"observed_at":"2026-08-16T10:22:53.496564Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.482989Z","title":"Composition loss for counting, density map estima- tion and localization in dense crowds","venue":null,"work_id":"e3876da2-5c64-4ce2-8a77-f8152dc4496d","year":2018},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.507778Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:646081068f4803d182e1620b3543576ee64e48329ad35f164c931d3db9ce287c","observation_id":"7771275f-05a5-40d4-b808-9a8c39b60bd7","resolution":{"observed_at":"2026-08-16T10:22:53.486389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07315","last_updated":"2024-11-21T08:08:06Z","snapshot_observed_at":"2026-08-19T05:12:30.203464Z","submitted_at":"2024-07-10T02:24:43Z","title":"CosmoCLIP: Generalizing Large Vision-Language Models for Astronomical Imaging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07315","snapshot_observed_at":"2026-08-16T10:22:52.511131Z","title":"Cosmoclip: Generaliz- ing large vision-language models for astronomical imaging","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.511131Z"},"links":{"cited_paper":"/paper/2407.07315","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:b24007338813ee23a867d39b18d723e663d1f97d931b879be44da64cf620ee87","observation_id":"bbdc62ea-4066-464f-9852-4d5b711ee143","resolution":{"observed_at":"2026-08-16T10:22:52.511131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09453","last_updated":"2025-02-21T04:50:45Z","snapshot_observed_at":"2026-08-17T21:03:51.498714Z","submitted_at":"2024-10-12T09:16:09Z","title":"MMAD: A Comprehensive Benchmark for Multimodal Large Language Models in Industrial Anomaly Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09453","snapshot_observed_at":"2026-08-16T10:22:52.515246Z","title":"Mmad: The first-ever comprehensive benchmark for mul- timodal large language models in industrial anomaly detec- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.515246Z"},"links":{"cited_paper":"/paper/2410.09453","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:b76cdc4a3ee9db0fcaadf113fc4e1fde7500a2413c55bd75d044ddc969470c0a","observation_id":"af02aa70-aabd-4317-b138-8e2890980087","resolution":{"observed_at":"2026-08-16T10:22:52.515246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.471081Z","title":"A diagram is 10 worth a dozen images","venue":null,"work_id":"75cbb7a3-df63-4828-9f98-58c562f33f38","year":2016},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.518870Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:708752f40a38a3e7a66a3e746b9560bd23af26379fca7a515cc78d6c41ccf72f","observation_id":"f97d40ff-5c0e-4917-8a81-08ae1b554f3b","resolution":{"observed_at":"2026-08-16T10:22:53.475510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.459739Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross B","venue":null,"work_id":"e19dd58b-27fa-41db-bd67-d3359db92050","year":2023},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.522188Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:c64a3bd7e016577bcd2d1f985c863109b26176e887c12ed078419719f60aa208","observation_id":"ef01dd84-2979-419b-b91b-f2006978501c","resolution":{"observed_at":"2026-08-16T10:22:53.463325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.448836Z","title":null,"venue":null,"work_id":"ce212361-d80c-4989-a0a7-74a4692348f9","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.525350Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:fdd61811398556ef7e7d0eb80391d388c94851ae1ab45d7d730deda348e88e98","observation_id":"652cbbda-5d7a-4ae4-b779-259e86ac5003","resolution":{"observed_at":"2026-08-16T10:22:53.452609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.437672Z","title":"A dataset of clinically generated visual questions and answers about radiology images","venue":null,"work_id":"97cec2ea-9cd3-4738-83f0-21f18f232f92","year":2018},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.528830Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:6fe1699626b27723d6ea65d9c40baa40d9a3153f54c9a0276a6f7c9cb736d0d1","observation_id":"ce38ad38-cf11-496e-b34a-23bafbf7087c","resolution":{"observed_at":"2026-08-16T10:22:53.441274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.427308Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation, 2022","venue":null,"work_id":"296d8bce-73af-40e8-a840-a332110d9ab6","year":2022},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.532223Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:fc10eb18f9228bbe8768db60e9571864bc7c0a4207780773717622f10d2a57cb","observation_id":"dd87e033-17dd-40d5-a7ac-b5ca145bb28e","resolution":{"observed_at":"2026-08-16T10:22:53.431021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.417284Z","title":"Hrvqa: A visual question answering benchmark for high-resolution aerial images","venue":null,"work_id":"38c967af-c00d-4db8-8269-0584b446c5e0","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.535599Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:15c39470a6e60d37e83b767e0e649a4cb8601b44ce18367fdfa6c146c0098203","observation_id":"090ce644-3b98-469d-9077-51d19d9bb127","resolution":{"observed_at":"2026-08-16T10:22:53.420747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.406844Z","title":"To- wards streaming perception","venue":null,"work_id":"fde3572c-a964-4c92-a944-a34b63ab1c03","year":2020},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.538872Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:568333e75f1d774d4292579452a99c55edcba4096b23666cb064145ea1b2f811","observation_id":"5ea0ebcb-a443-4f56-bce3-67b7cd2542a7","resolution":{"observed_at":"2026-08-16T10:22:53.410588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.396088Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"0acc3b7c-5091-4904-bba2-cfb786e80117","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.542538Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:07ede0dfe0cdc6bbe2abd0dce9c0f6b5f392f661aea97754e79e5d8b642383e7","observation_id":"e02da5d8-5072-4c2c-b1f7-49c0d86fa976","resolution":{"observed_at":"2026-08-16T10:22:53.399929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11404","last_updated":"2022-06-22T22:10:18Z","snapshot_observed_at":"2026-08-16T16:51:02.222443Z","submitted_at":"2022-06-22T22:10:18Z","title":"The ArtBench Dataset: Benchmarking Generative Models with Artworks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11404","snapshot_observed_at":"2026-08-16T10:22:52.545955Z","title":"The artbench dataset: Benchmarking generative models with art- works","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.545955Z"},"links":{"cited_paper":"/paper/2206.11404","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:4a7b6982166f357739b000734e4675afaa8182a54d6412cd120ba9cbf82e4e99","observation_id":"8834e4b0-29c1-49bb-ac17-2cf49e132b87","resolution":{"observed_at":"2026-08-16T10:22:52.545955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.385869Z","title":"Visual instruction tuning","venue":null,"work_id":"a47733e6-aa2b-4668-8e30-c284df1d3fd8","year":2023},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.549625Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:38b10f3632c197cdb705d3604b98ce14063c9bd2f88b9503c7b8ba376a358d8d","observation_id":"702d130a-c5fd-47a4-bb23-c923f4826bf1","resolution":{"observed_at":"2026-08-16T10:22:53.389280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.375107Z","title":"Visual instruction tuning","venue":null,"work_id":"59f2d0a5-978f-46cf-90af-b141de5e5bc0","year":2023},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.552983Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:402e453ff5c9d1fbc82d472875084658f41603bde40e71eb1d371c692a4b3d50","observation_id":"b662ac6b-21e7-47e4-91a6-3b735978b878","resolution":{"observed_at":"2026-08-16T10:22:53.378720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.364463Z","title":"Liu, Kevin Lin, John Hewitt, Ashwin Paranjape, Michele Bevilacqua, Fabio Petroni, and Percy Liang","venue":null,"work_id":"79c17bfd-cfb5-4524-bbd6-45aef64ae966","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.556413Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:08caaeaf7b6195c4cf1825d1937e59be9e5072a421075846c2197153306690b9","observation_id":"5c0f2fe2-da3d-4828-b7db-7357e9005fd2","resolution":{"observed_at":"2026-08-16T10:22:53.368266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.353261Z","title":"A convnet for the 2020s","venue":null,"work_id":"01ef00aa-4dc0-4e05-a1fe-298dfe4dbb34","year":2022},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.560005Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:38342c55e5fa21ccc51d7cddbb19e86ba7fac0949dc923ed8ad7c8b0c65877d3","observation_id":"f5d8e1cc-4b44-4e31-8afd-14b7e3d78322","resolution":{"observed_at":"2026-08-16T10:22:53.357129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-16T10:22:52.563373Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.563373Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:a9e6d47bdfe004587436aa30a1537b5a2cfb77c0b583df58f61d792ef4341123","observation_id":"f3b305db-fadf-4584-b15e-fa91c6b88242","resolution":{"observed_at":"2026-08-16T10:22:52.563373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.341299Z","title":"Feast your eyes: Mixture- of-resolution adaptation for multimodal large language mod- els","venue":null,"work_id":"79a33cf2-4b2f-41c2-b17c-d7a5c44a4ccf","year":2025},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.567069Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:78054d3935243e08158e66f846412184ee0f102e074d9494780a7619c48cc7f2","observation_id":"997a93e9-ecbe-44a5-9a1d-bf4f0c1d7d36","resolution":{"observed_at":"2026-08-16T10:22:53.344940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.329859Z","title":"Infographicvqa","venue":null,"work_id":"53d968dc-f4f8-4997-a646-07fca6861df6","year":2022},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.570808Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:301c72fa1469abaef9df5eb345a9e1daca18c3a3ea5f6aae023bde917f72f3eb","observation_id":"432380a8-118f-4daf-b63d-c7788b99631b","resolution":{"observed_at":"2026-08-16T10:22:53.333675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.318175Z","title":"MM1: methods, analysis and insights from multimodal LLM pre-training","venue":null,"work_id":"d5e07aad-6fe6-49ad-90a0-f0ce804a53c4","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.574251Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:2a29e8192400397a8a5a93375906eca8a3005a97c07de6c5e0f579f37bd1b842","observation_id":"304adae2-21fe-4aed-8c1e-cadeca871c33","resolution":{"observed_at":"2026-08-16T10:22:53.322446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.307283Z","title":"The mame dataset: on the relevance of high resolution and variable shape image properties.Applied Intelligence, 52(10):11703–11724, 2022","venue":null,"work_id":"f5a53c59-d091-46c2-a399-83ac391fc5d1","year":2022},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.577807Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:259a276fc77f8220bfc920ba2e6e45f1f2872a7a11062891f969bd4ec85918a0","observation_id":"36d208a9-8be8-4387-b4e5-9c87de2704f5","resolution":{"observed_at":"2026-08-16T10:22:53.311099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.296549Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"f0f46458-c9de-40ac-b6b0-717b5f4463cc","year":2021},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.581521Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:0e33dda510adcb88a5514b167690282e921ea270915c18857eeb1740dc17afcb","observation_id":"6d458e48-6f4a-4836-86b6-9d15bbb56e64","resolution":{"observed_at":"2026-08-16T10:22:53.300422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.584823Z","title":"The synthia dataset: A large collection of synthetic images for semantic segmentation of urban scenes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.584823Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:896c16386a3c995e74ff8c64f68fe366b68a48940c0b34ab4ea9bb5b8f036ac1","observation_id":"418f9234-1f9a-48e7-b5ec-48bed3326402","resolution":{"observed_at":"2026-08-16T10:22:52.584823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.277576Z","title":"Jhu-crowd++: Large-scale crowd counting dataset and a benchmark method","venue":null,"work_id":"3b878f82-30a5-48b2-9bd8-9c2cdbd76688","year":2020},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.588328Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:30b8cf6d6f582cafd3fc5aab2055e08cbb651c26a4a9d27138e766f8797f5c5b","observation_id":"6dbd83c3-87e4-46ae-bc16-6a5df342a570","resolution":{"observed_at":"2026-08-16T10:22:53.281672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18532","last_updated":"2024-05-15T05:43:30Z","snapshot_observed_at":"2026-08-19T14:46:36.716663Z","submitted_at":"2024-04-29T09:19:05Z","title":"MileBench: Benchmarking MLLMs in Long Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18532","snapshot_observed_at":"2026-08-16T10:22:52.591664Z","title":"Milebench: Benchmark- ing mllms in long context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.591664Z"},"links":{"cited_paper":"/paper/2404.18532","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:d04ac40feb55737e7f33a1780b0e88b467cf8d30ce8f98174222aa449df722ed","observation_id":"2effe67c-8df2-4ba9-be1d-f9082195663a","resolution":{"observed_at":"2026-08-16T10:22:52.591664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T10:22:52.595291Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.595291Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:c6ef8da95c8b5077a93ea52b286e3ace33742a28000c3f9e8d75aaaf32798c27","observation_id":"2249752f-28cf-48b5-afd6-ee52df310d5b","resolution":{"observed_at":"2026-08-16T10:22:52.595291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T10:22:52.599306Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.599306Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:6b86f0b1595840d899ae2e7cb9f61e8415568a8e4100d37c43232dfa436e62ef","observation_id":"0073b7ca-a1b8-42e1-bd00-913a855c079c","resolution":{"observed_at":"2026-08-16T10:22:52.599306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.266427Z","title":"Predicting breast tumor proliferation from whole-slide im- ages: the tupac16 challenge","venue":null,"work_id":"481a7306-c307-4d4a-bd3b-6b0b1800049a","year":2019},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.602880Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:b19b1f6da80de3f4d1c49ffec7cbc3b30cfcbefb763e14e45e5e3d5b4b6e5b45","observation_id":"e8d37346-5381-4628-8b22-f894d82d57e9","resolution":{"observed_at":"2026-08-16T10:22:53.270358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-19T13:30:10.420864Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09411","snapshot_observed_at":"2026-08-16T10:22:52.606264Z","title":"Muirbench: A comprehensive bench- mark for robust multi-image understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.606264Z"},"links":{"cited_paper":"/paper/2406.09411","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:770e7f7cbeadd17ac187a43363d34b1816674988de2d74d49a67b3568b80e0ee","observation_id":"3581a251-a555-4e0f-81f8-bd8810a09e88","resolution":{"observed_at":"2026-08-16T10:22:52.606264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-16T10:22:52.613989Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.613989Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:7c9bc1927cf0d37848776d15f3036737fa4cb808dbda8ee43d54c0e77eb0db58","observation_id":"8038171f-0e4d-4270-88fd-fe9b7f7436c3","resolution":{"observed_at":"2026-08-16T10:22:52.613989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.254936Z","title":"Divide, conquer and combine: A training-free framework for high-resolution im- age perception in multimodal large language models","venue":null,"work_id":"baaf9823-215c-4e9b-a2e8-2ac8366a4288","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.617535Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:0a66b7d42af75b4d5f2e431975bfa850e027943423f36e2d26cfcbbefdcd7096","observation_id":"99e3a955-7b77-43ed-a0d4-4de8baafce46","resolution":{"observed_at":"2026-08-16T10:22:53.258765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-08-16T13:23:18.646931Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-08-16T10:22:52.620905Z","title":"Divide, conquer and combine: A training-free framework for high-resolution im- age perception in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.620905Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:d7373dce28f4a903a452b4a04606aa222ec28dbda11928117262a0900a6d52ca","observation_id":"99dd5e4f-374c-4d32-bc37-8bb84f7c2773","resolution":{"observed_at":"2026-08-16T10:22:52.620905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.244159Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"f90e0e63-6f24-4309-ad30-7e684b00e966","year":2025},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.624325Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:aaaec0e8070d9be607ed7b461716abccaa6864d8a3989fde3d7c8f4c7c42f2d4","observation_id":"b4cab3b4-c321-46b0-9e4b-28dae3ee7bd5","resolution":{"observed_at":"2026-08-16T10:22:53.247840Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.232601Z","title":"Panda: A gigapixel- level human-centric video dataset","venue":null,"work_id":"dd1f5d2b-e5d3-43f8-9fbf-780f6beca92d","year":2020},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.627940Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:3a82460764cbafee22ac0087ffe5524a2ee6972219e0259ab6b38d62ab24476a","observation_id":"eef52f33-274d-440e-b097-3312e6487ebe","resolution":{"observed_at":"2026-08-16T10:22:53.236547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.221661Z","title":"Weiser, P.L","venue":null,"work_id":"3eaa6e04-87e7-45bf-bed1-7473764ccdb4","year":2017},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.631117Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:4dfda6abe26065dffc570a4665f6d7378190ab9847b8eba2d60a6af668fc71f1","observation_id":"57526d2d-fb65-4948-b8c8-6d0d0a0fe354","resolution":{"observed_at":"2026-08-16T10:22:53.225206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.199391Z","title":"V?: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"f893db61-5306-4a50-893f-66cffa01eb5d","year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.637878Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:4e833f2d42c902294a4a448f6677e8532f3bbac3124b3c448c50a895b56b993b","observation_id":"2c891846-3d79-4421-aae7-cdf56950113c","resolution":{"observed_at":"2026-08-16T10:22:53.203540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13766","last_updated":"2025-03-11T17:31:27Z","snapshot_observed_at":"2026-08-18T11:01:07.019808Z","submitted_at":"2024-07-18T17:59:30Z","title":"Visual Haystacks: A Vision-Centric Needle-In-A-Haystack Benchmark","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13766","snapshot_observed_at":"2026-08-16T10:22:52.641231Z","title":"Visual haystacks: A vision-centric needle-in-a- haystack benchmark","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.641231Z"},"links":{"cited_paper":"/paper/2407.13766","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:51b71a192399fb85ca93e0e9f3980f2f9bd6f960d7ca347a387fffdcb9af3a89","observation_id":"d38f6978-372a-4e46-914f-b76d9b486cff","resolution":{"observed_at":"2026-08-16T10:22:52.641231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-16T10:22:52.648406Z","title":"Deepseek-vl2: Mixture-of- experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.648406Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:37a33136ad4e16214dd243a2bc8753dadef108a984af6da406d02047f2d58987","observation_id":"88fce6b9-61f5-46f8-b8c4-77343d86eccb","resolution":{"observed_at":"2026-08-16T10:22:52.648406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.188293Z","title":"Deep learning for detecting corona virus disease 2019 (covid-19) on high-resolution computed tomography: a pilot study","venue":null,"work_id":"b5cba861-9c2e-456d-be14-3082eff95dca","year":2019},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.651683Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:927e46d683088d33099c4bdc8a7c5669de5b23e0b47aa74018b55151419510e2","observation_id":"d8fdb897-c59f-4dad-b020-0499b7480244","resolution":{"observed_at":"2026-08-16T10:22:53.192182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.177472Z","title":"Bdd100k: A diverse driving dataset for heterogeneous multitask learning","venue":null,"work_id":"76127602-2a83-4981-baf4-7360123041c8","year":2020},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.655316Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:f172f3f106fffa0834f5a6c737bbae5554a9d3ba97520025fc8e1863913a74d8","observation_id":"319de3f4-0f78-4693-ad79-70d0235c154c","resolution":{"observed_at":"2026-08-16T10:22:53.181330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.659019Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for ex- pert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.659019Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:0f1b428b141b0b4f9f836d9c61e1bde3e71313cd8b16ab19e9f98d277f06001c","observation_id":"a3770264-13b9-43f9-a15f-822ebf6caee3","resolution":{"observed_at":"2026-08-16T10:22:52.659019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.159137Z","title":"Single-image crowd counting via multi-column convolutional neural network","venue":null,"work_id":"0b7c4b47-d196-4078-920a-6f38ee3a42af","year":2016},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.662419Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:87e405480edf7dd5ec8c47acc49e6db6af98034e167ae574202df945c82dfb7c","observation_id":"a6e95b13-d20a-4042-9b3e-21ee90b4f30c","resolution":{"observed_at":"2026-08-16T10:22:53.162943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02713","last_updated":"2025-08-01T16:40:14Z","snapshot_observed_at":"2026-08-19T14:11:01.412437Z","submitted_at":"2024-10-03T17:36:49Z","title":"LLaVA-Video: Video Instruction Tuning With Synthetic Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02713","snapshot_observed_at":"2026-08-16T10:22:52.665965Z","title":"Video instruction tuning with synthetic data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.665965Z"},"links":{"cited_paper":"/paper/2410.02713","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:4f1902f6a6b9a8ebf3ab35190d954fe725b8b176f82e820fe1297947f2d44c0e","observation_id":"4ff3db0e-5e4a-45ea-8d17-2c8a00b98a54","resolution":{"observed_at":"2026-08-16T10:22:52.665965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-16T10:22:52.669629Z","title":"Mme-realworld: Could your multimodal llm challenge high-resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.669629Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:fca26d0d295f43aa4de7e5ae1445935ee760b1b6c1aec25f9f24bdbd95edb5ea","observation_id":"ce0ae181-b1cf-4695-9ff0-773db659f6a4","resolution":{"observed_at":"2026-08-16T10:22:52.669629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.147402Z","title":"Monitoring Extracted from MME-Realworld, this dataset features images taken from public safety cameras in diverse scenarios","venue":null,"work_id":"d88afb64-75b2-4d0e-b03e-1220c8742412","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.673114Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:bbf8e15e2fcbb91bf37deea40af4c52f9ca7a83f48fbce0bbdd8b4079331d413","observation_id":"6ad8a1ae-f2b4-4ff2-accb-87d5da2029f5","resolution":{"observed_at":"2026-08-16T10:22:53.151619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.135911Z","title":null,"venue":null,"work_id":"8340e6f9-ed75-436c-bf8c-12447b7986be","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.676865Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:1b3a9b68f4e40ee7704f7233db1cd7401e18a9486ed3fc8403cff396a19ae57e","observation_id":"f10ccd4a-4de5-4ce5-a358-e5474c129936","resolution":{"observed_at":"2026-08-16T10:22:53.139626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.123594Z","title":"Phi- 3.5 [2] is a lightweight model designed for efficient lan- guage understanding and generation","venue":null,"work_id":"6bab716b-ac84-4421-b6c0-8460139f46ef","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.680145Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:cb53f16d6c2a4772adcec11191feba6cff9b09ae6627295d1eecc4a0484bd1d7","observation_id":"c18d8af0-22b6-4773-8268-b177c9265cec","resolution":{"observed_at":"2026-08-16T10:22:53.128132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.999646Z","title":"The scores are the average per- formance of all samples in val, test, testmini splits","venue":null,"work_id":"2cffd16e-40d3-4b32-8186-6dcf3db6606d","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.684358Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:38355c1bc897340ce77d2074acf3ee464763f1696974b2d4ffff61c6e120f7ce","observation_id":"4439af5e-c13a-4957-b8fe-e865bc6755f0","resolution":{"observed_at":"2026-08-16T10:22:53.003484Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.988491Z","title":"question n Give an answer with this format: <ans>ANSWER</ans>, no redundant words. For example: <ans>A</ans>","venue":null,"work_id":"ead47843-c8fa-4d3b-bb44-6467a4ddc90b","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.688258Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:87cc9e896a517097d58e24258826e3f907601071b9ba531d3681bff61f6cd596","observation_id":"ea35b337-831a-47a2-a900-74d0eeac204d","resolution":{"observed_at":"2026-08-16T10:22:52.992279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:52.974274Z","title":"We compress the images to display them in the paper","venue":null,"work_id":"24a46d6e-4ea4-433e-b2c5-a2e82f89785e","year":null},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.691595Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:a8e74642a010fb41ea951d5950f4f341d209b7c60c805bfd911f86d94ddc2c4a","observation_id":"4b9f70eb-5177-4308-8a37-d78e5fd7e01a","resolution":{"observed_at":"2026-08-16T10:22:52.980470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T10:22:53.210991Z","title":"Geological Survey data release, 2022","venue":null,"work_id":"65b6f76c-84a8-47d8-b944-7aaf194c224c","year":2022},"citing_paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T10:22:52.634550Z"},"links":{"citing_paper":"/paper/2504.18406"},"observation_digest":"sha256:1e93f01a8ff3134aadce40901ddde744027d1915d89177715b8ce72b0ba92ec4","observation_id":"a0c9f485-4bef-49bc-b1b0-d659d904e87f","resolution":{"observed_at":"2026-08-16T10:22:53.214714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.18406","last_updated":"2025-04-29T16:20:52Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T11:06:00.879826Z","submitted_at":"2025-04-25T15:01:41Z","title":"HRScene: How Far Are VLMs from Effective High-Resolution Image Understanding?"},"reference_resolution":{"displayed":84,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":51},"total_outbound_references":84},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 84 of 84 outbound references and 0 inbound Pith citation observations for arXiv:2504.18406."}