{"as_of":"2026-08-19T04:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0f8984ea293a1ae4c05c87a4c2e451cfbe29e0a2babb654f53ed47ea0b37ca70","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T15:18:49.974575Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:51:42.830659Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T11:38:38.471219Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14276","snapshot_observed_at":"2026-08-15T17:51:42.830659Z","title":"Liang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20156","last_updated":"2025-07-27T07:20:25Z","snapshot_observed_at":"2026-08-17T04:17:02.488966Z","submitted_at":"2025-07-27T07:20:25Z","title":"Trust the Model: Compact VLMs as In-Context Judges for Image-Text Data Quality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:51:42.830659Z"},"links":{"cited_paper":"/paper/2501.14276","citing_paper":"/paper/2507.20156"},"observation_digest":"sha256:c4cc7017ab62fed50f9fcfa9e10e3f4a66b5d4da79018101d27f45d2e7c056df","observation_id":"1d86c0e1-6bd8-4667-8769-8edaf95e3ad4","resolution":{"observed_at":"2026-08-15T17:51:42.830659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2501.14276","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.14276","snapshot_observed_at":"2026-08-06T11:38:38.471219Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","venue":"cs.CV","work_id":"ba0978db-9a89-41d0-89b2-d7f6f8e04269","year":2025},"citing_paper":{"arxiv_id":"2507.22530","last_updated":"2025-07-31T03:01:47Z","snapshot_observed_at":"2026-08-11T21:40:20.267418Z","submitted_at":"2025-07-30T09:57:38Z","title":"HRVVS: A High-resolution Video Vasculature Segmentation Network via Hierarchical Autoregressive Residual Priors","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:38:36.041216Z"},"links":{"cited_paper":"/paper/2501.14276","citing_paper":"/paper/2507.22530"},"observation_digest":"sha256:5959ea4e6c3ac901325fb25a47b2ef57f5c18e7b3d33528653edb7b63753b3a3","observation_id":"377603f8-1932-42d4-ac27-1cb2d7df6fed","resolution":{"observed_at":"2026-08-06T11:38:38.548285Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.14276/citation-record","integrity":"/paper/2501.14276/integrity","json":"/paper/2501.14276/citation-record.json","paper":"/paper/2501.14276"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.724787Z","title":"Visual instruction tuning","venue":null,"work_id":"8570ea84-0727-48c2-8853-9b569c00d4fa","year":2023},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.624071Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:6f28f6502280480d5995059a2f1f548d341cf34c48d57c66e644ed666deb3783","observation_id":"b953dbc5-4c2c-4380-ab0a-4568c43acca0","resolution":{"observed_at":"2026-08-10T15:18:50.729320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.709839Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"f538a81e-057a-4a85-9639-0b0e438e115a","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.629706Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:b0a7c322ea3edbf8bbf8b08e6f9f7cc7f7b123dd58eb5f601d744a1fa44bb543","observation_id":"793e77b5-ae36-4a4e-8708-d4d4d1ad1c04","resolution":{"observed_at":"2026-08-10T15:18:50.714256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.694530Z","title":"Sharegpt4v: Improving large multi- modal models with better captions","venue":null,"work_id":"fafa8af7-562f-405f-a2b1-91cd15577d8e","year":2025},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.635118Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:931d23f148a2a87c63722c1acf9085aec84985bca465f243ca74e4bbb8bd8500","observation_id":"06c17ce1-689b-4fa8-a059-5500e98a098d","resolution":{"observed_at":"2026-08-10T15:18:50.699395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.678581Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"b2539696-035e-4102-b930-8fd66fcbce40","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.640278Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:b05605c2f289931410f9128d7b11456972a0b6a99f5941f35b3130c1074552c9","observation_id":"a2eaa09e-434f-4f68-b289-9f04a195ccdd","resolution":{"observed_at":"2026-08-10T15:18:50.683185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.662400Z","title":"InternLM-XComposer2-4KHD: A pioneering large vision-language model handling resolutions from 336 pixels to 4k HD","venue":null,"work_id":"61a9364a-d108-4fd5-9fb5-b9562a722864","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.645187Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:cecf00ce09761f33b1449c964efd373ef550783c80fd1c133abca5f7ca4c4d69","observation_id":"4c8928aa-2cb5-4c60-94ad-ace2a76da0d9","resolution":{"observed_at":"2026-08-10T15:18:50.667468Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.646252Z","title":"Salgan: Visual saliency prediction with adversarial networks","venue":null,"work_id":"629ea8e8-bccd-434a-acdd-e4af2e709b45","year":2017},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.650579Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:bb4ffd2dcba305233602959d9132e820b34ee1f931fed53b358356155d0af588","observation_id":"c450716a-35f9-47b7-9d62-b9aa6d260320","resolution":{"observed_at":"2026-08-10T15:18:50.651828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.630047Z","title":"PaLI: A jointly-scaled multilingual language-image model","venue":null,"work_id":"885ca0d5-68b6-4fb7-a3f4-89e3c43c7e0a","year":2023},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.655951Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:3aa7ef095e184ebe9fdec8fbde7a51df396bec504ae8dea1e19d4585d1085ac2","observation_id":"83e6ff61-f14e-45ea-8bab-98341f2d92cb","resolution":{"observed_at":"2026-08-10T15:18:50.635363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T15:18:49.661345Z","title":"Deepseek- vl: towards real-world vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.661345Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:1b1626628d561c01dff9ff634224ece90214b317d735dc000fe2130bfbbde502","observation_id":"341bd568-5bef-4ff7-9209-2e8df930f74b","resolution":{"observed_at":"2026-08-10T15:18:49.661345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.614757Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs","venue":null,"work_id":"efec4f60-ded2-4dc1-8682-5faf855aebfc","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.666160Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:e5d9db60b187b64b4af373e1187fe7920f661f30a88b30ad80826e435f4f7835","observation_id":"4ac08dd5-2ae7-486a-b65d-a0f9052462d9","resolution":{"observed_at":"2026-08-10T15:18:50.619723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:49.670527Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.670527Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:c8744f9afbe53fed6e8fb4ed5c29234b48fdae3d616ad58f9d6702fd0ddf40df","observation_id":"0b98434d-d5c4-473f-ab85-df6b0825bfaf","resolution":{"observed_at":"2026-08-10T15:18:49.670527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:49.674802Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.674802Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:d5faa0b8da444437a4b11289b32f3675286cc491b1f2a1b8f9ac6e1c382a75ce","observation_id":"40ac4578-9d36-44c6-bc74-9aac4380cf8c","resolution":{"observed_at":"2026-08-10T15:18:49.674802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.579612Z","title":"Instruct- blip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"a567d992-5127-473b-9ddd-789be8180139","year":2023},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.679115Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:185fd75367b4839cb01b63e360e6483f42e9675f9892cc88d98b3e6d3bc24a9d","observation_id":"1365c077-116c-4169-a8d4-ffc36c18a8c9","resolution":{"observed_at":"2026-08-10T15:18:50.584820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.564845Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"a9330704-e917-41b6-8f8d-701409af11a9","year":2021},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.683033Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:fc94d4ea407bfb3dc658a1efb51293514617124084a9e6af6e8805b0087b3d2a","observation_id":"695af14c-d233-47bc-b4bd-f3520a045059","resolution":{"observed_at":"2026-08-10T15:18:50.569728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.550014Z","title":"Dual modality prompt tuning for vision-language pre-trained model","venue":null,"work_id":"fe8e4266-928a-4b93-a2f3-68307de4f43d","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.686957Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:5a55e4d6ab39ecf5b07f721b4fc5e331b836348cafa167c3b42d4aff7882dad3","observation_id":"1602eccf-23fe-4268-b4c2-4910c6fce142","resolution":{"observed_at":"2026-08-10T15:18:50.554579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.534805Z","title":"Sgva-clip: Semantic-guided visual adapting of vision-language mod- els for few-shot image classification","venue":null,"work_id":"c5bcd957-0cd8-4b64-840c-3fc7a3b90c21","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.690868Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:87c13124c39eb15c2ba2a4b1fbc65365ec0c07c84f8ef53c0879be354ff3f1c9","observation_id":"c149faca-a31e-419f-903f-fbdc5d9bfb1c","resolution":{"observed_at":"2026-08-10T15:18:50.539960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.520057Z","title":"Gpt4ego: Unleashing the potential of pre-trained models for zero- shot egocentric action recognition","venue":null,"work_id":"92190f06-be1c-4fba-8a7f-16762e88f449","year":2025},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.695889Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:48b3799434458625aeb518bff8a0a32cb14ae83ea4952b2ca181108a999b66b9","observation_id":"f3181c5a-fa3f-4cb3-afc8-eff3fb1e2313","resolution":{"observed_at":"2026-08-10T15:18:50.524452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03420","last_updated":"2024-09-09T05:36:27Z","snapshot_observed_at":"2026-08-16T13:21:07.303548Z","submitted_at":"2024-09-05T11:09:00Z","title":"mPLUG-DocOwl2: High-resolution Compressing for OCR-free Multi-page Document Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.03420","snapshot_observed_at":"2026-08-10T15:18:49.701778Z","title":"mplug-docowl2: High-resolution compressing for ocr-free multi-page document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.701778Z"},"links":{"cited_paper":"/paper/2409.03420","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:3ea740d434e9f3b94863558981602f6a16c74afd4fd9ee8563a482499732f5cb","observation_id":"c5de4ea7-eb2f-442a-bde9-424ba3531185","resolution":{"observed_at":"2026-08-10T15:18:49.701778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-12T16:46:46.561976Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-10T15:18:49.706713Z","title":"Internlm2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.706713Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:0e0da9f95e24c51385168750e5068a7e8d91c5e5790d291b678147ec3a1bf7c7","observation_id":"8ca60c17-f493-44a1-8a96-f9d0d7887b4b","resolution":{"observed_at":"2026-08-10T15:18:49.706713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-10T15:18:49.711643Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.711643Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:a29304a7e9c3bdf17acd4bed95eabc432b9516d1cae4b9a6e52d5cff394c9ddf","observation_id":"f95fd1fc-71b6-444c-bea8-964308349d3e","resolution":{"observed_at":"2026-08-10T15:18:49.711643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.506043Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":"a80443c3-e5ad-46ae-af2c-8354406233f6","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.717726Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:54ae1b49de7750917554c27a521c2a66785c2abc87e8646d459069118cd5dd1a","observation_id":"3a553936-ea40-47d6-8922-850dd0ea4399","resolution":{"observed_at":"2026-08-10T15:18:50.510175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.492000Z","title":"Towards vqa models that can read","venue":null,"work_id":"36bd37ea-b29c-499d-a8bf-f58d89a52aa7","year":2019},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.722163Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:68d3bd8429223edaa891ba61f6775837f260d5299841435d7b00b85712f306db","observation_id":"90c802b5-471a-4462-b9a4-4c44ce254abf","resolution":{"observed_at":"2026-08-10T15:18:50.496165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.477598Z","title":"Mmbench: Is your multi-modal model an all-around player? In Proceed- ings of the European Conference on Computer Vision (ECCV) , pages 216–233, 2025","venue":null,"work_id":"649cd03f-e659-48ff-94d3-0d0ff9536320","year":2025},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.727363Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:ac5e4c57eb905254729aa5f26dd5062ade55b233cc222b4a5d46435a0f7afdcb","observation_id":"fc766ca9-d6d0-4117-a0b4-122ad133a92f","resolution":{"observed_at":"2026-08-10T15:18:50.482251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.462721Z","title":"A diagram is worth a dozen images","venue":null,"work_id":"bdedbd39-0a33-48a7-9362-614e003d4019","year":2016},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.732028Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:4cdf6db370b96983ac039c125379e65a57b0f5eba12250dc5aafd41ee62fd544","observation_id":"22cb8890-990b-464b-9528-904eec590064","resolution":{"observed_at":"2026-08-10T15:18:50.467391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.448306Z","title":"Hallusionbench: an advanced diagnostic suite for entangled language hallucination and visual illusion in large vision-language models","venue":null,"work_id":"04106497-bb85-49bb-919c-51b003634dee","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.736628Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:f27d0bc83bcd3946ae6ed65e46fc2969a2463c3a1f060e8a7d6207c4b34b0dcb","observation_id":"45db2590-02e4-4fa6-ad30-f86564e89be3","resolution":{"observed_at":"2026-08-10T15:18:50.453036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.433573Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"18295fb1-1679-449e-a196-cd2d485fddd5","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.740823Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:7c9116a02c6cfbf625781b18dd703a77260ab869fcee7a40d2f28ce873fdd47f","observation_id":"9fb2e153-f3fc-4ab9-a3de-3e38e67e7fb4","resolution":{"observed_at":"2026-08-10T15:18:50.438408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.418273Z","title":"Decoupled weight decay regular- ization","venue":null,"work_id":"9c1c666c-5a4f-4f70-8001-7051402c0b9b","year":2019},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.744780Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:0547be547038032d00a854994369f1055f932121a73c489401ed7738f1561bd1","observation_id":"92118df8-568f-47dc-bc9d-2b271f751bbf","resolution":{"observed_at":"2026-08-10T15:18:50.423092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.403605Z","title":"Dvqa: Understanding data visualizations via question answering","venue":null,"work_id":"a017c9de-518b-461f-a575-0efb24de7b57","year":2018},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.748916Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:d71e47d70033bb6e7be4e12268b3b6b620b6ec45dd1af029fc3d8e2df787ce30","observation_id":"54c31879-1f12-40ce-818f-3f1fbf90adc1","resolution":{"observed_at":"2026-08-10T15:18:50.408507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.388968Z","title":"ChartQA: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":"e05bed42-919b-4ed4-9016-d273e128ffdb","year":2022},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.879875Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:898a0bf8923ae93c6bc6573abe21b4a3a3e683c334c858aec199efae7eb8d60a","observation_id":"73927c6d-1325-4fb3-9fa0-b15755cc4b35","resolution":{"observed_at":"2026-08-10T15:18:50.393775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.374387Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"39db0231-7548-4d72-b857-50a712f0567e","year":2021},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.884941Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:1fca81d49ca910263626d3045b64cf1b8f913036cfb5a22c81779572628b4444","observation_id":"df0f00d9-5505-4a04-9084-806373e0ec1c","resolution":{"observed_at":"2026-08-10T15:18:50.379028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.358964Z","title":"An augmented benchmark dataset for geometric question answering through dual parallel text encoding","venue":null,"work_id":"c8691ff0-53c5-417c-abaf-5f5ab6a3bd7e","year":2022},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.889819Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:8b25c36d5dae74e5ec9a6d69deb1523f117c77a9b8708b172786706713e3e3ed","observation_id":"423dafa5-36b5-4243-b489-c6c85c98862a","resolution":{"observed_at":"2026-08-10T15:18:50.363884Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.343188Z","title":"Ocr-free document understanding trans- former","venue":null,"work_id":"093ccdd2-9f87-4cdd-a449-8c3cfa27aeb1","year":2022},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.894446Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:d23b5b3b5b8f1424904062ea18b565c37fb22a6fc289fdab160f6609a470b8d4","observation_id":"3fea2abc-bf7f-49fa-877d-8fc5f3113e0d","resolution":{"observed_at":"2026-08-10T15:18:50.347991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.327635Z","title":"Are we on the right way for evaluating large vision-language models? In Proceedings of the International Conference on Neural Information Processing Systems (NIPS) , 2024","venue":null,"work_id":"c7c3edfe-7631-4c57-93d9-c802de7112df","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.898740Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:d494728ba48085f61f71a35c201decc8526c33c5a5e77ea253afe5d91de834d3","observation_id":"24fae8a2-ce73-4e34-b13b-0bee0ad822f5","resolution":{"observed_at":"2026-08-10T15:18:50.332780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.313100Z","title":"Mm-vet: evaluating large multimodal models for integrated capabilities","venue":null,"work_id":"9aae0e49-be7e-4cfe-a51b-d24589a0ba8c","year":2025},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.902995Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:11431895b209df39dd03223d34afd4da3bbd9148d34482945261bcd78f1b60ee","observation_id":"5a44332a-664a-4c49-8cee-a2ec6c247fdc","resolution":{"observed_at":"2026-08-10T15:18:50.317294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.297851Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":"ebb434c6-c31a-4452-afac-20aeb9936927","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.907151Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:edc215b25a6dcbf60a5cea880024f30de9a25c321fe553c36736a8e7c0f21030","observation_id":"9906a31c-bea3-48b3-9336-8f37e7158ecd","resolution":{"observed_at":"2026-08-10T15:18:50.302758Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.281315Z","title":"Grok-1.5 vision preview","venue":null,"work_id":"74b02779-2b35-4f04-bc1e-092c7ec14657","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.911148Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:d9d4f987d45c16f44fce558fe51bfcf5a12056549c4d28b276e01f6a01167dd3","observation_id":"c6c03810-9ee8-4a14-8e6e-a27d589e770a","resolution":{"observed_at":"2026-08-10T15:18:50.286691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-08-13T00:35:03.634903Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.13257","snapshot_observed_at":"2026-08-10T15:18:49.916042Z","title":"Mme-realworld: Could your multimodal llm challenge high- resolution real-world scenarios that are difficult for humans? arXiv preprint arXiv:2408.13257, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.916042Z"},"links":{"cited_paper":"/paper/2408.13257","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:461c1f37d2f858676f459406bb98a56824a7247fb2ebdd9d89989a1848b9c418","observation_id":"6aef7a1f-6d98-4fb2-91b5-1776dc5c62f7","resolution":{"observed_at":"2026-08-10T15:18:49.916042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15556","last_updated":"2024-08-28T06:09:02Z","snapshot_observed_at":"2026-08-16T13:23:18.646931Z","submitted_at":"2024-08-28T06:09:02Z","title":"Divide, Conquer and Combine: A Training-Free Framework for High-Resolution Image Perception in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15556","snapshot_observed_at":"2026-08-10T15:18:49.921539Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.921539Z"},"links":{"cited_paper":"/paper/2408.15556","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:2636994265c04104f7bb4756bff9f0a73ad180190c8165324422336aa90abf7f","observation_id":"85204ccc-18ad-4c77-bee0-92926ec24000","resolution":{"observed_at":"2026-08-10T15:18:49.921539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.264597Z","title":"Infographicvqa","venue":null,"work_id":"0d843453-3421-4192-aca4-32bb2867ead0","year":2022},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.926739Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:e2ff74c1a3a61c93e60be9552919ae3a4a18675a75cb170fb9e4cf2742b35815","observation_id":"d55b6464-93a5-4e79-8433-028d34009484","resolution":{"observed_at":"2026-08-10T15:18:50.269531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.248626Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":"efce44f1-579b-4bca-b4fb-6952aec38a83","year":2023},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.931136Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:22b11b1b4c5fb233e214b8f6bec86ff703788e562eb199bcf5f60574f260e0e3","observation_id":"05ce2f96-c2e0-4b66-a5b8-5075adda0bfc","resolution":{"observed_at":"2026-08-10T15:18:50.253336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.233200Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"dc7bafca-c6c8-4eac-8f0b-4ab54d8bc572","year":2022},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.935488Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:80ffb715559cd5ee59df5e89d6213d168ccf5090bf31f69e4e7baeee415e1c01","observation_id":"dabf7dd9-6e3c-4415-ae52-f3c04b9c7b12","resolution":{"observed_at":"2026-08-10T15:18:50.238145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.217547Z","title":"What matters when building vision-language models? In Proceedings of the International Conference on Neural Information Processing Systems (NIPS), 2024","venue":null,"work_id":"bde8795c-aa13-47c9-af8c-f0499ed0e88b","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.940272Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:c63230702c4076f268bc8d4753764cebcd83a29404454301471d71a5d0216b28","observation_id":"b290609f-f6fa-4c5e-b999-c5d4635ae25f","resolution":{"observed_at":"2026-08-10T15:18:50.222525Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:50.198654Z","title":"Vila: On pre-training for visual language models","venue":null,"work_id":"27094526-a537-4e70-8779-96f476ba5f75","year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.944967Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:dfb98800fe2262772328eb45d807125f9aceb0cddeaac7c971139ecf0dc1f965","observation_id":"cc3526a8-d06a-4df2-b2c6-bbb387b08b1c","resolution":{"observed_at":"2026-08-10T15:18:50.205851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T15:18:49.949655Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.949655Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:3eef7e9696b04852ca2e5554f3aa6606b4c3f0e6869fbc8a9fa774d44fd1f7ec","observation_id":"5bf02c69-1611-4eb0-888a-7a11ed03c12f","resolution":{"observed_at":"2026-08-10T15:18:49.949655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-08-16T05:38:56.513422Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16420","snapshot_observed_at":"2026-08-10T15:18:49.954946Z","title":"Internlm-xcomposer2: Mastering free-form text-image composition and comprehension in vision-language large model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.954946Z"},"links":{"cited_paper":"/paper/2401.16420","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:2e07354ceaf3c5228bdd93ebd217e83033fc4c09891ffffb18b2c786e8da9973","observation_id":"a48a38b5-7dce-4027-9b86-642a409825f6","resolution":{"observed_at":"2026-08-10T15:18:49.954946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-08T07:16:45.596308Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-10T15:18:49.959972Z","title":"Paligemma: A versatile 3b vlm for transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.959972Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:c6dd9d544669897157123105490f667ed95940672fbdebb954375e8b7cfcc398","observation_id":"26ee26dc-7886-4915-ab75-859a9ae4212c","resolution":{"observed_at":"2026-08-10T15:18:49.959972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-10T15:18:49.965049Z","title":"Llava- onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.965049Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:4472e2b9fca30154d2ceee7651115c2f72c8884d403c2d785434fe736758b7dd","observation_id":"140b4b66-190e-45ad-9a71-68564329d3f7","resolution":{"observed_at":"2026-08-10T15:18:49.965049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T15:18:49.970163Z","title":"Mini-internvl: a flexible-transfer pocket multi-modal model with 5% parameters and 90% performance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.970163Z"},"links":{"citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:0bbb925a71845b562ffe05b4a7563aff5705c816c47f72725779bbe62d20bf7b","observation_id":"de49709a-2c31-437b-9bed-827cca1ca6f6","resolution":{"observed_at":"2026-08-10T15:18:49.970163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-10T15:18:49.974575Z","title":"Ovis: Structural embedding alignment for multimodal large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T15:18:49.974575Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2501.14276"},"observation_digest":"sha256:578644984f4afc4b90b999491aadf47dafc03a312d5cf3a3570cb5a2c4dce384","observation_id":"5fc3821e-0ff2-44bb-84c7-380649c8191e","resolution":{"observed_at":"2026-08-10T15:18:49.974575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.14276","last_updated":"2025-01-24T06:42:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T19:06:22.271959Z","submitted_at":"2025-01-24T06:42:06Z","title":"Global Semantic-Guided Sub-image Feature Weight Allocation in High-Resolution Large Vision-Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 2 inbound Pith citation observations for arXiv:2501.14276."}