{"as_of":"2026-08-13T18:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:70925c8e89ba5eae186d02861d87ab59c8e7fd1d9c9de238e73749383a0c37cc","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:48:35.027792Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T21:58:53.702009Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T17:37:14.448914Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12776","snapshot_observed_at":"2026-07-02T17:37:14.448914Z","title":"Native visual understanding: Resolving resolution dilemmas in vision- language models","venue":null,"work_id":"9e48fa37-995a-49f0-8bbc-1c01c9c71aaf","year":2025},"citing_paper":{"arxiv_id":"2509.22186","last_updated":"2025-09-29T16:41:28Z","snapshot_observed_at":"2026-08-06T11:22:47.957500Z","submitted_at":"2025-09-26T10:45:48Z","title":"MinerU2.5: A Decoupled Vision-Language Model for Efficient High-Resolution Document Parsing","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-17T13:25:31.884175Z"},"links":{"cited_paper":"/paper/2506.12776","citing_paper":"/paper/2509.22186"},"observation_digest":"sha256:c0f70e6ae5f74979c57da0c3699b5afd924a9ac9c45eb62f955159246910f219","observation_id":"e7ab0eda-b5a6-4a65-9a70-0eda9239920e","resolution":{"observed_at":"2026-05-17T13:25:32.034155Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12776","snapshot_observed_at":"2026-07-02T17:37:14.448914Z","title":"Native visual understanding: Resolving resolution dilemmas in vision- language models","venue":null,"work_id":"9e48fa37-995a-49f0-8bbc-1c01c9c71aaf","year":2025},"citing_paper":{"arxiv_id":"2604.04771","last_updated":"2026-04-09T09:16:34Z","snapshot_observed_at":"2026-08-12T11:17:57.847430Z","submitted_at":"2026-04-06T15:44:18Z","title":"MinerU2.5-Pro: Pushing the Limits of Data-Centric Document Parsing at Scale","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:58:41.377996Z"},"links":{"cited_paper":"/paper/2506.12776","citing_paper":"/paper/2604.04771"},"observation_digest":"sha256:ff974da8f298808bffca05bcc43fde9a71bf8ebb71c1a81a31469a33c878b2f2","observation_id":"112900c6-95c3-433a-b8c0-8835c23ea18c","resolution":{"observed_at":"2026-05-10T23:35:52.439397Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2506.12776","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.12776","snapshot_observed_at":"2026-07-02T17:37:14.448914Z","title":"Native visual understanding: Resolving resolution dilemmas in vision- language models","venue":null,"work_id":"9e48fa37-995a-49f0-8bbc-1c01c9c71aaf","year":2025},"citing_paper":{"arxiv_id":"2606.07861","last_updated":"2026-06-05T21:49:34Z","snapshot_observed_at":"2026-08-02T02:56:55.871904Z","submitted_at":"2026-06-05T21:49:34Z","title":"The Last Visible Pixel: Probing Fine-Scale Perception in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-27T21:58:53.702009Z"},"links":{"cited_paper":"/paper/2506.12776","citing_paper":"/paper/2606.07861"},"observation_digest":"sha256:41d0fd60bb00d026f2be6dffac82b58e573a20386e66a98c10927bb4f6202b79","observation_id":"0fe9215b-8e3c-4eae-9b83-3f1e8e898893","resolution":{"observed_at":"2026-07-02T17:37:14.450399Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.12776/citation-record","integrity":"/paper/2506.12776/integrity","json":"/paper/2506.12776/citation-record.json","paper":"/paper/2506.12776"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T00:48:28.130945Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.130945Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:6daa14ac15f62642d7dee8556ee4127fc886b03253442bd98a40e08952322342","observation_id":"e0e82b7c-81b1-41c4-a0b5-6c052a6f472b","resolution":{"observed_at":"2026-08-07T00:48:28.130945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-12T17:29:41.806995Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T00:48:28.212811Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.212811Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:76169a43f24eee868352fc5fd461975f0dfc0af0f1b684c09cdaa9c8eb8aa6e0","observation_id":"6369f684-748a-4e43-9414-9bc5a166ee8b","resolution":{"observed_at":"2026-08-07T00:48:28.212811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.856155Z","title":null,"venue":null,"work_id":"d90a7ebd-30e9-4d71-93ab-f23737459de3","year":2019},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.348014Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:26e7432c5a20c9eda4f9cc569e1b520eb9c3a7562eeb4d2d5b5d5b76904d84b5","observation_id":"80ce4dc1-81d8-4543-8384-df02b0d133c3","resolution":{"observed_at":"2026-08-07T00:48:37.930240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15558","last_updated":"2025-01-26T15:20:39Z","snapshot_observed_at":"2026-08-13T09:08:32.328477Z","submitted_at":"2025-01-26T15:20:39Z","title":"Ocean-OCR: Towards General OCR Application via a Vision-Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15558","snapshot_observed_at":"2026-08-07T00:48:28.448857Z","title":"Ocean-ocr: Towards general ocr application via a vision-language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.448857Z"},"links":{"cited_paper":"/paper/2501.15558","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b632009e54eeac7f183d80af67492350fb524052ff0b98856284d94fad62b4e6","observation_id":"3a605ce2-499d-4e75-a0b5-7159b53b774b","resolution":{"observed_at":"2026-08-07T00:48:28.448857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-07T00:48:28.559091Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.559091Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:471bd49a619654010087986b5645f1288b31f00565eb237e83b572faebae4424","observation_id":"92ffee03-72d9-4c73-9c81-4513847c6dcf","resolution":{"observed_at":"2026-08-07T00:48:28.559091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.686334Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.686334Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:ff42578ca740cb0d365486fb8b37d25bac01411667c6ef7205ba51568cac3141","observation_id":"f7d0afd1-97d5-4d80-80f4-e03ef8c6561c","resolution":{"observed_at":"2026-08-07T00:48:28.686334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.785387Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.785387Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:720f015985822c88f044a1d7f588c0fecdb3c1636df9cb961f5cdf54421e89ad","observation_id":"b260ec6d-0bbb-4899-8e6c-51b9aff3a854","resolution":{"observed_at":"2026-08-07T00:48:28.785387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.885481Z","title":"FlashAttention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.885481Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:616e04cedd20cebd8f0e1bb58effb23c5f21abee2804cba5f379d7380dd7f252","observation_id":"72c52b55-10e8-4431-bf04-c0040d6601aa","resolution":{"observed_at":"2026-08-07T00:48:28.885481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:28.989104Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:28.989104Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:de4e6b569db160e70fb84e0ffb5d2c8dea04edf44bade3ada4fda416f367ab63","observation_id":"15e0b855-cade-44c4-8722-8e0b0d8f28aa","resolution":{"observed_at":"2026-08-07T00:48:28.989104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-07T00:48:29.154407Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.154407Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5e832d313f3e6fcc0181d12a3c40b68956f5d003b5846e2fc9473ddb4a40d3eb","observation_id":"afc9fdcc-c093-4040-8fc8-8c54c2b820d5","resolution":{"observed_at":"2026-08-07T00:48:29.154407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.652403Z","title":"Gpt-3: Its nature, scope, limits, and consequences","venue":null,"work_id":"e9b17f95-319c-4d2c-b808-1fe1d7b3ce8b","year":2020},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.255022Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:970769ee17e4586372239c70864e0adff90d42cf92a087c6db4da84f56cae779","observation_id":"34d6d148-e214-4a23-b785-302d79a40750","resolution":{"observed_at":"2026-08-07T00:48:37.749092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-07T00:48:29.381519Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.381519Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2a4a80823983a797f691fa4c898070c4411231a77a2674f7b9180cf761a40852","observation_id":"e32e37fb-45e4-4006-ada8-2c8766dc3bcc","resolution":{"observed_at":"2026-08-07T00:48:29.381519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00321","last_updated":"2025-06-05T02:59:05Z","snapshot_observed_at":"2026-08-12T17:21:52.298102Z","submitted_at":"2024-12-31T07:32:35Z","title":"OCRBench v2: An Improved Benchmark for Evaluating Large Multimodal Models on Visual Text Localization and Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00321","snapshot_observed_at":"2026-08-07T00:48:29.512536Z","title":"Ocrbench v2: An improved benchmark for evaluating large multimodal models on visual text localization and reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.512536Z"},"links":{"cited_paper":"/paper/2501.00321","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:4e573f750667edd13e0f1c765c789a613115bdcbd485fc31619f865a254b2c92","observation_id":"79bd0a28-93a8-4458-9fc0-5186a0340428","resolution":{"observed_at":"2026-08-07T00:48:29.512536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.420997Z","title":"Seed1.5-vl technical report, 2025","venue":null,"work_id":"b4ad5b8e-05e3-4896-bf7d-778f307d8501","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.634978Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:cb14634ef27aa8adc57972987a19220a2c8407cb4d024f339ace90113ef4a8c1","observation_id":"1d2629bd-4eee-4440-90d2-4227f3240ef6","resolution":{"observed_at":"2026-08-07T00:48:37.524920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.233208Z","title":"Llava-uhd: an lmm perceiving any aspect ratio and high-resolution images","venue":null,"work_id":"05ba28eb-7a01-42f0-af43-734cfb6de489","year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.741955Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:bc3b462bb3b18cd81de145819c51759568f77dc21f92024c8847a1e12b011322","observation_id":"383e8978-26b3-4a4a-8418-e1043bfa123e","resolution":{"observed_at":"2026-08-07T00:48:37.308102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:29.843867Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.843867Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:64f73ad5f746e1bd909416ed71c5d5e37f95788cc3d062d33a40bec936dff02d","observation_id":"e7ff2c4b-6a7e-4a70-a0bc-1de1c4fcf400","resolution":{"observed_at":"2026-08-07T00:48:29.843867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.11943","last_updated":"2021-03-22T15:34:39Z","snapshot_observed_at":"2026-08-10T10:17:45.578054Z","submitted_at":"2021-03-22T15:34:39Z","title":"BERT: A Review of Applications in Natural Language Processing and Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.11943","snapshot_observed_at":"2026-08-07T00:48:29.931868Z","title":"Bert: a review of applications in natural language processing and understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:29.931868Z"},"links":{"cited_paper":"/paper/2103.11943","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:354e08ea33ba94f4490f715c27b626844f49dad04410b4f27e8dadc6e4471f2d","observation_id":"757c8926-79bc-4b83-8eef-656cf9bd9112","resolution":{"observed_at":"2026-08-07T00:48:29.931868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T00:48:30.085311Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.085311Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:ae0a7112c68b96fcd2a46bc13f1547cb3ee400e49580646a971accc11296b4ad","observation_id":"f45a04d0-49c7-4083-9a7b-458e621671fc","resolution":{"observed_at":"2026-08-07T00:48:30.085311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16790","last_updated":"2024-04-25T17:39:35Z","snapshot_observed_at":"2026-08-13T00:22:04.524738Z","submitted_at":"2024-04-25T17:39:35Z","title":"SEED-Bench-2-Plus: Benchmarking Multimodal Large Language Models with Text-Rich Visual Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16790","snapshot_observed_at":"2026-08-07T00:48:30.185030Z","title":"Seed-bench-2-plus: Benchmarking multimodal large language models with text-rich visual comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.185030Z"},"links":{"cited_paper":"/paper/2404.16790","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:0a1b897978fdc607da307d137e310426f0051cbf0a496535d306857c50947b09","observation_id":"d0599d4f-1320-4427-957d-93ceb82ad4d3","resolution":{"observed_at":"2026-08-07T00:48:30.185030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-07T00:48:30.316110Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.316110Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:dc3fbaba5c8a6c6847af6e206489be077622b1aa162dd3cc6943399d8f554c46","observation_id":"ecc99e65-9cfe-4be9-8062-c03588f67105","resolution":{"observed_at":"2026-08-07T00:48:30.316110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-08-12T23:30:17.473787Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-08-07T00:48:30.416053Z","title":"Tokenpacker: Efficient visual projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.416053Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b1fd60b59be0120a9367646b542836b8c84759829d9e8b0f85acb94d8ba490a9","observation_id":"4294a87b-37ca-4dd7-8684-3793d217ceef","resolution":{"observed_at":"2026-08-07T00:48:30.416053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-07T00:48:30.535552Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.535552Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:424ba12342d06f40d263f778e17b0d979bb3f535c38d60cf7d9079437bd37844","observation_id":"c8e8a796-7b0c-4d36-bc25-67623a38812a","resolution":{"observed_at":"2026-08-07T00:48:30.535552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-07T00:48:30.624519Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.624519Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:0defa29b005e32b2b5d60000c84f8ce6efc5b4f313dd5e4e4825d60059332175","observation_id":"4544fb5c-1eb9-4760-9932-a995bd17dc91","resolution":{"observed_at":"2026-08-07T00:48:30.624519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:30.741494Z","title":"Monkey: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.741494Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:aaf1c7cf2fffca25162f9cd4f63f03108bd57cdd8de003228c22f03b35ef29cb","observation_id":"d39cb784-ac20-49f6-858e-3926719fd61f","resolution":{"observed_at":"2026-08-07T00:48:30.741494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-08-11T01:59:38.596539Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-07T00:48:30.849435Z","title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.849435Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:db2516ccaaabcef0acae50d5125ee1c300e167eca9125d887300783904d76d16","observation_id":"bf36f4bd-1fae-47c5-85ba-3a755db47a5a","resolution":{"observed_at":"2026-08-07T00:48:30.849435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:30.977433Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:30.977433Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:7ac693361668aded4037885de7623b9fbb319d0ff800c763c715e5fadd4efbd6","observation_id":"316f67e6-7fba-4b5e-84ee-da9e18e278e2","resolution":{"observed_at":"2026-08-07T00:48:30.977433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:37.048091Z","title":"LLaV A-NeXT: Improved reasoning, ocr, and world knowledge.https://llava-vl.github.io/blog/ 2024-01-30-llava-next/","venue":null,"work_id":"2a5a0d57-194d-46f5-8004-527c9c3d36ab","year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.082464Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5998c95d85bfe62e343b2d0f1bb69be62034b2b9b85297aed5c4c761a5962daf","observation_id":"c7c5f576-1235-4f76-ae9b-4cc6d7c4d51b","resolution":{"observed_at":"2026-08-07T00:48:37.142439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.182343Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.182343Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5a64a81275e128d1e46be13fe97b2983508e23a17a22487bff1086db71ca0d65","observation_id":"50640e39-879f-48dd-9f2f-013a9676da49","resolution":{"observed_at":"2026-08-07T00:48:31.182343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.252154Z","title":"Mmbench: Is your multi-modal model an all-around player? In European conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.252154Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:1cd7445ca994abdcce0f72aa31e1d3ee49063ff080c99841383cce83ec969dc8","observation_id":"ef186e24-61e5-41cf-bf81-fda06bac4f5c","resolution":{"observed_at":"2026-08-07T00:48:31.252154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.366111Z","title":"Ocrbench: on the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.366111Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b2de6e92473b48403062711f6209f7e4870322f9399d7719fbaaf54a44cf37bc","observation_id":"7f8843cc-3055-4ec6-9c48-159ad1fb97a6","resolution":{"observed_at":"2026-08-07T00:48:31.366111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-07T00:48:31.424586Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.424586Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:609e0f698d4dcae3cc5d37a1373d7ba5232a06b5f08fc028e064ee0d974ffe0e","observation_id":"e39b5d73-5718-41e6-9886-f2394b594b86","resolution":{"observed_at":"2026-08-07T00:48:31.424586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T00:48:31.521261Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.521261Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:5464ef9daedcceeba36b04f76bbf8dbd2bb957376f593236550e5f1e00507d17","observation_id":"a607c0fa-11a5-46ca-8516-3e96c1384d3a","resolution":{"observed_at":"2026-08-07T00:48:31.521261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-07T00:48:31.608767Z","title":"Mathvista: Evaluating mathematical reasoning of foundation models in visual contexts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.608767Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:aa76f286a6b3e1ba5ce40de8ea3412a11ebe5fab117bdc678617ac007f037287","observation_id":"5fb20c4f-02ed-43fd-a417-9700eb54ee93","resolution":{"observed_at":"2026-08-07T00:48:31.608767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-13T04:03:01.615934Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-07T00:48:31.688789Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.688789Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2264fab1cc53fe038ca27d2225729c6cb9148f0a2c9740b9733221a606bc0728","observation_id":"56555408-5b6c-498d-a63f-ba3f12f10b05","resolution":{"observed_at":"2026-08-07T00:48:31.688789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T00:48:31.784648Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.784648Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:0169e7e33905cd8136bf3562f448f4fed068eebb52b7dd8571b897a556c306a6","observation_id":"888b9194-5eee-423a-a6c0-3abbdc2e8561","resolution":{"observed_at":"2026-08-07T00:48:31.784648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:31.859231Z","title":"Infographicvqa","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.859231Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b3fd9ea23318d791f26ab3b838a02757e5ef847ab4bc55805052abca7f845585","observation_id":"3622c02b-b745-4a0a-84e8-765ad3c35cd1","resolution":{"observed_at":"2026-08-07T00:48:31.859231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.863934Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"5255e2f9-de5e-4360-b4dc-fdd50c6fd694","year":2021},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:31.955507Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2713884baa9362ff832954d5a8a40bd068af53ccae28c80643787be334abc151","observation_id":"f2035eb1-a169-47b4-a1c2-e9e7a65c513c","resolution":{"observed_at":"2026-08-07T00:48:36.930932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.663968Z","title":"Patch n’ pack: Navit, a vision transformer for any aspect ratio and resolution, 2023","venue":null,"work_id":"c3f0bd96-9f84-4cce-8bfb-aa53e8edc41b","year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.047540Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2931339556e8caeb2097cecd3b35b6ba0e52803d5acc1401b3ed90ba66156e4d","observation_id":"6a20a55d-df00-4e28-a867-2b132bc3d205","resolution":{"observed_at":"2026-08-07T00:48:36.759217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.441284Z","title":"Ovo-bench: How far is your video-llms from real-world online video understanding? In Proceedings of the Computer Vision and Pattern Recognition Conference, pages 18902–18913, 2025","venue":null,"work_id":"0bc318d8-45ec-45c5-948b-589a662d9304","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.169757Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:d251cc78302b2d337fef6048cf036dbbd4828aa34d69b232de06e522c5fb00d3","observation_id":"9b0c52fe-66d5-49d3-8796-b11c09c98a05","resolution":{"observed_at":"2026-08-07T00:48:36.557679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.297562Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.297562Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:39b7a2db94eb55a44314a9e77224a8b5ffbcbee4c266a8c7097a351f2072b074","observation_id":"fd369666-9d8e-44d8-a40e-dd555445bd52","resolution":{"observed_at":"2026-08-07T00:48:32.297562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:36.218394Z","title":"When do we not need larger vision models? In European Conference on Computer Vision, pages 444–462","venue":null,"work_id":"ac03867b-40e5-4e19-8558-823c3f8046c9","year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.404618Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:57fa33ae015d407aad710391068f75d74c52d4bf85baa44182c2739f75111971","observation_id":"396cba8e-2143-49c2-a0a5-5cb1159e68b6","resolution":{"observed_at":"2026-08-07T00:48:36.296805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.488516Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.488516Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:95e456d05dd1298ef4620dc869db02e5a8a9d56211aaf9e6ae1ba58f284e89d9","observation_id":"7ebac53f-50e3-4040-a501-c1ec785f2b0b","resolution":{"observed_at":"2026-08-07T00:48:32.488516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.571426Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.571426Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:f7cc2399285e3bd9fd1e1d924da06ed73e69ebf56b2959fb58ffc49f1bc08c81","observation_id":"7f22c7c6-e324-451c-bd75-660a10d00b58","resolution":{"observed_at":"2026-08-07T00:48:32.571426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.667962Z","title":"Internlm: A multilingual language model with progressively enhanced capabilities, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.667962Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:757951cacfa3a37481cb978eb12555b0a233c19e58061dc499e817c6273169ea","observation_id":"26a6e65a-bf4a-4826-8a9c-fafbb8a22589","resolution":{"observed_at":"2026-08-07T00:48:32.667962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-08-09T09:48:45.884814Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T00:48:32.740707Z","title":"Kimi-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.740707Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b10706c8be5ae176605dbcb56a7a5c8f86f95ff44dcbb8a80e09161e6818f122","observation_id":"7d899ee3-e8d1-4120-8aae-aebb65305b14","resolution":{"observed_at":"2026-08-07T00:48:32.740707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:32.855555Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.855555Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:269964371c1c642c1ae6a3ffba1cea76666cd4f279addfc442036a03beaf542f","observation_id":"d2e9f43c-e693-4959-852e-547fcdf21f5a","resolution":{"observed_at":"2026-08-07T00:48:32.855555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T00:48:32.992231Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.992231Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:a42b71352759353b8d8d0d05edeaa2e77753dd6ab170d5c28f2b32e0e4678194","observation_id":"f4b0045e-7682-452e-b341-2d0e1956b838","resolution":{"observed_at":"2026-08-07T00:48:32.992231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T00:48:33.114735Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.114735Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:83c1cb2ba3864664c8d20c15e255d2a3e5b6f09c17ac6ae8cf6b6b3158b00836","observation_id":"2cc87ade-6243-4ef1-8afa-2e443bdfbefc","resolution":{"observed_at":"2026-08-07T00:48:33.114735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:35.997888Z","title":"Divide, conquer and combine: A training-free framework for high-resolution image perception in multimodal large language models","venue":null,"work_id":"1cf911de-6564-43fc-9671-9913d2bac752","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.213010Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:dc7039016fca3f72fc155caac66ed4dbe4a770b744ae9082684ae13ef5c86edb","observation_id":"32f6e633-21d2-455d-a48f-02b01855bc70","resolution":{"observed_at":"2026-08-07T00:48:36.091872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07783","last_updated":"2025-01-14T01:57:41Z","snapshot_observed_at":"2026-08-13T12:18:56.180630Z","submitted_at":"2025-01-14T01:57:41Z","title":"Parameter-Inverted Image Pyramid Networks for Visual Perception and Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07783","snapshot_observed_at":"2026-08-07T00:48:33.338434Z","title":"Parameter-inverted image pyramid networks for visual perception and multimodal understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.338434Z"},"links":{"cited_paper":"/paper/2501.07783","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:3f9f2becc83a9520e3ec1cf46e557815c00b494a26d3051f530f5a2b72fb65b6","observation_id":"3b412e13-b0c9-482f-9f09-a2dae75db265","resolution":{"observed_at":"2026-08-07T00:48:33.338434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-07T00:48:33.446924Z","title":"Deepseek-vl2: Mixture-of-experts vision-language models for advanced multimodal understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.446924Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:de81987fc8bc11fdcb1a1c0b3075561894f7ea19e9da9b2992dc4637973a9460","observation_id":"e80137b3-24e5-4535-8511-8cd6d336417a","resolution":{"observed_at":"2026-08-07T00:48:33.446924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T00:48:33.535196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.535196Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:ae9d3fe592a4f979e945e21ebe638b0651d529c1594e3d0f9ddd1c1e0358dcce","observation_id":"1b8db740-51b7-4499-9a91-3e129af10f55","resolution":{"observed_at":"2026-08-07T00:48:33.535196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05126","last_updated":"2023-10-08T11:33:09Z","snapshot_observed_at":"2026-08-13T05:54:33.801989Z","submitted_at":"2023-10-08T11:33:09Z","title":"UReader: Universal OCR-free Visually-situated Language Understanding with Multimodal Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05126","snapshot_observed_at":"2026-08-07T00:48:33.654963Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.654963Z"},"links":{"cited_paper":"/paper/2310.05126","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:b9c4bd62e8a6a4bf7cfd68eefd901a4619411221518accc13acdee77407f4d43","observation_id":"5a2db8e0-340b-4ab7-b439-f2c2c86854f8","resolution":{"observed_at":"2026-08-07T00:48:33.654963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.02490","last_updated":"2024-12-01T05:46:03Z","snapshot_observed_at":"2026-08-08T03:31:37.699253Z","submitted_at":"2023-08-04T17:59:47Z","title":"MM-Vet: Evaluating Large Multimodal Models for Integrated Capabilities","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.02490","snapshot_observed_at":"2026-08-07T00:48:33.765571Z","title":"Mm-vet: Evaluating large multimodal models for integrated capabilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.765571Z"},"links":{"cited_paper":"/paper/2308.02490","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:259624bc7fb643ff8083a031691a3693e9ef4d0fbcf1d99660341b8fd7da92a2","observation_id":"94d73980-c679-4485-84c2-0af603b7dc22","resolution":{"observed_at":"2026-08-07T00:48:33.765571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09204","last_updated":"2024-04-14T09:48:37Z","snapshot_observed_at":"2026-08-13T00:30:34.672063Z","submitted_at":"2024-04-14T09:48:37Z","title":"TextHawk: Exploring Efficient Fine-Grained Perception of Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09204","snapshot_observed_at":"2026-08-07T00:48:33.913826Z","title":"Texthawk: Exploring efficient fine-grained perception of multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:33.913826Z"},"links":{"cited_paper":"/paper/2404.09204","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:7d79eea852e517a6775fb3f09fdb1dc96110bb42944a22d250257910ac23fdf9","observation_id":"bd675666-0726-40a7-ada7-dcd14b2e0ccb","resolution":{"observed_at":"2026-08-07T00:48:33.913826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:34.049608Z","title":"Sigmoid loss for language image pre-training, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.049608Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:a3f307cf30d57bfa389e8b77f5e15957158024faa8328897b8ce15ec65958722","observation_id":"727ce860-a44f-441f-8fed-e0382e7af1ba","resolution":{"observed_at":"2026-08-07T00:48:34.049608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09596","last_updated":"2024-12-12T18:58:30Z","snapshot_observed_at":"2026-08-12T23:49:37.475723Z","submitted_at":"2024-12-12T18:58:30Z","title":"InternLM-XComposer2.5-OmniLive: A Comprehensive Multimodal System for Long-term Streaming Video and Audio Interactions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09596","snapshot_observed_at":"2026-08-07T00:48:34.167998Z","title":"Internlm-xcomposer2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.167998Z"},"links":{"cited_paper":"/paper/2412.09596","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:bce3466890515ee1c9f5764919702aa1438ceb57924e918bb6f9de26aee8aa45","observation_id":"4cef6c13-6340-4263-8359-99ce2afbf1c6","resolution":{"observed_at":"2026-08-07T00:48:34.167998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-12T23:44:15.418450Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-07T00:48:34.329669Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.329669Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:3f21cfacc385a38719d0c2484fae951896685325d1b30c4d364c6786fd2db41e","observation_id":"309da78b-8d1e-4153-836e-aa64ee4ed65e","resolution":{"observed_at":"2026-08-07T00:48:34.329669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13871","last_updated":"2025-03-19T10:04:22Z","snapshot_observed_at":"2026-08-11T14:38:15.849933Z","submitted_at":"2024-12-18T14:07:46Z","title":"LLaVA-UHD v2: an MLLM Integrating High-Resolution Semantic Pyramid via Hierarchical Window Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13871","snapshot_observed_at":"2026-08-07T00:48:34.447271Z","title":"Llava-uhd v2: an mllm integrating high-resolution feature pyramid via hierarchical window transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.447271Z"},"links":{"cited_paper":"/paper/2412.13871","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:2a1e88ebdd6a466bd7d7b08900871d34c8085d138ec92e900e52995e13abd51c","observation_id":"3d866024-da5b-4073-b695-8bf8b0b3a9ae","resolution":{"observed_at":"2026-08-07T00:48:34.447271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17770","last_updated":"2024-06-27T02:12:28Z","snapshot_observed_at":"2026-08-12T23:35:03.537843Z","submitted_at":"2024-06-25T17:55:11Z","title":"MG-LLaVA: Towards Multi-Granularity Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17770","snapshot_observed_at":"2026-08-07T00:48:34.538261Z","title":"Mg-llava: Towards multi-granularity visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.538261Z"},"links":{"cited_paper":"/paper/2406.17770","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:4d22dc430a99c3f191d11bb2085df8dc9c7dabc439fd2d45e34fee25a9a509b0","observation_id":"80f41d3b-5c2a-4624-901b-1e90b1c58f28","resolution":{"observed_at":"2026-08-07T00:48:34.538261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:35.771119Z","title":"Swift: a scalable lightweight infrastructure for fine-tuning","venue":null,"work_id":"3dacbede-3704-437a-9079-d94cdfe3a77b","year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.646887Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:074dbb19c26613d29a54fe0c277176736a0fce0dfb1793b9bcda5a30489cf9a5","observation_id":"ebd9d7f2-d8c0-4b09-95a8-8012cb60fa00","resolution":{"observed_at":"2026-08-07T00:48:35.879362Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T00:48:34.833805Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models.arXiv preprint arXiv:2403.13372, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.833805Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:44887a9146e1f5d08cf2b572cbee3fc4a4817a919dafe8e0c51b7783e3a13c27","observation_id":"d7e63517-4296-4df2-99a0-37102c2a6997","resolution":{"observed_at":"2026-08-07T00:48:34.833805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T00:48:34.911797Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:34.911797Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:192d0a6a878133cfc4160b3dba2d6b62d69c50cdc25e65e9ace9668add7c9365","observation_id":"fce9c156-8fc7-47df-8f60-e76731845313","resolution":{"observed_at":"2026-08-07T00:48:34.911797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:48:35.559123Z","title":"$” or measurement units such as “cm","venue":null,"work_id":"6691cca6-f586-43bc-ba04-4e2e2a6f3773","year":2006},"citing_paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:35.027792Z"},"links":{"citing_paper":"/paper/2506.12776"},"observation_digest":"sha256:aa57c65b98da3770d989628488d69736ea7cc7ef95264b2a40f3dae5827d541d","observation_id":"7a882fd8-dd3a-4dfc-ba9a-baa3e1f05b5f","resolution":{"observed_at":"2026-08-07T00:48:35.630405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.12776","last_updated":"2025-06-15T08:58:09Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T10:18:08.457959Z","submitted_at":"2025-06-15T08:58:09Z","title":"Native Visual Understanding: Resolving Resolution Dilemmas in Vision-Language Models"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":53,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 3 inbound Pith citation observations for arXiv:2506.12776."}