{"as_of":"2026-08-20T01:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:eac1ce29b23249b15ffa0c759e3ff4a955399dfb082a8a5a799ea85cfc301954","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T13:38:18.919283Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T23:09:32.594194Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T23:14:01.665133Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"cited_work":{"arxiv_id":"2501.16297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16297","snapshot_observed_at":"2026-06-29T23:14:01.665133Z","title":"Fal- con: Resolving visual redundancy and fragmentation in high-resolution multimodal large language models via visual registers","venue":null,"work_id":"5bf9f96f-4554-4d68-9347-6ea2a87a3960","year":2025},"citing_paper":{"arxiv_id":"2507.23372","last_updated":"2026-05-22T03:38:02Z","snapshot_observed_at":"2026-08-14T08:29:40.209724Z","submitted_at":"2025-07-31T09:39:27Z","title":"UniEmo: Unifying Emotional Understanding and Generation with Learnable Expert Queries","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-25T08:14:28.540629Z"},"links":{"cited_paper":"/paper/2501.16297","citing_paper":"/paper/2507.23372"},"observation_digest":"sha256:3f1ed55433b53c6961f52941b06703977c65528256de68418ec426aa403468ad","observation_id":"1e720cc7-46b5-45e6-8500-60bd9775742e","resolution":{"observed_at":"2026-05-25T08:15:33.790283Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"cited_work":{"arxiv_id":"2501.16297","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16297","snapshot_observed_at":"2026-06-29T23:14:01.665133Z","title":"Fal- con: Resolving visual redundancy and fragmentation in high-resolution multimodal large language models via visual registers","venue":null,"work_id":"5bf9f96f-4554-4d68-9347-6ea2a87a3960","year":2025},"citing_paper":{"arxiv_id":"2605.25820","last_updated":"2026-06-10T03:38:23Z","snapshot_observed_at":"2026-08-15T23:25:26.805112Z","submitted_at":"2026-05-25T13:16:51Z","title":"Visual-Redundancy-Controlled Parallel Decoding for Diffusion-Based Multimodal Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-29T23:09:32.594194Z"},"links":{"cited_paper":"/paper/2501.16297","citing_paper":"/paper/2605.25820"},"observation_digest":"sha256:c9690341ab44b184d524b338db9b585f0592cb932c8e36e06799c68b8d5239fa","observation_id":"308599d9-d0d2-4720-a799-43695fdad954","resolution":{"observed_at":"2026-06-29T23:14:01.667217Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16297/citation-record","integrity":"/paper/2501.16297/integrity","json":"/paper/2501.16297/citation-record.json","paper":"/paper/2501.16297"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-10T13:38:18.660902Z","title":"Qwen-vl: A versatile vision-language model for un- derstanding, localization, text reading, and beyond","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.660902Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:9c44a4067d1c3333f53416a7f0f75a86e521c6ac7216db6f913d97b9f6a1c2e7","observation_id":"9cecb0cd-669b-499c-b5d1-611b54e4602a","resolution":{"observed_at":"2026-08-10T13:38:18.660902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.646517Z","title":"Lion: Empowering multimodal large language model with dual-level visual knowledge","venue":null,"work_id":"30217902-57cb-420b-b5da-c141615bc541","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.665980Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:8566aa6d79b86cda10cdc6043d88882ddafc3dbcd2651f2f3014fc45723e6e3a","observation_id":"2930fe71-38c5-4dd1-96c0-cf4eb91f3fa8","resolution":{"observed_at":"2026-08-10T13:38:19.650731Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.635031Z","title":"Less is more: Empowering gui agent with context- aware simplification","venue":null,"work_id":"7c1d3f0a-e614-41c6-9b2d-9975ffcc9ab0","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.670578Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:258e8c5608901c3dcbf840d49c65152185ac76f5fa1334b0f0939ff8c0f2336c","observation_id":"00b8b4a7-9f6e-4a5b-9383-1862af359e04","resolution":{"observed_at":"2026-08-10T13:38:19.639220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-17T13:04:04.064087Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-10T13:38:18.674964Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.674964Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:58ed138c343d45ad8ef37a7cedf61d959ff8a43a21b9bc8cd1c5e3615fa9cd6c","observation_id":"06f4e848-242b-4446-baae-33a9dde9139b","resolution":{"observed_at":"2026-08-10T13:38:18.674964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.624224Z","title":"Spa-bench: A comprehensive benchmark for smartphone agent evalua- tion","venue":null,"work_id":"37ac6c2b-2f76-42e4-9a39-acf3b44e5ca9","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.679118Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:a94582f6aabf634217e76fe70c40dc17edbe4db39164fcbcfd7d2e27e8db5ac0","observation_id":"48e9b2e3-80b4-4576-bacf-75157864c99b","resolution":{"observed_at":"2026-08-10T13:38:19.628063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.683251Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.683251Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:2aeb2bf1441a75a4fa036d418f7b2a34e7663943d197c428eb00965c77c5e328","observation_id":"4a044303-7ddb-4633-a91d-549cd3158b58","resolution":{"observed_at":"2026-08-10T13:38:18.683251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.606452Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"f60b16ee-a4a2-47bd-b381-019eed43b468","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.687230Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:55a5734dd3e0982273cb94cf219e42865cb57b2519cd76d10bdc6b8136419acf","observation_id":"189dacbe-1e7a-47f2-b301-7d58e427a451","resolution":{"observed_at":"2026-08-10T13:38:19.610545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.692030Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.692030Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:bb19e996875dd124b3dae925f10909cd250761dccd43dd9fce9227f52098e920","observation_id":"f4d8f2bb-447e-48e7-b1a4-6d90bfe78e25","resolution":{"observed_at":"2026-08-10T13:38:18.692030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.588048Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"08a1f115-cbd5-4e3d-bc57-58d1e5d1d70a","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.696051Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:9c48c0ec5a20b23b22de3ecb292ba3a9442748d58238a78df2259007f804f8a4","observation_id":"86a2d164-30f3-4be8-878c-2ed042bca62e","resolution":{"observed_at":"2026-08-10T13:38:19.592111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.576827Z","title":"Vision transformers need registers","venue":null,"work_id":"dcface91-c7bb-4e7a-8164-68635d9a94cb","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.699899Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:9a064fddf75d73e07ea1b64f4753f6c14bc908ce33703d2bcc75c0ec5a6e6099","observation_id":"54b7c54b-407f-42a3-a4d7-cae40c478b81","resolution":{"observed_at":"2026-08-10T13:38:19.580813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.703723Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.703723Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:7ef22e3f1b7b08e2e6af5aeb5f86b69a3c50f582251fa8f8f37a48bdb461dc99","observation_id":"b05491e6-12f0-4fae-b022-4e138d0b0fde","resolution":{"observed_at":"2026-08-10T13:38:18.703723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T13:38:18.707825Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.707825Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:f26506d2a6c9be4d273d2173535f8252128ad8d980846c7eb2b1e7db9b7c41d6","observation_id":"86885e08-9b0e-4839-b105-0bd5e9780b93","resolution":{"observed_at":"2026-08-10T13:38:18.707825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-10T13:38:18.711903Z","title":"Bridging nonlinearities and stochastic regularizers with gaussian error linear units","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.711903Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:b98f2886ec0ae4b3394b8cce52c040f54d9bd45e7b2a0bcaf97ca2c543a70f10","observation_id":"f0b27731-56bc-4aa2-b96c-c85fdb6faf2f","resolution":{"observed_at":"2026-08-10T13:38:18.711903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-18T00:01:15.410179Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.16500","snapshot_observed_at":"2026-08-10T13:38:18.716137Z","title":"Cogvlm2: Visual language mod- els for image and video understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.716137Z"},"links":{"cited_paper":"/paper/2408.16500","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:0d22b2fb2a71ff719aa5fb43a1a0a03230e38dec1d8d37b4462c103b256f5d12","observation_id":"ac01ab06-dbdb-4897-a3e3-12b933609d0d","resolution":{"observed_at":"2026-08-10T13:38:18.716137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.558898Z","title":"mplug-docowl 1.5: Unified structure learning for ocr-free document understanding","venue":null,"work_id":"a1748172-a958-4362-8ffe-ab826b1937ee","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.720321Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:34df8f8f44e50c84539cc6741c1fab8c86def12e4e6ea4184364f4937f2f8131","observation_id":"33395e58-9e1a-40ff-842f-eee1d6082bc2","resolution":{"observed_at":"2026-08-10T13:38:19.563433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.548132Z","title":"Mini-monkey: Alleviating the semantic saw- tooth effect for lightweight MLLMs via complementary im- age pyramid","venue":null,"work_id":"086830f7-3463-4c90-b133-e5ccf82e2fac","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.724048Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:e867f4a67af9a2506da238ea472b520669e7fa595037e122924be411259dd1ba","observation_id":"905014d2-2ac6-4584-bced-f09eaa7de993","resolution":{"observed_at":"2026-08-10T13:38:19.551976Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.537538Z","title":"Hires-llava: Restoring fragmen- tation input in high-resolution large vision-language models","venue":null,"work_id":"25304c71-b74a-4863-a780-447bc2dfc999","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.727665Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:07599500a4ef88d49d63d8a11da043139639315a48fd2bda76f5382acde3b2d7","observation_id":"156e88a4-8f94-4638-83c2-989d28bd2371","resolution":{"observed_at":"2026-08-10T13:38:19.541358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.526601Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":"c0ad9e9a-e681-4fe4-bdb5-651a08853232","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.731361Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:3b8547b3ebc6d870dec5711e739be64f3adb2333ed8242c06a50449bbc617092","observation_id":"6493d439-31b1-4e22-815a-5bd29d58c30c","resolution":{"observed_at":"2026-08-10T13:38:19.530445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-10T13:38:18.735094Z","title":"Seed-bench: Benchmarking mul- timodal llms with generative comprehension","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.735094Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:9fd1dd138c4fb540efd029d5287eb6567c58e78d74827ac65fb5ad85cc59fe26","observation_id":"057861c3-7ed6-4acb-943c-0fc7d84e2852","resolution":{"observed_at":"2026-08-10T13:38:18.735094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.739410Z","title":"LLaV A-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.739410Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:3e1e3a3a9348d2f59c2bcf71b8d11b1e6aee6aa8a0a662f53103ad920eb37084","observation_id":"01559c1a-9d54-4159-b24d-a22c4e2cb7e2","resolution":{"observed_at":"2026-08-10T13:38:18.739410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.509808Z","title":"STAR: Learning diverse robot skill abstractions through rotation-augmented vector quan- tization","venue":null,"work_id":"26d9a85d-088f-4dda-b8a5-9573d03f6f38","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.743525Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:e4d7fbc777368e74ba83cb6c4057f3b6177c0387db85c09c31b15a3e1b01357d","observation_id":"dbaafdc9-d0bb-4a5c-8a55-5eb8ee60a24b","resolution":{"observed_at":"2026-08-10T13:38:19.513557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.498096Z","title":"Blip-2: Bootstrapping language-image pre-training with 11 frozen image encoders and large language models","venue":null,"work_id":"f8c25529-13d3-4e90-81a4-cfc2b73659c1","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.747331Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:2d7e677ca062c013ae06a1d27fa46eae01b0cfc38716b97c2e66c8ce6ff9352d","observation_id":"9773fdbd-b6ca-4420-b586-1ed3a5cdc433","resolution":{"observed_at":"2026-08-10T13:38:19.502224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.487288Z","title":"Flex- attention for efficient high-resolution vision-language mod- els","venue":null,"work_id":"7004598f-4e8c-4b10-bff6-256c76e6fc32","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.751038Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:4e59ba8d54d561bd84859a1b1f5ee4d1902af762583aaa3c02b8b7975cac4844","observation_id":"05ab51b1-b59b-4d17-88f1-e36a767cf6f2","resolution":{"observed_at":"2026-08-10T13:38:19.491062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.476464Z","title":"Lion-fs: Fast & slow video-language thinker as online video assistant","venue":null,"work_id":"f5e3fe77-c204-4d63-a635-4886152a6a04","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.754766Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:70537e7c7a998222cbddcb3322efc8364586582c2a1c3427f88046b509492fa1","observation_id":"3898cb60-9eb4-4ae8-ba70-2caf4890a0de","resolution":{"observed_at":"2026-08-10T13:38:19.480351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.758353Z","title":"Evaluating object hallucination in large vision-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.758353Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:ab5fc6af4e7255c1efe5aa0873dd2dd3086d33120e969f226e4763faaa26838a","observation_id":"92305da7-4122-4711-a3e1-2bb26cb96def","resolution":{"observed_at":"2026-08-10T13:38:18.758353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18814","snapshot_observed_at":"2026-08-10T13:38:18.761893Z","title":"Mini-gemini: Mining the potential of multi-modality vision language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.761893Z"},"links":{"cited_paper":"/paper/2403.18814","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:fb3b3a690b6deb5f9cab977422636e5bfcdef6182690003c479114b1ec7a5a98","observation_id":"a1862721-228f-481c-a619-8369a8c60462","resolution":{"observed_at":"2026-08-10T13:38:18.761893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.459642Z","title":"Optimus-1: Hybrid multimodal memory empowered agents excel in long-horizon tasks","venue":null,"work_id":"e909e531-8a02-453a-93bd-d1274c465d93","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.766280Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:eba32ecbb919869e417afbc33164a0eceb948e292d17d55dd315a1642a73fc5f","observation_id":"aa7da1ae-4093-4815-88dc-9d1598f5cd82","resolution":{"observed_at":"2026-08-10T13:38:19.463546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.448415Z","title":"Mon- key: Image resolution and text label are important things for large multi-modal models","venue":null,"work_id":"79f1564c-7d93-4744-bdb1-284411d3f48c","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.770199Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:4d7a261d1e4abc18dbc3f7f8976904d5897414a347a732ce23e3d180f3a5eafc","observation_id":"0aa62c3a-5c79-47be-b161-5eb2c705ed67","resolution":{"observed_at":"2026-08-10T13:38:19.452524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.437797Z","title":"Optimus-2: Multimodal minecraft agent with goal-observation-action conditioned policy","venue":null,"work_id":"222e3392-e6a6-46ab-8d6a-73c8a843d5c5","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.773810Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:39c55fa17c744cc63cdfd52b8a481e6a7e8caa450862d38df1e2eab72ad4369c","observation_id":"75e8e79f-8633-4bed-bfe3-4ff0824dd92f","resolution":{"observed_at":"2026-08-10T13:38:19.441573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.426822Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"9148dd45-a6e6-4309-a2f7-3a999d2709a7","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.777251Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:503e8351ee5866d06c72a9db982beed8babeff6a816ee3b5bc9fe687d445c50f","observation_id":"aeb7aca1-8e46-4cf1-bbf9-a55e1f82e333","resolution":{"observed_at":"2026-08-10T13:38:19.430737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.780931Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.780931Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:9b259e766e8578ed39ec0ecb21e681fc07a341837cdf2aef48dba1e7516f214c","observation_id":"94754f3a-0b0a-49e2-ab02-bb33b379258c","resolution":{"observed_at":"2026-08-10T13:38:18.780931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.784750Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.784750Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:4103e411cfdf7b3cb38ede6e3a7f59f63de220ddc4a761b06bef1eca008e9d66","observation_id":"403f895a-a8e2-4982-b704-cf18734199f1","resolution":{"observed_at":"2026-08-10T13:38:18.784750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04473","last_updated":"2024-03-15T06:51:30Z","snapshot_observed_at":"2026-08-19T13:06:25.132325Z","submitted_at":"2024-03-07T13:16:24Z","title":"TextMonkey: An OCR-Free Large Multimodal Model for Understanding Document","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04473","snapshot_observed_at":"2026-08-10T13:38:18.788312Z","title":"Textmonkey: An ocr-free large multimodal model for understanding document","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.788312Z"},"links":{"cited_paper":"/paper/2403.04473","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:58a827e5c855669b580af6edbc21d78831e1c00450eb1fd2b03e414d9bd5b576","observation_id":"c8afdfd2-f1ab-45df-81a9-258884492a40","resolution":{"observed_at":"2026-08-10T13:38:18.788312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.792560Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.792560Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:77c721dd3dcc8dc9ca95707685fa52f81614e4bd8b4557f023497a183d0d67e9","observation_id":"99251e67-9df0-41a4-970d-90e9a6a68bf0","resolution":{"observed_at":"2026-08-10T13:38:18.792560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.796210Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.796210Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:c8cf2c939384d0301fdb6072c45f401a1603061e574ee780e1260fb6b4d36fb8","observation_id":"718f2c8d-4842-4d67-9520-ebb223d1e3b8","resolution":{"observed_at":"2026-08-10T13:38:18.796210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-19T16:22:29.898436Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-10T13:38:18.800215Z","title":"Deepseek-vl: towards real-world vision- language understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.800215Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:c31f33375623f67456ed4dfd97696e8486de45b215dff91e94e1392e78917684","observation_id":"80466512-1ad5-4253-a94a-96d2ca4629bb","resolution":{"observed_at":"2026-08-10T13:38:18.800215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.390897Z","title":"Learn to explain: Multimodal reasoning via thought chains for science question answering","venue":null,"work_id":"4732a44a-d3cb-4800-a176-5733490f812c","year":2022},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.804301Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:b4336cfc0cc5d26d6495f1fbce6add03aaa9dc9b9cc91fa157dce94d0328ddf8","observation_id":"b5245f0b-10fa-4f44-b04f-5b197bbd3d48","resolution":{"observed_at":"2026-08-10T13:38:19.394658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-16T14:12:38.033838Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-10T13:38:18.807983Z","title":"Feast your eyes: Mixture-of- resolution adaptation for multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.807983Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:48b4ba238f101febfcd3a65ae6e9923e301b5014fdb71ab6fb975a75b284a7ae","observation_id":"5c6f3f2f-88ce-4b28-aa9a-a977052721d7","resolution":{"observed_at":"2026-08-10T13:38:18.807983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.379722Z","title":"Spatial-temporal graph diffusion policy with kinematic mod- eling for bimanual robotic manipulation","venue":null,"work_id":"74af3a67-1412-4c31-b5be-2d00521c0e5a","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.812074Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:2ccd06506985164e8621094d96f565fa5bded8b6b9e43a87ab79dc2a7da0f18f","observation_id":"4dfc0037-2743-484f-bd91-0de059dd5dd2","resolution":{"observed_at":"2026-08-10T13:38:19.383566Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.368402Z","title":"Chartqa: A benchmark for question an- swering about charts with visual and logical reasoning","venue":null,"work_id":"a0bcf99e-8078-44a9-b5ff-67732da460ce","year":2022},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.816038Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:015f06069374f3ed9663be57bb8236d8507af3561de628331cd7d10c72144d10","observation_id":"b58f3cd1-f15f-4198-b84a-0ab867f706a4","resolution":{"observed_at":"2026-08-10T13:38:19.372698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.356953Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":"808c8588-fa21-466b-b9b8-8a9fbb0bf5d6","year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.819840Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:2e1b5d546d6c9e35e19629136d64f5a7c586efd3ab95dd526cf01741d6adaa04","observation_id":"fcf03e1a-d56a-426f-878e-f1710aed48e2","resolution":{"observed_at":"2026-08-10T13:38:19.361057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.823527Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.823527Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:43cbb42c125bd68eb5acf599fada738cadc372bde3ddf908470048357aa74abe","observation_id":"2223dd60-7822-4ab6-8de0-6f1d3d81404e","resolution":{"observed_at":"2026-08-10T13:38:18.823527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.827229Z","title":"Multi-adversarial discriminative deep domain generalization for face presentation attack detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.827229Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:6b880bdd314c2c3732147859534055e2be01589b2db3bdf9f01a7919d4673ad2","observation_id":"68d28a54-be9a-4828-b622-3bef84431d87","resolution":{"observed_at":"2026-08-10T13:38:18.827229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.334063Z","title":"Detecting and grounding multi-modal media manipulation","venue":null,"work_id":"816f5ae8-5048-497a-be47-64753b1d6e8a","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.831549Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:294b9e7e153e8c716d5e32127e211f3dcb6f7d5c21385af4d6eccdf9ee70a566","observation_id":"5682eb4d-25ed-4d0c-909a-1a2eb617661c","resolution":{"observed_at":"2026-08-10T13:38:19.337795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.322945Z","title":"Detecting and grounding multi-modal media manip- ulation and beyond","venue":null,"work_id":"dca129c4-f935-43b2-91d9-54c05dadb59d","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.835497Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:8b47fbffbedb726f8a76c2f301bdcbd5ed53b8618abcbcf40f80b5f566203785","observation_id":"1ee6b5e4-3a72-463e-91df-12ac496afa7a","resolution":{"observed_at":"2026-08-10T13:38:19.327055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.311959Z","title":"Mome: Mixture of multimodal experts for gen- eralist multimodal large language models","venue":null,"work_id":"3bc83225-1ced-4c03-958d-d21c67755b69","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.839306Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:da7bbcbc248e6b89169ec3cfeac1d62233adf3f8b369c38de7de7ee57aa72dcc","observation_id":"302dd13c-0a73-4068-a2b9-490798c2f71d","resolution":{"observed_at":"2026-08-10T13:38:19.315809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.300940Z","title":"When do we not need larger vision models? In 12 European Conference on Computer Vision, pages 444–462,","venue":null,"work_id":"c7d8f9c6-3fce-4b8f-8192-416a0e4a2e3c","year":null},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.843134Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:d886dcfeeff11cc02eb2cf7dbda9054eef6686ea75776e2479f83a1b7dfa68b5","observation_id":"5de446c3-1946-4748-85a2-4b8b58af2f6c","resolution":{"observed_at":"2026-08-10T13:38:19.304740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:18.847335Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.847335Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:226223754b0c0e049f18df6a3c4468f359510b5d0d098f132624cf9419afcc8f","observation_id":"f9db3667-dfaa-4807-a952-860ebba09887","resolution":{"observed_at":"2026-08-10T13:38:18.847335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-10T13:38:18.851125Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.851125Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:0ba733112bec298fb62cde9329a13301142cf3cfb301981e26ea049f48fe2826","observation_id":"36153ffb-5247-473e-a02a-992f25713644","resolution":{"observed_at":"2026-08-10T13:38:18.851125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T13:38:18.855123Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.855123Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:5c5bb2dd12ee096901b3842940aafa688f7d236e47da5b0c6e18508e3c2355bf","observation_id":"279cc74f-b201-40d4-95ba-30f69f6556f0","resolution":{"observed_at":"2026-08-10T13:38:18.855123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T13:38:18.858993Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.858993Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:3c4618ddd520aacef8a00e81ccbb88f99978e103b710d7df9feb996c2030ce8f","observation_id":"41e6be49-fde2-4170-950c-dea735c419e7","resolution":{"observed_at":"2026-08-10T13:38:18.858993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.283392Z","title":"V*: Guided visual search as a core mechanism in multimodal llms","venue":null,"work_id":"277a83ca-1b0d-41d5-bc89-e1b6d96a1325","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.863115Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:f60ed3367efc65018a77301bbe0a6072beef4b90d210e630bf42a347151b3eba","observation_id":"5b9a5693-bae5-4f98-b923-48684cfba1b9","resolution":{"observed_at":"2026-08-10T13:38:19.287477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.272227Z","title":"Gui-explorer: Au- tonomous exploration and mining of transition-aware knowl- edge for gui agent","venue":null,"work_id":"88347bc9-e36c-445a-ab8b-67697782bd76","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.867100Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:84c554e3ee11b7a4c4b39af0972bd791981b059f5666472ffd9c3de80474e579","observation_id":"8caefd48-b66b-45fd-98dc-526a0336d167","resolution":{"observed_at":"2026-08-10T13:38:19.276332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-17T11:43:45.183126Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-10T13:38:18.870758Z","title":"Deco: Decoupling token compres- sion from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.870758Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:8acf58fd7b4cd22e22adf1202b4528b34f7b59846531ad253f2803ea21263f4d","observation_id":"369d4a1a-0c92-4c72-b617-b8716adcf56d","resolution":{"observed_at":"2026-08-10T13:38:18.870758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-10T13:38:18.875541Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.875541Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:c61b4d50f5f0ef4c8a1952921391540307d46d8b8ebc7fe312995a72ed5b7fd8","observation_id":"9bd10117-1474-4938-a48d-c544a1805316","resolution":{"observed_at":"2026-08-10T13:38:18.875541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02499","last_updated":"2023-07-04T11:28:07Z","snapshot_observed_at":"2026-08-18T18:37:49.349707Z","submitted_at":"2023-07-04T11:28:07Z","title":"mPLUG-DocOwl: Modularized Multimodal Large Language Model for Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02499","snapshot_observed_at":"2026-08-10T13:38:18.879391Z","title":"mplug-docowl: Modularized multimodal large language model for document understanding","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.879391Z"},"links":{"cited_paper":"/paper/2307.02499","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:a1b925943285450aeae2011b48514f54d0468dffd2070ee6ea00ff33b28b1678","observation_id":"2e866717-1d12-4ccf-bf1b-c775db334c8d","resolution":{"observed_at":"2026-08-10T13:38:18.879391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.257345Z","title":"Ureader: Universal ocr-free visually-situated language understanding with multimodal large language model","venue":null,"work_id":"b19111e8-3276-430c-be55-235fe8f8763a","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.883290Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:220333d0cad89ecec12e69e28a543a6ea9037fca747c80ee9cb4e4a1f9e70023","observation_id":"57e8c7ba-2775-43f7-8808-f8bb8be2a97e","resolution":{"observed_at":"2026-08-10T13:38:19.264231Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-16T17:13:28.893408Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-10T13:38:18.886964Z","title":"mplug-owl: Modularization empowers large language models with multimodality","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.886964Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:b644b1b6599ec12c94a00f66c1941a1f561f8420d01f7ca7dc28b7cdc625437a","observation_id":"3908d8fc-4886-4a77-916b-13a650794a9b","resolution":{"observed_at":"2026-08-10T13:38:18.886964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.236136Z","title":"mplug-owl2: Revolutionizing multi-modal large language model with modality collaboration","venue":null,"work_id":"beb29cdd-1787-489d-9694-6a07b398a960","year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.891094Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:9ea06d5fa99c374562452bf653fb0b5a672cde845355c4d7e74e3f4bfdeff9c4","observation_id":"d570105d-11f2-4813-bad3-6a832874fa46","resolution":{"observed_at":"2026-08-10T13:38:19.239916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.224464Z","title":"Modeling context in referring expres- sions","venue":null,"work_id":"a6c1b316-c011-4a3e-8504-77872bc6975e","year":2016},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.895145Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:b95cad673a2799972a6a6c99056b1a15e82a7c740150e304e9e92f455a6fe8e8","observation_id":"95e99493-16af-43f9-aacd-7f06afa2fa0d","resolution":{"observed_at":"2026-08-10T13:38:19.228709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.212308Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"a7c3608e-ddd7-46a8-a033-39cc0a21dc6c","year":2023},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.899089Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:fbb023ceeef1c1fb827c41eef25ce4a204897d4e8a22a124797f24ffa03d15c8","observation_id":"288adfb4-a5bb-43f1-96d3-a928edd16fbe","resolution":{"observed_at":"2026-08-10T13:38:19.216519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03320","last_updated":"2024-07-03T17:59:21Z","snapshot_observed_at":"2026-08-14T16:53:05.474750Z","submitted_at":"2024-07-03T17:59:21Z","title":"InternLM-XComposer-2.5: A Versatile Large Vision Language Model Supporting Long-Contextual Input and Output","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03320","snapshot_observed_at":"2026-08-10T13:38:18.903154Z","title":"Internlm-xcomposer-2.5: A versatile large vision language model supporting long-contextual in- put and output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.903154Z"},"links":{"cited_paper":"/paper/2407.03320","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:32c4ab888555b051b2f0b0846093496957b1f717535788fd465471adafbd9f18","observation_id":"7f24491c-e4a3-4866-b6fe-c2441f230af3","resolution":{"observed_at":"2026-08-10T13:38:18.903154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14439","last_updated":"2024-07-19T16:11:15Z","snapshot_observed_at":"2026-08-16T13:32:39.735795Z","submitted_at":"2024-07-19T16:11:15Z","title":"Token-level Correlation-guided Compression for Efficient Multimodal Document Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14439","snapshot_observed_at":"2026-08-10T13:38:18.907427Z","title":"Token-level correlation-guided com- pression for efficient multimodal document understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.907427Z"},"links":{"cited_paper":"/paper/2407.14439","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:7d2d681d21024d75853961cde3110095e52508e359175ea76537c4b30692fbb5","observation_id":"8fbc5767-86a4-45e6-85df-5737da82d995","resolution":{"observed_at":"2026-08-10T13:38:18.907427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.194770Z","title":"From redundancy to relevance: Enhancing explainability in multimodal large language mod- els","venue":null,"work_id":"0eff9add-cc30-4b7b-8bbc-0a1e8c5e0cf7","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.911600Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:46780c438cdb6fb75fd86938ed4325612c849014cd870595531d1930b59a0e22","observation_id":"ac5d1f9d-a70b-4c35-8dde-30a233ecbc2c","resolution":{"observed_at":"2026-08-10T13:38:19.199802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T13:38:19.181397Z","title":null,"venue":null,"work_id":"2d916286-9c62-4ad2-b2b4-09f2e4b973c6","year":2025},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.915446Z"},"links":{"citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:34b23d5d7d67e19b0bef380b3eeb4664d6e6f4424f6e700ef5d9e017fd76d220","observation_id":"5a52d847-6c2a-401f-a6d0-37d6db3f6f4f","resolution":{"observed_at":"2026-08-10T13:38:19.186362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08487","last_updated":"2024-06-14T00:52:35Z","snapshot_observed_at":"2026-08-16T13:43:37.776811Z","submitted_at":"2024-06-12T17:59:49Z","title":"Beyond LLaVA-HD: Diving into High-Resolution Large Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08487","snapshot_observed_at":"2026-08-10T13:38:18.919283Z","title":"Beyond llava-hd: Diving into high-resolution large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-10T13:38:18.919283Z"},"links":{"cited_paper":"/paper/2406.08487","citing_paper":"/paper/2501.16297"},"observation_digest":"sha256:37083169fbf4c72c8be45129f8843f2e690907a35e3d6a55feca50c0670e7923","observation_id":"b382da80-0c94-48de-b22d-f2e8fd4ba5eb","resolution":{"observed_at":"2026-08-10T13:38:18.919283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.16297","last_updated":"2025-06-30T12:24:33Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T03:56:45.966165Z","submitted_at":"2025-01-27T18:36:10Z","title":"FALCON: Resolving Visual Redundancy and Fragmentation in High-resolution Multimodal Large Language Models via Visual Registers"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 2 inbound Pith citation observations for arXiv:2501.16297."}