{"as_of":"2026-08-09T19:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7089f3f2afd6eee0837ba9d205bffc4a1ccbd06588e97f1af37b172529a70995","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:16:36.659461Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24424/citation-record","integrity":"/paper/2607.24424/integrity","json":"/paper/2607.24424/citation-record.json","paper":"/paper/2607.24424"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20688","last_updated":"2025-06-25T03:23:16Z","snapshot_observed_at":"2026-08-09T08:17:06.215899Z","submitted_at":"2025-06-25T03:23:16Z","title":"Building Lightweight Semantic Segmentation Models for Aerial Images Using Dual Relation Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20688","snapshot_observed_at":"2026-07-31T15:16:35.452784Z","title":"Global-local attention network for semantic segmentation in aerial images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.452784Z"},"links":{"cited_paper":"/paper/2506.20688","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:d6f391bfc07d95fd4f05ac667a425582196d056d20479d36a4909639bf53f86b","observation_id":"265850aa-de40-408b-a3a6-99916840bc9e","resolution":{"observed_at":"2026-07-31T15:16:35.452784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:35.666344Z","title":"Yingen Liu, Fan Wu, Ruihui Li, Zhuo Tang, and Kenli Li","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.666344Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:785aab42ba701cd42db084b4a876b5a003a54938ad16473444d69e719e346203","observation_id":"a40eecd5-d6ad-41c4-a083-8102051bed19","resolution":{"observed_at":"2026-07-31T15:16:35.666344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-07-31T15:16:35.713332Z","title":"MMBench: Is your multi-modal model an all-around player?arXiv preprint arXiv:2307.06281, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.713332Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:842e5e857d1719c279057dfc230a4718b183ec67cb12f765e5443e9c1e806645","observation_id":"8d1b3508-6f4c-4e2b-8fb4-820f22c94017","resolution":{"observed_at":"2026-07-31T15:16:35.713332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:35.776370Z","title":"LLM-CoT enhanced graph neural recommendation with harmonized group policy optimization.arXiv preprint arXiv:2505.12396,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.776370Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:517a81923959d1a919795c5f83b61f9b3eb8f114b4a2095f2054866407f315fc","observation_id":"5c263949-b6bc-42f6-ba5f-88e8d9d2d287","resolution":{"observed_at":"2026-07-31T15:16:35.776370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07209","last_updated":"2025-03-10T11:48:26Z","snapshot_observed_at":"2026-08-09T08:18:45.319744Z","submitted_at":"2025-03-10T11:48:26Z","title":"Synthetic Lung X-ray Generation through Cross-Attention and Affinity Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07209","snapshot_observed_at":"2026-07-31T15:16:35.827292Z","title":"Synthetic lung x-ray generation through cross-attention and affinity transformation.arXiv preprint arXiv:2503.07209,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.827292Z"},"links":{"cited_paper":"/paper/2503.07209","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:95024478dc5b6fcea6aba7a9c96d6ad23a12a27a8392cb4df12eb3e5be60d320","observation_id":"076e2494-6d70-4159-b50e-7c46c16574ee","resolution":{"observed_at":"2026-07-31T15:16:35.827292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17916","last_updated":"2024-05-28T07:37:44Z","snapshot_observed_at":"2026-08-09T08:19:09.608459Z","submitted_at":"2024-05-28T07:37:44Z","title":"Boosting General Trimap-free Matting in the Real-World Image","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17916","snapshot_observed_at":"2026-07-31T15:16:35.885573Z","title":"Boosting general trimap-free matting in the real-world image","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.885573Z"},"links":{"cited_paper":"/paper/2405.17916","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:08bddc1521f393d743728f984a6a8ad6686ae9684d6ca0574c8b9a7f6d92ea12","observation_id":"2f5f2ab3-e589-4d00-a86b-9f6df844c650","resolution":{"observed_at":"2026-07-31T15:16:35.885573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18078","last_updated":"2024-05-28T11:39:36Z","snapshot_observed_at":"2026-08-09T08:18:04.730318Z","submitted_at":"2024-05-28T11:39:36Z","title":"Edge-guided and Class-balanced Active Learning for Semantic Segmentation of Aerial Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18078","snapshot_observed_at":"2026-07-31T15:16:35.961854Z","title":"Boosting semantic segmentation of aerial images via decoupled and multilevel compaction and dispersion.IEEE Transactions on Geoscience and Remote Sensing, 61:1–16, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.961854Z"},"links":{"cited_paper":"/paper/2405.18078","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:de75d95789ae11b7758ebecb442b4417fd621f2cc1f612503fe925559de38ac9","observation_id":"2860f3ab-5cea-41f0-840f-f2d73964f7e7","resolution":{"observed_at":"2026-07-31T15:16:35.961854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:36.036325Z","title":"LLaV A-PruMerge: Adaptive token reduction for efficient large multimodal models.arXiv preprint arXiv:2403.15388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.036325Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:65e54d28549491b7e571cbd6cbf18d3ea3253f7b7de5f65b2fd67c34b6a518ea","observation_id":"5b72cc80-e18a-441d-bb84-bd50cac27d7f","resolution":{"observed_at":"2026-07-31T15:16:36.036325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-07-31T15:16:36.166786Z","title":"Qwen2-VL: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.166786Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:8735fe231f3d0f763c05d1d11ccd7393e515da3958f41cfc498e1afd3074e3c2","observation_id":"615aaa49-0563-4914-a4ef-9059c1386717","resolution":{"observed_at":"2026-07-31T15:16:36.166786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.00363","last_updated":"2025-07-01T01:29:31Z","snapshot_observed_at":"2026-08-09T08:18:45.833448Z","submitted_at":"2025-07-01T01:29:31Z","title":"GDGS: 3D Gaussian Splatting Via Geometry-Guided Initialization And Dynamic Density Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.00363","snapshot_observed_at":"2026-07-31T15:16:36.231359Z","title":"GDGS: 3d gaussian splatting via geometry-guided initialization and dynamic density control.arXiv preprint arXiv:2507.00363,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.231359Z"},"links":{"cited_paper":"/paper/2507.00363","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:4880cb25840323cae9ef7e02af17e4ecd90b758b539728496d10a7631f3c81b4","observation_id":"aff33c9b-f53e-4232-b2ac-e8a09bce3b99","resolution":{"observed_at":"2026-07-31T15:16:36.231359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19235","last_updated":"2025-06-24T01:39:34Z","snapshot_observed_at":"2026-08-06T23:04:52.829402Z","submitted_at":"2025-06-24T01:39:34Z","title":"RecLLM-R1: A Two-Stage Training Paradigm with Reinforcement Learning and Chain-of-Thought v1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19235","snapshot_observed_at":"2026-07-31T15:16:36.284072Z","title":"RecLLM-R1: A two-stage training paradigm with reinforcement learning and chain-of-thought.arXiv preprint arXiv:2506.19235,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.284072Z"},"links":{"cited_paper":"/paper/2506.19235","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:e1f616171496c5058600bbd29c73f5daa9ea8d34fea84b998491f450b3bacdd2","observation_id":"256a2bc7-e757-49fd-98e6-8408da8096ee","resolution":{"observed_at":"2026-07-31T15:16:36.284072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.11703","last_updated":"2024-03-18T12:04:11Z","snapshot_observed_at":"2026-08-06T16:32:30.757011Z","submitted_at":"2024-03-18T12:04:11Z","title":"LLaVA-UHD: an LMM Perceiving Any Aspect Ratio and High-Resolution Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.11703","snapshot_observed_at":"2026-07-31T15:16:36.341288Z","title":"LLaV A-UHD: An LMM perceiving any aspect ratio and high-resolution images.arXiv preprint arXiv:2403.11703,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.341288Z"},"links":{"cited_paper":"/paper/2403.11703","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:b0ad42980290c546a8b4ed48c3b22a7192d6203d8b32a56cdde23ca9b9175ae6","observation_id":"c955fe02-0de6-4385-83ac-b075f505bd63","resolution":{"observed_at":"2026-07-31T15:16:36.341288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:36.403095Z","title":"KV-Efficient VLA: A method to speed up vision language models with RNN-gated chunked KV cache.arXiv preprint arXiv:2509.21354,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.403095Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:d63994a13e67e85c8a2347248c11f7d5854e71f058838819789e61fa11ccdb57","observation_id":"7df803d8-1062-441e-9490-50f8a674284e","resolution":{"observed_at":"2026-07-31T15:16:36.403095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.19406","last_updated":"2025-06-24T08:20:08Z","snapshot_observed_at":"2026-08-09T15:42:40.230036Z","submitted_at":"2025-06-24T08:20:08Z","title":"A Global-Local Cross-Attention Network for Ultra-high Resolution Remote Sensing Image Semantic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.19406","snapshot_observed_at":"2026-07-31T15:16:36.496400Z","title":"A global-local cross-attention network for ultra-high resolution remote sensing image semantic segmentation.arXiv preprint arXiv:2506.19406, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.496400Z"},"links":{"cited_paper":"/paper/2506.19406","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:780c8faba2e1ca530f3a3cbbffe53ec6716d263b58b58cfc0322a44012ce1a42","observation_id":"aa5ec07b-db4a-4d1c-b66a-904a0e21d061","resolution":{"observed_at":"2026-07-31T15:16:36.496400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:16:36.589098Z","title":"Asymmetric Mamba–CNN collaborative architecture for large-size remote sensing image semantic segmentation.IEEE Transactions on Geoscience and Remote Sensing, 63:2002419, 2025a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.589098Z"},"links":{"citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:358bd3224515766439dc2ccedb361d5c6f3958f38c71cb0035d397966f2f47bf","observation_id":"b13f99e4-8ea2-4f11-961c-0038e2117e76","resolution":{"observed_at":"2026-07-31T15:16:36.589098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11265","last_updated":"2025-03-14T10:19:24Z","snapshot_observed_at":"2026-08-09T08:18:46.289243Z","submitted_at":"2025-03-14T10:19:24Z","title":"DynRsl-VLM: Enhancing Autonomous Driving Perception with Dynamic Resolution Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11265","snapshot_observed_at":"2026-07-31T15:16:36.659461Z","title":"DynRsl-VLM: Enhancing autonomous driving perception with dynamic resolution vision-language models.arXiv preprint arXiv:2503.11265,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.659461Z"},"links":{"cited_paper":"/paper/2503.11265","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:f6bda70cd55c2b80ff739faa1250fa5a9ae74d282508e4c4292384cdf109f16e","observation_id":"8485d1c8-2336-4c7e-ade7-65d6837eeaea","resolution":{"observed_at":"2026-07-31T15:16:36.659461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20110","last_updated":"2025-07-27T03:11:08Z","snapshot_observed_at":"2026-08-08T23:14:23.198627Z","submitted_at":"2025-07-27T03:11:08Z","title":"NeuroVoxel-LM: Language-Aligned 3D Perception via Dynamic Voxelization and Meta-Embedding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.20110","snapshot_observed_at":"2026-07-31T15:16:35.591649Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.591649Z"},"links":{"cited_paper":"/paper/2507.20110","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:497db4331fc498b6f8bbf77970471a3ac6be2bf134311b6139a681dbac9edf68","observation_id":"a33bd187-fc65-4803-86b4-289a43d4f062","resolution":{"observed_at":"2026-07-31T15:16:35.591649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13306","last_updated":"2025-05-19T16:25:55Z","snapshot_observed_at":"2026-08-09T08:19:07.466456Z","submitted_at":"2025-05-19T16:25:55Z","title":"GMM-Based Comprehensive Feature Extraction and Relative Distance Preservation For Few-Shot Cross-Modal Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13306","snapshot_observed_at":"2026-07-31T15:16:36.098226Z","title":"GMM-based comprehensive feature extraction and relative distance preservation for few-shot cross-modal retrieval.arXiv preprint arXiv:2505.13306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:36.098226Z"},"links":{"cited_paper":"/paper/2505.13306","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:15fd532bd91d6bd9bcb892f988ec59dc5c557fe0b9084cd6f8cb4fedac87c1b5","observation_id":"1504ed36-23b4-4c05-9f33-67006ed22c3b","resolution":{"observed_at":"2026-07-31T15:16:36.098226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-31T15:16:35.257881Z","title":"Transform dual-branch attention net: Efficient semantic segmentation of ultra-high-resolution remote sensing images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.257881Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:a7819bf682f52edc0adbfa0afe4b67ed5ae01f00290b77421208703ba0a2bf07","observation_id":"0c31cf5c-e39d-475f-a4b4-9f95d8461d36","resolution":{"observed_at":"2026-07-31T15:16:35.257881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-31T15:16:35.069570Z","title":"Qwen-VL: A versatile vision-language model for understanding, localization, text reading, and beyond.arXiv preprint arXiv:2308.12966,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.069570Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:7b5d4669fbb21f785d2b77201c43c58b885d224b837cc0d21741689b40525379","observation_id":"f86ea83f-0f57-4ac1-88c1-8fa8535132cb","resolution":{"observed_at":"2026-07-31T15:16:35.069570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17776","last_updated":"2024-05-28T03:12:33Z","snapshot_observed_at":"2026-07-06T18:21:01.419111Z","submitted_at":"2024-05-28T03:12:33Z","title":"The Binary Quantized Neural Network for Dense Prediction via Specially Designed Upsampling and Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17776","snapshot_observed_at":"2026-07-31T15:16:35.157744Z","title":"The binary quantized neural network for dense prediction via specially designed upsampling and attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.157744Z"},"links":{"cited_paper":"/paper/2405.17776","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:bba637512733e74a7ac4d7695023643f17572bab087cde2fec4fb1627ceeba6f","observation_id":"0fca96e3-fc26-49c9-a068-05d487e41777","resolution":{"observed_at":"2026-07-31T15:16:35.157744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-07-31T15:16:35.320995Z","title":"LLaV A-OneVision: Easy visual task transfer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.320995Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:c7fa34be2a2e6f36632d839accbf560558719f2103884f0308c6401ff7f04ff6","observation_id":"37815ebb-7506-4f76-af7f-0b0ad3507636","resolution":{"observed_at":"2026-07-31T15:16:35.320995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.02392","last_updated":"2024-08-28T08:49:57Z","snapshot_observed_at":"2026-07-06T18:40:22.951929Z","submitted_at":"2024-07-02T16:10:55Z","title":"TokenPacker: Efficient Visual Projector for Multimodal LLM","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.02392","snapshot_observed_at":"2026-07-31T15:16:35.532712Z","title":"To- kenPacker: Efficient visual projector for multimodal LLM.arXiv preprint arXiv:2407.02392, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-07-31T15:16:35.532712Z"},"links":{"cited_paper":"/paper/2407.02392","citing_paper":"/paper/2607.24424"},"observation_digest":"sha256:eaf2cb432aa6aecab3dfb686dee2a8ac31b6b2179b5f4986a3d7bcaab33e383d","observation_id":"8f953d7f-c32b-4170-910c-9dc353963321","resolution":{"observed_at":"2026-07-31T15:16:35.532712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24424","last_updated":"2026-07-27T13:36:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:34:58.893922Z","submitted_at":"2026-07-27T13:36:08Z","title":"MAViE: A Multi-scale Adaptive Vision Encoder for Fine-grained Visual Perception and Efficient Multimodal Reasoning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.24424."}