{"as_of":"2026-08-14T20:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:132d203cf019bc51f0b55ccea00be4cf41b34c099c73660b8add1c5bc696a335","coverage":[{"denominator":127,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:21:04.230183Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.20284/citation-record","integrity":"/paper/2607.20284/integrity","json":"/paper/2607.20284/citation-record.json","paper":"/paper/2607.20284"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:54.601881Z","title":"An Empirical Study of Remote Sensing Pretraining , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:54.601881Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:837ccc98ad5ca2da0c754cdcf4cc991c4758db4b389c3e134fd01053f2b15178","observation_id":"d4befa17-81b3-4318-b0f1-ec882b807ab1","resolution":{"observed_at":"2026-08-01T10:20:54.601881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:54.714523Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:54.714523Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:d6c8a4b0779c1f9f7579804a6a95712d9aa92224f2d7f6ac7c40f2e89c81975f","observation_id":"415a1b66-6f12-40b7-8655-73cd7cb53e03","resolution":{"observed_at":"2026-08-01T10:20:54.714523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:54.786805Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:54.786805Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:af07491111beb21563e1f312c70494ea252e599eb934e43aa0daa7b1446862fc","observation_id":"db293224-19c1-489a-8552-be4e728dbf43","resolution":{"observed_at":"2026-08-01T10:20:54.786805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:54.873707Z","title":"Liu and Delong Chen and Zhan-Rong Guan and Xiaocong Zhou and Jiale Zhu and Jun Zhou , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:54.873707Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:599615e0f829a6c448146eaa9e4fdc7602cae09ac322675d637a95ce7cb04480","observation_id":"2d1259f4-d86a-4f18-a576-4857a860c650","resolution":{"observed_at":"2026-08-01T10:20:54.873707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:54.966902Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:54.966902Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:617ad6cb61b11626ae1915d2105bc462470977c743f13dc558b6fa1aa98a4d0b","observation_id":"55b4b47b-e36e-4d16-b55d-9d37bf524b4e","resolution":{"observed_at":"2026-08-01T10:20:54.966902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:55.048591Z","title":"Good at captioning, bad at counting: Benchmarking","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.048591Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:669933758eb79074d0bf1e30c4aada9a910419a3e2f4e1fe95ff2773dd7b9e91","observation_id":"73e4655b-706f-4880-939b-285bbcb964ec","resolution":{"observed_at":"2026-08-01T10:20:55.048591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07089","last_updated":"2026-07-07T07:03:43Z","snapshot_observed_at":"2026-08-14T07:55:51.212888Z","submitted_at":"2024-06-11T09:30:02Z","title":"RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07089","snapshot_observed_at":"2026-08-01T10:20:55.171751Z","title":"arXiv preprint arXiv:2406.07089 , primaryclass =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.171751Z"},"links":{"cited_paper":"/paper/2406.07089","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:b1c833a42d6d87b4b1b3dad441b0b63bed476f39162f024591f0683d0ae0762f","observation_id":"ff5c14ec-5c39-4d18-a323-49baa60be98f","resolution":{"observed_at":"2026-08-01T10:20:55.171751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:55.227341Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.227341Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:0fe41b22dfd51143f5eaac29b33d5f59e8d13511fe29026d712c9e62f475642e","observation_id":"f067c93a-a77e-442e-90e7-34a95b284c48","resolution":{"observed_at":"2026-08-01T10:20:55.227341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:55.294613Z","title":"Evaluating Tool-Augmented Agents in Remote Sensing Platforms , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.294613Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:126758515e3bac2f5fd0a1b8a0f33b8ff76176c1f4582ddefd9c656cb117cf17","observation_id":"e563ec00-2cbc-4400-92da-038a871fe479","resolution":{"observed_at":"2026-08-01T10:20:55.294613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14289","last_updated":"2024-02-22T05:05:30Z","snapshot_observed_at":"2026-08-13T04:13:12.046147Z","submitted_at":"2024-02-22T05:05:30Z","title":"TinyLLaVA: A Framework of Small-scale Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14289","snapshot_observed_at":"2026-08-01T10:20:55.382179Z","title":"arXiv preprint arXiv:2402.14289 , primaryclass =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.382179Z"},"links":{"cited_paper":"/paper/2402.14289","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:9a463ec7055a17151b4d10c442ac4a420ea839a7ce74b65fb1874c814dda1a69","observation_id":"c6a5d733-615d-4e64-a8b1-022abe26ab3a","resolution":{"observed_at":"2026-08-01T10:20:55.382179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:55.512630Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.512630Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:c1e7252015f56c0db6e57ebb99f5369f1cd52e4dc3516c3d6d3cef50002d0397","observation_id":"3fb542d2-b4e6-496c-957a-0276fccc00d1","resolution":{"observed_at":"2026-08-01T10:20:55.512630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:55.592322Z","title":"Visual Instruction Tuning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.592322Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:6515bfe372a3af12d04beb145caba17c127b2079bd4283b905a11178e4222d8b","observation_id":"9e91cbb4-5b6c-4553-aabe-683b346d9181","resolution":{"observed_at":"2026-08-01T10:20:55.592322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-01T10:20:55.683575Z","title":"arXiv preprint arXiv:2308.12966 , primaryclass =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.683575Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:e8ea7230017e627812135b9fd52c99842d1fba873241441fed2eb1161c994737","observation_id":"10385c50-e044-4a04-b4c7-4184192b35b4","resolution":{"observed_at":"2026-08-01T10:20:55.683575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:55.794866Z","title":"Proceedings of the 30th ACM International conference on Multimedia , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.794866Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:abe550e6c19c95f6b3450eac57dc90f654d0cb0d40146b763a6856fdcd2884da","observation_id":"659815ca-80ea-4ebb-b6e2-0e4531a9768d","resolution":{"observed_at":"2026-08-01T10:20:55.794866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:55.908301Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:55.908301Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:7cd67e71bc5c2cc52ba7d7abdf4789c925de74b4926be668e9e5d54e17fbbd75","observation_id":"9f5e8986-aaf2-4e52-840b-5343e6e8344f","resolution":{"observed_at":"2026-08-01T10:20:55.908301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.057033Z","title":"2023 , pages =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.057033Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:517dc3743ed2984a2be759dd4c03637be8b2e74beb919aa580f480790c54c3e3","observation_id":"3468859d-9519-4ab5-9e52-78e35676a822","resolution":{"observed_at":"2026-08-01T10:20:56.057033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T10:20:56.144208Z","title":", title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.144208Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:be32e76afb7b0d3dc7d11e700fadb57ad18dd31980c848baf046ea96d17090ca","observation_id":"5df1ebd9-e812-4a56-862c-11c08a51c5f0","resolution":{"observed_at":"2026-08-01T10:20:56.144208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14178","last_updated":"2024-03-29T08:13:38Z","snapshot_observed_at":"2026-08-13T08:24:19.015641Z","submitted_at":"2023-04-27T13:27:01Z","title":"mPLUG-Owl: Modularization Empowers Large Language Models with Multimodality","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14178","snapshot_observed_at":"2026-08-01T10:20:56.250031Z","title":"arXiv preprint arXiv:2304.14178 , primaryclass =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.250031Z"},"links":{"cited_paper":"/paper/2304.14178","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:ccfa372be9d1f3bd9a85087530beed77c5235e37816e1d409d44f7338802423f","observation_id":"3fc5ca90-6d73-48b4-836e-0d7cbafba409","resolution":{"observed_at":"2026-08-01T10:20:56.250031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.328439Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.328439Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:3daac1e77e39866923d9176f7ee3d5b4e431e576be41732afadd07eb359aa80b","observation_id":"c39b880f-3a78-4abe-b47e-a4d9a93df9d7","resolution":{"observed_at":"2026-08-01T10:20:56.328439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.419464Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.419464Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:f5f71cc40d05703aa7487353287f7d9ec499e5a2d3f9340e5a14e2acf0327075","observation_id":"ec2b22e3-8785-4401-a5c0-b98de13d12e3","resolution":{"observed_at":"2026-08-01T10:20:56.419464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.486295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.486295Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:df57d8f3d50d74e21d65f218ced36a528cbd2e918b6aea033a5a218968c8860b","observation_id":"0d784999-5035-4375-8506-e8e55fe7f76d","resolution":{"observed_at":"2026-08-01T10:20:56.486295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.588395Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.588395Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:4d66e52a936f2d8f81ea671597396c547c049f2ab62a9cd96e3c5f4e27b27e9f","observation_id":"e4dc7e15-5f2a-4ccc-8f3a-870060b4f934","resolution":{"observed_at":"2026-08-01T10:20:56.588395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.680023Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.680023Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:039c48bd5d449a407f8a57b6ee1bece6aea9c2b0cbec4c48f7b57be1496a6a8f","observation_id":"eb22464a-e1d5-40a2-b790-1e7826bf31fd","resolution":{"observed_at":"2026-08-01T10:20:56.680023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20213","last_updated":"2024-12-19T13:46:40Z","snapshot_observed_at":"2026-08-14T11:49:07.961909Z","submitted_at":"2024-03-29T14:50:43Z","title":"VHM: Versatile and Honest Vision Language Model for Remote Sensing Image Analysis","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20213","snapshot_observed_at":"2026-08-01T10:20:56.785879Z","title":"arXiv preprint arXiv:2403.20213 , primaryclass =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.785879Z"},"links":{"cited_paper":"/paper/2403.20213","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:3fc11d3dc88487d4fb7f89cd42cc48259604c1c9398eeb23b037baf7f3896096","observation_id":"bfeebafc-3298-4522-b84b-cc55166125ef","resolution":{"observed_at":"2026-08-01T10:20:56.785879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.882404Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.882404Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:cd085298b0a166f40644bb6e2f0b242248d20182f7969064bf23cb1426e5d7ea","observation_id":"0e3723f5-96f6-4416-ae44-d9da62fa1072","resolution":{"observed_at":"2026-08-01T10:20:56.882404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:56.995031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:56.995031Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:d799f02fd40b94e9d72a67c458247df7d66ea7344305b8854b2dfe3aaf63463c","observation_id":"8232ca97-0c86-4957-8dca-89bd9bfd6f3a","resolution":{"observed_at":"2026-08-01T10:20:56.995031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.082028Z","title":"2025 , publisher=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.082028Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:0c8578be3c9af21f10121d8bbcc88e06d81af34b07cc7abcd8b03c165eb5f3b2","observation_id":"f7198ac1-e290-40cb-b64b-3a7b5e7fa4bb","resolution":{"observed_at":"2026-08-01T10:20:57.082028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.145154Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.145154Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:09160f17c052f4d4607e50f40bf00e2a3d40e8c2e03a4c5cc5ebec491d3e7dea","observation_id":"f04dd88c-8aac-4cbd-8219-f51d3b874bcb","resolution":{"observed_at":"2026-08-01T10:20:57.145154Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-12T23:42:36.797128Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-01T10:20:57.231744Z","title":"arXiv preprint arXiv:2406.10100 , primaryclass =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.231744Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:62c41212523dd74e40eaff3168da5a735f9482334b4d551cc3b048034d88e86f","observation_id":"9015ada6-7997-4178-b8f4-91ef0f9baea2","resolution":{"observed_at":"2026-08-01T10:20:57.231744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.295500Z","title":"arXiv preprint arXiv:2406.09385 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.295500Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:b67434cea837ddef54181a03b95bad85617588091ac231130d1dc04a0570b08c","observation_id":"6626fe44-8bca-4bad-bcab-5b8e62c7a51b","resolution":{"observed_at":"2026-08-01T10:20:57.295500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04498","last_updated":"2023-12-18T12:15:26Z","snapshot_observed_at":"2026-08-13T05:30:05.715696Z","submitted_at":"2023-11-08T07:15:05Z","title":"NExT-Chat: An LMM for Chat, Detection and Segmentation","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04498","snapshot_observed_at":"2026-08-01T10:20:57.384780Z","title":"arXiv preprint arXiv:2311.04498 , primaryclass =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.384780Z"},"links":{"cited_paper":"/paper/2311.04498","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:9e9166e609022f10c8ca1ad348da0e7e5a83d309e073e1f279ddecd908f215b9","observation_id":"210014b3-c990-4050-8b71-41f38297f8e5","resolution":{"observed_at":"2026-08-01T10:20:57.384780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-08-13T14:42:26.982679Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-01T10:20:57.445031Z","title":"arXiv preprint arXiv:2306.15195 , primaryclass =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.445031Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:4dc414625fe1ef5a9aac4b6bf1db2a226c398dd3a94037459c7462e1d33dd54d","observation_id":"71d918ed-a7da-49b4-81b9-fd074990dde1","resolution":{"observed_at":"2026-08-01T10:20:57.445031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.503222Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.503222Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:d3bd0bb83178cbb099314ef790fc8ac4b89d98d9b79bad62d6433f5555ed4487","observation_id":"03afd617-681c-4f64-8f18-a2ce57534822","resolution":{"observed_at":"2026-08-01T10:20:57.503222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.567667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.567667Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:42cd92969106b35e9a2d49fb13f0e4f3b4112d450eae75ccd629513067ea082b","observation_id":"53445d3c-9f5a-48df-9710-db42355a77b8","resolution":{"observed_at":"2026-08-01T10:20:57.567667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15112","last_updated":"2023-12-14T17:21:39Z","snapshot_observed_at":"2026-08-13T16:12:12.725607Z","submitted_at":"2023-09-26T17:58:20Z","title":"InternLM-XComposer: A Vision-Language Large Model for Advanced Text-image Comprehension and Composition","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15112","snapshot_observed_at":"2026-08-01T10:20:57.609350Z","title":"arXiv preprint arXiv:2309.15112 , primaryclass =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.609350Z"},"links":{"cited_paper":"/paper/2309.15112","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:5c59df6860190e3950bb8986c9481295476edc4931ca10f9e54de1e399918b5c","observation_id":"0d564aa3-ac52-4aef-b627-9e34a4238f1d","resolution":{"observed_at":"2026-08-01T10:20:57.609350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.680721Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.680721Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:7db3041f4dfc0077e9cb75f4656babc0e146de9e23d2e8aaed848cee4c194fb3","observation_id":"590563c2-be83-478f-b467-a2f25ace5a08","resolution":{"observed_at":"2026-08-01T10:20:57.680721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.745343Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.745343Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:ebe96f22a89b13a29c918e77fc259441a9fe246e871d1cf8e1e6f857c66d3b8e","observation_id":"95e58358-1eab-49cf-9e02-f8c5e7c6082d","resolution":{"observed_at":"2026-08-01T10:20:57.745343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.833541Z","title":"Cong and Yingjie Hu and Chris Cundy and Ziyuan Li and Rui Zhu and Ni Lao , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.833541Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:9ca44c493670d399e806d86188a7071a7a6726c31a0d19e73461dafd827ef6a8","observation_id":"baf6c8c4-e185-4874-92b2-f63e1de35cd5","resolution":{"observed_at":"2026-08-01T10:20:57.833541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.895888Z","title":"IGARSS 2024-2024 IEEE International Geoscience and Remote Sensing Symposium , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.895888Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:b87e611ea69e007f53df5787800c3ec3dd519a7b61464a6bbfbde29379916bab","observation_id":"d1028c56-509b-465d-a9d5-67f47b9c2563","resolution":{"observed_at":"2026-08-01T10:20:57.895888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:57.983042Z","title":"and Nieusma, Jordan M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:57.983042Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:783e2cf3fa48a01c1ad56f647f8c482b0fd401c7adac333a40b654d4c8e151a8","observation_id":"e942b209-d8aa-47d7-bfed-883585d52345","resolution":{"observed_at":"2026-08-01T10:20:57.983042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.071404Z","title":"2020 , number =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.071404Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:ba5e09165dfaa54a1cffd26269b73a3651b9bbf49d142c102e7a73380ee1e733","observation_id":"aa2ac42c-daf3-430c-a704-dba89a6b8fe9","resolution":{"observed_at":"2026-08-01T10:20:58.071404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.158805Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.158805Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:739dc427972f02f3dd6d75cbf7073907ce2044facc46211efcc7b8bc1fe81770","observation_id":"86f8bc97-8647-4e31-ade1-dfe31d682dae","resolution":{"observed_at":"2026-08-01T10:20:58.158805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.247232Z","title":"2024 , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.247232Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:c42172f0376db182e546258e0b1f82d1ed65b2d7538ea2db74ca08fc3c39c9e5","observation_id":"7ebe0822-5bce-4d05-843e-2d1902d15334","resolution":{"observed_at":"2026-08-01T10:20:58.247232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.309505Z","title":"Remote Sens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.309505Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:58efff48e59d2763e58da3e1132b2a6e25ef70353ac25a11607344671c314906","observation_id":"be7b36e4-3dca-4385-9070-e2bf34648841","resolution":{"observed_at":"2026-08-01T10:20:58.309505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.396111Z","title":"2024 , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.396111Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:cab60fd46407492aa9070541e73035e4b2766c5b728bde5f727de626b9b6f758","observation_id":"3c9085cf-336a-49d2-a6ea-16e86459e089","resolution":{"observed_at":"2026-08-01T10:20:58.396111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.460380Z","title":"Remote sensing image scene classification meets deep learning: Challenges, methods, benchmarks, and opportunities , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.460380Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:477f920f0789d56fedda4bf52e290e0287ff004660fbe23bc4101dd2aaac1d27","observation_id":"3cf05aea-6343-4d61-bd07-dcb34c613adb","resolution":{"observed_at":"2026-08-01T10:20:58.460380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12479","last_updated":"2024-06-18T10:34:28Z","snapshot_observed_at":"2026-08-12T23:40:14.059603Z","submitted_at":"2024-06-18T10:34:28Z","title":"RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12479","snapshot_observed_at":"2026-08-01T10:20:58.536227Z","title":"arXiv preprint arXiv:2406.12479 , primaryclass =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.536227Z"},"links":{"cited_paper":"/paper/2406.12479","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:eed02b8329a1c8f30b7e36a31b82102306f7f815f99009bcec91e3f8ba66dc73","observation_id":"47114dda-ffff-4cdb-9ab6-8f15fcc4680d","resolution":{"observed_at":"2026-08-01T10:20:58.536227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06475","last_updated":"2024-02-09T15:31:01Z","snapshot_observed_at":"2026-08-13T04:22:30.692524Z","submitted_at":"2024-02-09T15:31:01Z","title":"Large Language Models for Captioning and Retrieving Remote Sensing Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06475","snapshot_observed_at":"2026-08-01T10:20:58.622751Z","title":"arXiv preprint arXiv:2402.06475 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.622751Z"},"links":{"cited_paper":"/paper/2402.06475","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:cedc3d98fd31d2dd3a01231d8f7ab1272691d925053af94a6d3575d436dda36b","observation_id":"ee5f5c56-7676-48be-be54-7f353920ff0c","resolution":{"observed_at":"2026-08-01T10:20:58.622751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.706409Z","title":"2024 , issn=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.706409Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:f5d504054abb1d5da0fb43fc314d1de15e6fcce45c33d3ad306004bd5edf62ab","observation_id":"3e7c0ea0-cf66-4830-9a2e-ad1b5186f092","resolution":{"observed_at":"2026-08-01T10:20:58.706409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.786958Z","title":"Open Self-Supervised Features for Remote-Sensing Image Scene Classification Using Very Few Samples , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.786958Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:f73a603d50119f1a62fa4453d53a5cf8a6d8387d348c244ed3c8e7caebbaa350","observation_id":"ec4e106b-76e2-4b7a-be3e-6339ec65f0b6","resolution":{"observed_at":"2026-08-01T10:20:58.786958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.881946Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.881946Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:89970be0939ecf3ad65f91258aa6a85b77f537ebc73f60e46e7c8a3531d819ce","observation_id":"488ef5e1-8982-4a66-ac8b-65e806fbd798","resolution":{"observed_at":"2026-08-01T10:20:58.881946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:58.961484Z","title":"Zhang , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:58.961484Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:215c700f425d6ec5527f8a8e0e33937e253f0aa1745e926cb68e10ce81e84f28","observation_id":"d2c54b8a-4d4d-4700-868f-a46b1e4b0a24","resolution":{"observed_at":"2026-08-01T10:20:58.961484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.027276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.027276Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:52b6bb0481637a177d0de04aef0835a6aa92fa764ed3a95aa365e2db7d7cd0a3","observation_id":"34eee8e1-07f0-4801-83cf-abec3a5226d1","resolution":{"observed_at":"2026-08-01T10:20:59.027276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.142441Z","title":"2024 , publisher=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.142441Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:99ecd373894522694bd394e766ad1c9ecba52efc6ae2ab9bc33abdce01b30536","observation_id":"0640aa84-afe2-49ca-93e1-cb615bee2ac3","resolution":{"observed_at":"2026-08-01T10:20:59.142441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.263122Z","title":"GeoGPT: An assistant for understanding and processing geospatial tasks , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.263122Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:c60e6bb009067ac3c6c390f0707263f23261f2d567888897003c106d06cb5bd7","observation_id":"d4d56cbc-f18a-45b5-99cf-0f7036383523","resolution":{"observed_at":"2026-08-01T10:20:59.263122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.335245Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.335245Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:fb72f68f38c431d793a29d55db2f100d0c13ea4a18bf2a0fdee3051705f03ed3","observation_id":"bb66fe1f-3c5a-4571-a705-4afacce92ccb","resolution":{"observed_at":"2026-08-01T10:20:59.335245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.397204Z","title":"Exploring region features in remote sensing image captioning , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.397204Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:26e95ed898c6ddf9d961235a69755cfd0f69bbbacb25bf77d8653c7702dbf895","observation_id":"3f7e5481-a9d6-4a7f-aa5d-8c1db3d77403","resolution":{"observed_at":"2026-08-01T10:20:59.397204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.463006Z","title":"Understanding remote sensing imagery like reading a text document: What can remote sensing image captioning offer? , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.463006Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:6915397f4882964d08a59e818cc49c0c3090e0bb8c66441c692e109a3e2366d3","observation_id":"ed24eff0-1277-43d9-a252-57125411c78d","resolution":{"observed_at":"2026-08-01T10:20:59.463006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.588178Z","title":"Improving visual question answering for remote sensing via alternate-guided attention and combined loss , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.588178Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:e1b85ea7b73196df830dd5a35bbbc99995e5dd4da66d9867b3ff78ff0a68d138","observation_id":"75459db0-8c34-4107-95e1-cdcfa5f7520b","resolution":{"observed_at":"2026-08-01T10:20:59.588178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.721276Z","title":"A multi-scale contextual attention network for remote sensing visual question answering , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.721276Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:cd3bcd8dde060bb342eb27bb682e13858ef6f9419d567ea56bbbcef272d33938","observation_id":"a7077a3a-9add-496d-a810-4422af645ef0","resolution":{"observed_at":"2026-08-01T10:20:59.721276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.762897Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.762897Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:f44445da9cd43b4b13a87829d0705341e48542dc13f5875013cbf3221d705457","observation_id":"990fd01b-f412-46b6-9770-6ee00b2e3a6e","resolution":{"observed_at":"2026-08-01T10:20:59.762897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.868180Z","title":"National Science Review , volume=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.868180Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:8203741baf9254637cdc9d0b24ef868a56853e10a6d17df93e35ba0210fd6f49","observation_id":"dcdb04e0-3654-422d-854e-5a258c3db7af","resolution":{"observed_at":"2026-08-01T10:20:59.868180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:20:59.955578Z","title":"Burke and D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T10:20:59.955578Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:d2bcca693d36f33fb4f627aa42aeefc7bb67cbbfe75d9d90371be0c1f45e19c4","observation_id":"e619464e-ad80-4fb0-84f0-30d77353cecb","resolution":{"observed_at":"2026-08-01T10:20:59.955578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:00.026066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.026066Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:f27fd266bab51903eb5d45dc366936282a313332dfe3ad53ee97b8b875d993cb","observation_id":"7d89b12f-8823-4ce2-bb91-f82dda3fdf83","resolution":{"observed_at":"2026-08-01T10:21:00.026066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:00.062987Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.062987Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:76be1f72a215463fb538ddbb767c29df0fba4f1fee66541fe2114277b67fad6e","observation_id":"686c5c04-f598-4db5-92d9-7de02b76be3e","resolution":{"observed_at":"2026-08-01T10:21:00.062987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:00.174961Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.174961Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:ead931140882d7b163b676651cd39736bf4f9096b11439d764097cfcd663cdb5","observation_id":"083f7eb7-776f-4a88-876a-4f91f050c692","resolution":{"observed_at":"2026-08-01T10:21:00.174961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:00.285113Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.285113Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:1eb7db4d89cf50aa8d8db2afd3c5f9cb93cfe908ca7f6647951b5787e56b4198","observation_id":"d852c828-708f-4ee9-a55a-ad2c031cadce","resolution":{"observed_at":"2026-08-01T10:21:00.285113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:00.370300Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sensing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.370300Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:529f8d5b83360f75f500ecd55bf58e6eb210f97615edd40b17b00dd9dd43c3b6","observation_id":"573a8224-bce3-416a-82fa-01e6ff0499e0","resolution":{"observed_at":"2026-08-01T10:21:00.370300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:00.491468Z","title":"RingMo: A Remote Sensing Foundation Model With Masked Image Modeling , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.491468Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:7e7848a89eea18b778c5422664e10029bb6308378d7c29625456bd3c8c46710e","observation_id":"55c13578-a06b-4fbb-ae38-552317bcc875","resolution":{"observed_at":"2026-08-01T10:21:00.491468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-13T04:48:56.237545Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-01T10:21:00.604222Z","title":"arXiv preprint arXiv:2508.18265 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.604222Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:67b572b99dd3a0874548b1f04dd5665f51626219326fce20be6800cd8233fe4a","observation_id":"dcfdb771-0ed5-437c-a0b3-e5475c7a985e","resolution":{"observed_at":"2026-08-01T10:21:00.604222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-01T10:21:00.723033Z","title":"arXiv preprint arXiv:2511.21631 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.723033Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:f3c4c98111534036c11c0bdd474e03c525fe685ffb35e341e49e5dd666709edc","observation_id":"e6305349-2501-45fd-89b0-f84ce132e2ac","resolution":{"observed_at":"2026-08-01T10:21:00.723033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:00.871182Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:00.871182Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:1e79f09d2754c4b9e1c6ffedaf18a8b482061fccf19949b6fac1eead20e2e101","observation_id":"10dd8db6-719c-4680-a263-2a2ed3d8c992","resolution":{"observed_at":"2026-08-01T10:21:00.871182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.032267Z","title":"Spectral","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.032267Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:acb472fd604fa2a02f4bf6a7c87800d32ac2842ef3e0d171377bdcd8701c4467","observation_id":"2fe81551-75ff-476d-9f59-6653f921208c","resolution":{"observed_at":"2026-08-01T10:21:01.032267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.151180Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.151180Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:246a85f6268ded0a8591ad5510600588983488bd9935eca55403d93dd2aa173a","observation_id":"a4a1e811-de72-48c9-a009-c16758b5efe4","resolution":{"observed_at":"2026-08-01T10:21:01.151180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.316233Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.316233Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:76e8dfd4f452f53d6d227df0e70960b4c18b935c9a9e409dad16da0f85f0ecb1","observation_id":"15268ad4-6bdf-4d31-89dd-3faa4c604399","resolution":{"observed_at":"2026-08-01T10:21:01.316233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.484340Z","title":"2026 , publisher=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.484340Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:78eb42177e8760054417a94ff783304fdb90aafc822fda3cfa838fcbe12e49f4","observation_id":"724ce1fe-c155-4258-a1c6-8de23a18187b","resolution":{"observed_at":"2026-08-01T10:21:01.484340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.596873Z","title":"2025 , volume=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.596873Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:1b48e6b8cbf22f2a4ba26c0313ca4d30a242a27b998445284ed2eefd53a6b90a","observation_id":"8e90db9b-087a-4d0f-bc86-75863240cf16","resolution":{"observed_at":"2026-08-01T10:21:01.596873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.713438Z","title":"2024 , issn =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.713438Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:9cd8996159d2c897ac9d3b1ed40d772e5d621a1cf78e6f8e5564db67440bec05","observation_id":"77213fea-1aca-4953-96d5-afb80e2bfbdd","resolution":{"observed_at":"2026-08-01T10:21:01.713438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.800137Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.800137Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:9488ee95eebe1507e367e4ff74e339fdb4d021b7a660cd59b976fca348f138c5","observation_id":"2b1b9c53-7dba-4988-9585-5658db2c8112","resolution":{"observed_at":"2026-08-01T10:21:01.800137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:01.915277Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:01.915277Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:a84eff7050caa1b9893b2582974c97883c8bd54c46960ee9c2a173e6b460baf0","observation_id":"bc0e7a54-db86-4d7c-b4f5-639a67fdab41","resolution":{"observed_at":"2026-08-01T10:21:01.915277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:02.081012Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:02.081012Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:c1b86917ef59fd8c6b3b2e80dc2118e4f02dc96976c9fa6d3fd290076bdb917e","observation_id":"acceac88-e9b8-43ac-908b-978c1b2c8f68","resolution":{"observed_at":"2026-08-01T10:21:02.081012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:02.249731Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:02.249731Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:0fb22bcecaf5e8e98d44f9b48459b140aa06b7b2c699267ea5a4f4d3317c0611","observation_id":"255a262a-ecd4-41ef-84e4-c91631d93898","resolution":{"observed_at":"2026-08-01T10:21:02.249731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:02.423084Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:02.423084Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:276e8c73326e1c6dffd2fd3cf7a134ef7557e67401efd496714e34c6a816d422","observation_id":"280bceaf-4ceb-4647-836f-fdbec180e6c4","resolution":{"observed_at":"2026-08-01T10:21:02.423084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:02.543923Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:02.543923Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:8550162c5a29a7eae624d9ec7016252501d229ea2df434bfbbb818171a8e3a16","observation_id":"58ebe15c-b057-47b8-99d4-b35614c21daf","resolution":{"observed_at":"2026-08-01T10:21:02.543923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:02.705568Z","title":"arXiv e-prints , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:02.705568Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:d3c310614df90d71052b312fd318a96e517118bba3e0dce938bfdba69012a43c","observation_id":"7fd61d53-8ba3-476a-b951-6823c12cd370","resolution":{"observed_at":"2026-08-01T10:21:02.705568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:02.835491Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:02.835491Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:7c87a54c42608bf4cef6f68148c4a2dd91795c18635d7c891951c9e92281b885","observation_id":"552bc830-9926-4ccc-8afd-31963bd54c75","resolution":{"observed_at":"2026-08-01T10:21:02.835491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-01T10:21:02.995105Z","title":"arXiv preprint arXiv:2507.01006 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:02.995105Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:a42ccf0cf63f4f61cf6e2e9d14915e5e733a589daf52601715cf1c8ae23e084a","observation_id":"848b346a-2def-45ff-a7f4-93017106f0b7","resolution":{"observed_at":"2026-08-01T10:21:02.995105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.151536Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.151536Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:acf029a447b392b8479a23db2204c0d830a6ffb983a3d304b0b9ca5badc8430f","observation_id":"ce40f3d9-41e9-4d1a-896a-075f2cda077e","resolution":{"observed_at":"2026-08-01T10:21:03.151536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.288682Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.288682Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:e53069d77253df521fa9ca13a669e21a32478ebb34b39313da2a0f04bb854763","observation_id":"84e3437e-8506-4e00-a369-7a76e019440b","resolution":{"observed_at":"2026-08-01T10:21:03.288682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.427962Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.427962Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:52a14c87432b812d66eabc0370cfb740e4209bd06a7f7a0bd2729f261ba938a3","observation_id":"e3dd745f-fc29-4384-908f-e3ed9886c969","resolution":{"observed_at":"2026-08-01T10:21:03.427962Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.574049Z","title":"Language Models are Few-Shot Learners , volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.574049Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:4b6fe724b6ab129608021d6aa2168370d1f53dc12f49e73145067ae341973d36","observation_id":"2f65d69d-df7c-47bd-983a-4c107b7cf829","resolution":{"observed_at":"2026-08-01T10:21:03.574049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.683250Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.683250Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:5b170c3d0febd249d653d317616cb04d50a515ce178e67788d8b121f007a1776","observation_id":"d6c7c5e5-e5fe-4ab5-af80-87d01eedc74f","resolution":{"observed_at":"2026-08-01T10:21:03.683250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.737982Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.737982Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:a4caf60ad13bfab6f02403416094f22bd45add65f393665573cb4664f0ab91c9","observation_id":"c1d1784c-85f0-472b-a2d1-311f038f627f","resolution":{"observed_at":"2026-08-01T10:21:03.737982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.812703Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.812703Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:193511aacb64c980c80dd838a54c8c1b9eed9d757770cedc4053ad0b97fda542","observation_id":"35035b02-27e3-42e7-b52c-11f31e467355","resolution":{"observed_at":"2026-08-01T10:21:03.812703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.876220Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.876220Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:39b6cf1cd0801376ee33c9c3b58f03032ad3bf2da70537103889ea29bf53088e","observation_id":"76d765aa-3df2-4510-b5fd-0db8d4136aa6","resolution":{"observed_at":"2026-08-01T10:21:03.876220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.922735Z","title":"ICLR Workshop on Machine Learning for Remote Sensing , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.922735Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:9dde3336b9c2f95108ad820117c0fd6d29e0986784788b740460ef4514e9c30f","observation_id":"fc9e2178-2aa6-4e03-b06d-c8b289e183e4","resolution":{"observed_at":"2026-08-01T10:21:03.922735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:03.998589Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:03.998589Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:309193412f3b262161815ecd1479c09fa5b5df0b02f2c855e41ac8cb2e229049","observation_id":"58b179ac-231c-4660-b065-3068517eff60","resolution":{"observed_at":"2026-08-01T10:21:03.998589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:04.054849Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:04.054849Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:b50e927fb27460d735a7e57d7a9b738812e9ecffcdfbb9f3fd673ab151dc63d2","observation_id":"9088e523-11ac-425a-9ae3-a482e165ac90","resolution":{"observed_at":"2026-08-01T10:21:04.054849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:04.153051Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:04.153051Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:ab9d1699bf8e98cf0094fa8163c73f8c4e148f112fbe799c3fceb8f562388a66","observation_id":"7318f675-5918-4620-a297-dfad03ff042b","resolution":{"observed_at":"2026-08-01T10:21:04.153051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T10:21:04.230183Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:04.230183Z"},"links":{"citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:52745b7b5cc183ae1633593e8d4b678f81f57e170f8a323f0f0b9b15933afcd2","observation_id":"85e62464-9458-4db4-b05a-c810feecd6e1","resolution":{"observed_at":"2026-08-01T10:21:04.230183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T04:13:24.607941Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":127},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 127 outbound references and 0 inbound Pith citation observations for arXiv:2607.20284."}