{"as_of":"2026-08-15T10:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3f35490b6553b2cfba310c3a96e1918c63e0ccf233d3f7deeed516440dfc99f7","coverage":[{"denominator":299,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:38:55.619271Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-01T05:11:58.947649Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T10:45:42.279098Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"cited_work":{"arxiv_id":"2505.14361","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14361","snapshot_observed_at":"2026-07-01T10:45:42.279098Z","title":"arXiv preprint arXiv:2505.14361 , year=","venue":null,"work_id":"4cff9b26-75b2-474f-bbb3-7a8126bbb934","year":null},"citing_paper":{"arxiv_id":"2606.31976","last_updated":"2026-06-30T17:16:59Z","snapshot_observed_at":"2026-08-13T20:00:56.429483Z","submitted_at":"2026-06-30T17:16:59Z","title":"TreeAgent: A Generalizable Multi-Agent Framework for Automated Bias Labeling in Forestry via Compiled Expert Rules and Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-07-01T05:11:58.947649Z"},"links":{"cited_paper":"/paper/2505.14361","citing_paper":"/paper/2606.31976"},"observation_digest":"sha256:e608d5b280e65c1067e33525867e8ce844132b7e322961020b9965e9f4dd5bab","observation_id":"f489b34b-47d3-4a3c-8fb1-24e0b4a0f13a","resolution":{"observed_at":"2026-07-01T10:45:42.280738Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14361/citation-record","integrity":"/paper/2505.14361/integrity","json":"/paper/2505.14361/citation-record.json","paper":"/paper/2505.14361"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.064939Z","title":"Rsgpt: A remote sensing vision language model and benchmark,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.064939Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:9c8038622193fcbe5ec1a1a57fcd74dd8336c00d0c72f0c010f98776d41f9e3d","observation_id":"3c13e333-f01a-4f75-a0a5-affae0186252","resolution":{"observed_at":"2026-08-07T15:38:43.064939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.156146Z","title":"Remoteclip: A vision language foundation model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.156146Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:0597a7e0ed2fbf27f8b86910f8b1f9de7dc616020140c4e16415440f3951c811","observation_id":"4d061b49-c907-4ddc-8d88-e98eff39cea3","resolution":{"observed_at":"2026-08-07T15:38:43.156146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.283004Z","title":"Geochat: Grounded large vision-language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.283004Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:47a82da135bf598315291128477ca0faf3545eb73461e8e1229285414db3266a","observation_id":"28528bda-18a9-4da0-9c19-e9106bba1398","resolution":{"observed_at":"2026-08-07T15:38:43.283004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.452270Z","title":"Remote sensing vision-language foundation models without annotations via ground remote alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.452270Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:78a20b7c89cc394efe42ebe610c41a61b5f78ac0781cb273c67d2577028178b0","observation_id":"7edb7424-6f49-4b1a-844d-b3c0ca45e78f","resolution":{"observed_at":"2026-08-07T15:38:43.452270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.608411Z","title":"Skyeyegpt: Unifying remote sens- ing vision-language tasks via instruction tuning with large language model,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.608411Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:61f5f886cd08236e36b37572992870a50300eb833f9ce67f93c325521b714311","observation_id":"80c7a8fa-64c7-4355-a09c-ba621b435a22","resolution":{"observed_at":"2026-08-07T15:38:43.608411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.778323Z","title":"Earthgpt: A universal multimodal large language model for multisensor image com- prehension in remote sensing domain,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.778323Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:df7655d10ccd2b5ba58d9c0b15df84cae8c9049c4d3db97acd87002e44d025d2","observation_id":"8317d75c-4ee6-4c4c-aa23-a0b09e186326","resolution":{"observed_at":"2026-08-07T15:38:43.778323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:43.900412Z","title":"Rs5m and georsclip: A large scale vision-language dataset and a large vision-language model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:43.900412Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:0a663d0e9a1c62a0d87b426fcdc6c3475fbc29798f9ae843b836dd6e0fff56c1","observation_id":"9f968775-1c81-4dba-934d-ea48443625d5","resolution":{"observed_at":"2026-08-07T15:38:43.900412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.024239Z","title":"Skyscript: A large and semantically diverse vision-language dataset for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.024239Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6870c704266fbcb1238fdde1e9c6d97b31d4ba1d30126c581a89511e038b9e8c","observation_id":"7991c0ca-874f-437a-bf88-f02088e1cb2d","resolution":{"observed_at":"2026-08-07T15:38:44.024239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.181611Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.181611Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b4754b9156f5c79197cc90439d9bd13d65c0a008e898a7725e9656ee2d21f0a7","observation_id":"85e592d4-8a4d-4a9b-8181-be5747a519a5","resolution":{"observed_at":"2026-08-07T15:38:44.181611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.289917Z","title":"Rs- llava: A large vision-language model for joint captioning and question answering in remote sensing imagery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.289917Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c4a557ba2cc8173cb77c7cac23932d4b759e0cb8577c63ef05005a09e5d92a97","observation_id":"6cf05be3-18b1-49f7-9990-60f465189842","resolution":{"observed_at":"2026-08-07T15:38:44.289917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-12T23:42:36.797128Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-07T15:38:44.401424Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for remote sensing vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.401424Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ba11b11a14da50fe6924fa95e1ef9014a271abd9a94c774b33ec4cb3eb7e3994","observation_id":"9ae29f85-5d1f-4171-9a1e-bd4620c1b678","resolution":{"observed_at":"2026-08-07T15:38:44.401424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.510141Z","title":"Vrsbench: A versatile vision- language benchmark dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.510141Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:cae1d7e5e9bae92870e5c6dc7e267468fc34dbb2eaaeb3dfd636cbcc61c2b942","observation_id":"ff8d6127-e1ca-42d2-a67d-78004064ca42","resolution":{"observed_at":"2026-08-07T15:38:44.510141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.622345Z","title":"Changeclip: Remote sens- ing change detection with multimodal vision-language representation learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.622345Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b81e2317c9258533ee92f6ceb13468d888ea784ecab77db804a98abc09d09537","observation_id":"7e6441a9-928e-4ed8-ab1a-d9411385a790","resolution":{"observed_at":"2026-08-07T15:38:44.622345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:44.787635Z","title":"Rs-clip: Zero shot remote sensing scene classification via contrastive vision-language supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.787635Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:24e4aa09c07f62dd873a2172c7dd56faea806f07f304c54aca6832ba4a91bcec","observation_id":"21ec66ba-65ee-4a29-8c3a-e81b9062f7dc","resolution":{"observed_at":"2026-08-07T15:38:44.787635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09816","last_updated":"2025-07-18T11:42:52Z","snapshot_observed_at":"2026-08-13T11:04:16.310449Z","submitted_at":"2024-02-15T09:31:07Z","title":"Mind the Modality Gap: Towards a Remote Sensing Vision-Language Model via Cross-modal Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09816","snapshot_observed_at":"2026-08-07T15:38:44.914015Z","title":"Mind the modality gap: Towards a remote sensing vision-language model via cross-modal alignment,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:44.914015Z"},"links":{"cited_paper":"/paper/2402.09816","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6e3de6023c27c2c8c12bbe64ab238f044ca882d62b5d3fb54a76d4b5e837c764","observation_id":"cb51dcff-43d7-4a42-8371-a7f4ee1c1383","resolution":{"observed_at":"2026-08-07T15:38:44.914015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.014750Z","title":"Towards vision-language geo-foundation model: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.014750Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:bbb093640936c18da4748beb8773b3af12a7d2694320d75707a1eee81f37fc6b","observation_id":"c5713cf3-7683-4486-8685-24b06828bc24","resolution":{"observed_at":"2026-08-07T15:38:45.014750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.170587Z","title":"Vision-language models in remote sensing: Current progress and future trends,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.170587Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:e03095647065030d0f3ca630a5f99e6ba8d731e71d2861a517c9a78313095257","observation_id":"58a77bdf-717b-4601-bf47-2ba6fece9281","resolution":{"observed_at":"2026-08-07T15:38:45.170587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.235768Z","title":"S-clip: Semi-supervised vision- language learning using few specialist captions,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.235768Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b4cb09bfe91ca15553037bb310609ddc70e0e1140927802150b728b1c28c2996","observation_id":"2ddba138-6449-4a73-a96c-46fe659847aa","resolution":{"observed_at":"2026-08-07T15:38:45.235768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.332966Z","title":"Multi-view feature fusion and visual prompt for remote sensing image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.332966Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:16b6a7505853a0c84ec683ddba5c5ce50d11b48011038e57c9f68a2816060195","observation_id":"962fc3d3-1b70-4987-8969-f0e56291152f","resolution":{"observed_at":"2026-08-07T15:38:45.332966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.468804Z","title":"Vision- language models for zero-shot classification of remote sensing images,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.468804Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:473b6c118e66aaed63c491b9a06c1c11bdc563d4c1148ca99610d38d6e12a3c6","observation_id":"34fe4cf5-db90-46af-aa20-a628f1c79d1a","resolution":{"observed_at":"2026-08-07T15:38:45.468804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.646020Z","title":"Detecting cloud presence in satellite images using the rgb-based clip vision-language model,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.646020Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:1193c8bb1e896920a21feb56ae446cafbfb3e6aa3e6e37deb09030653842cf3c","observation_id":"4591f1d6-c747-4afb-a06f-509911022cc7","resolution":{"observed_at":"2026-08-07T15:38:45.646020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.809267Z","title":"Chatearthnet: a global- scale image-text dataset empowering vision-language geo-foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.809267Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:507a4bf99d9902a3ac410e7533d9d86c5bc14c6e88c3853ff4ee8c6208d0dae8","observation_id":"8fa01820-6df0-413f-8c19-17a775d5a98f","resolution":{"observed_at":"2026-08-07T15:38:45.809267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:45.933746Z","title":"Bi-modal transformer-based approach for visual question answering in remote sensing imagery,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:45.933746Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:955d59941f5f7e1badd32ad31c35accf53dc68147a4491eb7b5f0ff0b74fa8bc","observation_id":"9e13967b-f96d-4e1f-8a9b-3c50c95f9267","resolution":{"observed_at":"2026-08-07T15:38:45.933746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.052643Z","title":"Popeye: A unified visual-language model for multi-source ship detection from remote sensing imagery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.052643Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:9bb58fad9a1583409c8d4ccc64de79527308a0e004c3736f7f6f7e8c4f59c606","observation_id":"e010fd27-cd52-4b66-9022-b49a6f7b66c6","resolution":{"observed_at":"2026-08-07T15:38:46.052643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.198276Z","title":"Deep semantic-visual alignment for zero-shot remote sensing image scene classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.198276Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6dab81dcca14abde18edee74be2f7852be32d6d642aa0f2b85c9b3a2b3e13870","observation_id":"f5d64ec1-2d08-49b0-9e2b-c884b2e27c38","resolution":{"observed_at":"2026-08-07T15:38:46.198276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05766","last_updated":"2024-09-21T09:50:33Z","snapshot_observed_at":"2026-08-12T23:47:00.962571Z","submitted_at":"2024-06-09T12:41:14Z","title":"Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View","version":2},"cited_work":{"arxiv_id":"2406.05766","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05766","snapshot_observed_at":"2026-08-07T15:39:23.060219Z","title":"Set-CLIP: Exploring Aligned Semantic From Low-Alignment Multimodal Data Through A Distribution View","venue":"cs.LG","work_id":"434f7b15-a933-4d1e-8a28-8372a5ffb18f","year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.336526Z"},"links":{"cited_paper":"/paper/2406.05766","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:e9dc7804c77d524a064a6c0905993b623910d35c9931629a6bc05e8593e1c4d1","observation_id":"50a34e47-9fbc-4ba5-b65b-6eb24e18de1f","resolution":{"observed_at":"2026-08-07T15:39:23.164372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.502942Z","title":"Segment change model (scm) for unsupervised change detection in vhr remote sensing images: a case study of buildings,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.502942Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c0f85b865fcbd7f57aee55a8b635b65ce11b161cb211267f148ae3a78b2f7f57","observation_id":"069b0439-49c8-441e-9d6e-9e43c7c134ad","resolution":{"observed_at":"2026-08-07T15:38:46.502942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.641308Z","title":"A new learning paradigm for foundation model-based remote-sensing change detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.641308Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:7bba99cafb173e6b2908ab8b968be1564c476d4679fc77e46f6912060f46bfb2","observation_id":"dc1962f1-fe34-4f97-86b0-e2b6d62e2dde","resolution":{"observed_at":"2026-08-07T15:38:46.641308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:46.750482Z","title":"Vlca: vision-language aligning model with cross-modal attention for bilingual remote sensing image captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.750482Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c4693a86b9fd7ec940ec6571ec47558c3ce66780d1d24a1ee449da5ae4e0f982","observation_id":"2cc03d95-bcea-4853-aaac-ce83c706e8de","resolution":{"observed_at":"2026-08-07T15:38:46.750482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12479","last_updated":"2024-06-18T10:34:28Z","snapshot_observed_at":"2026-08-12T23:40:14.059603Z","submitted_at":"2024-06-18T10:34:28Z","title":"RS-GPT4V: A Unified Multimodal Instruction-Following Dataset for Remote Sensing Image Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12479","snapshot_observed_at":"2026-08-07T15:38:46.888234Z","title":"Rs-gpt4v: A unified multimodal instruction-following dataset for remote sensing image understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:46.888234Z"},"links":{"cited_paper":"/paper/2406.12479","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:27ec5254144f7406112d5a2b071a57f2e7b0e4fe1f472dca87011963a9324166","observation_id":"1c232cf3-5270-4340-81cf-8ad1dd03c2ae","resolution":{"observed_at":"2026-08-07T15:38:46.888234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.040530Z","title":"Luojiahog: A hierarchy oriented geo-aware image caption dataset for remote sensing image–text retrieval,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.040530Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ef0823264cf3ed19511a889d309d7eb5a6d336a52fb3daa8854d29766d5a7700","observation_id":"0ddae0ae-3251-4bcb-a412-0779d4648ae9","resolution":{"observed_at":"2026-08-07T15:38:47.040530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11619","last_updated":"2023-04-23T11:23:05Z","snapshot_observed_at":"2026-08-14T14:15:22.128898Z","submitted_at":"2023-04-23T11:23:05Z","title":"SATIN: A Multi-Task Metadataset for Classifying Satellite Imagery using Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11619","snapshot_observed_at":"2026-08-07T15:38:47.152096Z","title":"Satin: A multi-task meta- dataset for classifying satellite imagery using vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.152096Z"},"links":{"cited_paper":"/paper/2304.11619","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6799e48dd051b084dcfdb43c2bef91c2930ca2e031f1e57d52dcbb753b4f373e","observation_id":"2df3449b-f06b-4bfa-9f43-30aabb12c296","resolution":{"observed_at":"2026-08-07T15:38:47.152096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.311652Z","title":"Rsvg: Exploring data and models for visual grounding on remote sensing data,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.311652Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:caa14f4fc854c6088ae09a6cf82ea20daa883c729af9c1c7c1b6c196008354c7","observation_id":"5f9f3b49-df9d-41cb-84d2-ad5c436dd404","resolution":{"observed_at":"2026-08-07T15:38:47.311652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.462892Z","title":"Good at captioning bad at counting: Bench- marking gpt-4v on earth observation data,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.462892Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:3598a654d4c3d72b00961a1e754f92a0181993d09ea12b0fea6a68877b92d216","observation_id":"7fca31d7-7a71-41d2-8110-f68cd29bebeb","resolution":{"observed_at":"2026-08-07T15:38:47.462892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.610998Z","title":"Satclip: Global, general-purpose location embeddings with satellite imagery,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.610998Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:88132ac8269a30b4fb2628b3098b8b34f320ec52c7da3091e1f271b496d136a3","observation_id":"240f4edb-64b2-4d99-8446-17152f569de6","resolution":{"observed_at":"2026-08-07T15:38:47.610998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.742008Z","title":"GeoCLIP: Clip-inspired alignment between locations and images for effective worldwide geo- localization,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.742008Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:cb208580edd1009911d58163a0b7397c7bf8dd3a90791faead9fee99f7141ca1","observation_id":"c9e19baa-94ff-4442-b24d-75d4b146fd5b","resolution":{"observed_at":"2026-08-07T15:38:47.742008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.857469Z","title":"Csp: Self-supervised contrastive spatial pre-training for geospatial-visual representations,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.857469Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d2a0d0f0ca0242369ff38196317480d51453a98049eced97793c254a1e1b9dbc","observation_id":"b222e3fc-c3be-4be3-9492-1c3235c67cf6","resolution":{"observed_at":"2026-08-07T15:38:47.857469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:47.942387Z","title":"Diffusionsat: A generative foundation model for satellite imagery,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:47.942387Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:8d30dc13a865d8c9bc2cb9885bc245a3b77e5fa0029b684a48e45567943f195d","observation_id":"5d3d29a9-925a-4789-a9e6-abb55d56fc23","resolution":{"observed_at":"2026-08-07T15:38:47.942387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.144141Z","title":"Crs-diff: Controllable remote sensing image generation with diffusion model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.144141Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:4e9931ca9ec4bce7cf8744171925d8eee097f2b107d2ddea3fc8e45b55a9d6d8","observation_id":"d0624a66-64f5-40d7-a41d-597b684d9ab1","resolution":{"observed_at":"2026-08-07T15:38:48.144141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.276207Z","title":"Practical techniques for vision- language segmentation model in remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.276207Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c90db2e5bbbbe6adfd0e19dc97ccca84954bbbf99b613b84265c843b68097cfd","observation_id":"431fd769-708a-4b4e-a89a-6f1e0aa122f9","resolution":{"observed_at":"2026-08-07T15:38:48.276207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.421970Z","title":"Text2seg: Zero-shot remote sensing image semantic segmentation via text-guided visual foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.421970Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d005cf2f908954dbbcd451d0bc23a086032f8325c5c79f565000ddaf43ab6c66","observation_id":"023dc923-3566-4b26-b689-2de62c972118","resolution":{"observed_at":"2026-08-07T15:38:48.421970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.564888Z","title":"A decoupling paradigm with prompt learning for remote sensing image change captioning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.564888Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:3cc8ae11cf5589a56b49ca7033815d743582ec8793b7b34e8941d5c33a326d33","observation_id":"261f59c7-267d-4a7e-96e2-a68940a51f15","resolution":{"observed_at":"2026-08-07T15:38:48.564888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.738237Z","title":"Bootstrapping interactive image-text alignment for remote sensing image captioning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.738237Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:abf304f133555e647d3c1dad8962efb62e737fb50f856be7854b9ee8ca713301","observation_id":"97d41679-a69e-41ca-81bb-4d27abffb58a","resolution":{"observed_at":"2026-08-07T15:38:48.738237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:48.945772Z","title":"Text- guided diverse image synthesis for long-tailed remote sensing object classification,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:48.945772Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:4bda3353835e018c98f2a5bdfbce2a9fedf3c5cfc9c41d301aaae3d2f599aee5","observation_id":"92996c50-923f-42e7-8516-296d00d0c1d0","resolution":{"observed_at":"2026-08-07T15:38:48.945772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.158228Z","title":"Object detection in aerial images: A large-scale benchmark and challenges,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.158228Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:44eee36169d6f6dfe202c844ed31d503731b9941e5d05010bc93efab878ad030","observation_id":"16f4bd2c-0ffd-4064-b3b6-752a3595ac07","resolution":{"observed_at":"2026-08-07T15:38:49.158228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.305788Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.305788Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:42197fa1ccf3c86a1e2194c20f697d1ff2918df6a26f8b63faa1bfe9f0c09592","observation_id":"977c3415-671e-43ac-87f8-48948426a08b","resolution":{"observed_at":"2026-08-07T15:38:49.305788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.424549Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.424549Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:c9a7644205a1a1fc2fc9fb5c172fc4e24173dec38bf6ac0109f0600baa02682f","observation_id":"2865e876-251a-47f7-8822-0dba7d917d7c","resolution":{"observed_at":"2026-08-07T15:38:49.424549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.623916Z","title":"Learning to rank question answer pairs with holographic dual lstm architecture,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.623916Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ae0313823daa3e2e358473e7dcf77f3a72b26fc4ab21ef6e48af6eaec5805ee5","observation_id":"dd525767-374d-41b4-90ae-70d878c23db1","resolution":{"observed_at":"2026-08-07T15:38:49.623916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.777690Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.777690Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:a53d132124544bdfe89fe5a65d9e15ce3d6eb7e9cc21c72e9f090bc7620951d9","observation_id":"83d2cb6a-951f-4d5b-a5ad-3acb6ec24634","resolution":{"observed_at":"2026-08-07T15:38:49.777690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.897162Z","title":"Lora: Low-rank adaptation of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.897162Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:8bb5693562d12d1a7a32b1f2f0273bb7e01d546feb74a506ea8f6fd1f8515d4e","observation_id":"9c5386c5-479e-4fd6-b4ee-5584bb0148ef","resolution":{"observed_at":"2026-08-07T15:38:49.897162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:49.957361Z","title":"Object detection in optical remote sensing images: A survey and a new benchmark,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:49.957361Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:2699515e337b56140688c69990bc8f5f2e35e72e3e8fab1f7d649984a07a9b28","observation_id":"e2d88973-a7c8-495d-926d-da6955896f03","resolution":{"observed_at":"2026-08-07T15:38:49.957361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.035586Z","title":"Fair1m: A benchmark dataset for fine-grained object recognition in high-resolution remote sensing imagery,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.035586Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:366f72b8eb8e92da9707aa576b7f25c0520968aadb27044a85270fb424f5b2e1","observation_id":"c585a361-a717-4c94-a5f9-7885947955af","resolution":{"observed_at":"2026-08-07T15:38:50.035586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.099116Z","title":"Remote sensing image scene classifi- cation: Benchmark and state of the art,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.099116Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:16dbe49bede1f6a41c19f3e91a8ee6a8705a7b2352d1d4f4b79d7abc84c42804","observation_id":"1929c793-e415-4b4d-9a32-587ad25b5520","resolution":{"observed_at":"2026-08-07T15:38:50.099116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.178928Z","title":"Rsvqa: Visual question answering for remote sensing data,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.178928Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:850609484bf66fbb10aa925f3005b5df36106f17e92583db3a217fc1ed353870","observation_id":"0a3af32e-b7a6-4bd1-a80a-7a6cdc3a5518","resolution":{"observed_at":"2026-08-07T15:38:50.178928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.251075Z","title":"Floodnet: A high resolution aerial imagery dataset for post flood scene understanding,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.251075Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d6fd4258773835ecf4c18711c5019c218a44ab547a52ce79b762f62d0d098d9d","observation_id":"7dc08abe-90cb-4c6b-b0d0-77e74f7a23d9","resolution":{"observed_at":"2026-08-07T15:38:50.251075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.331731Z","title":"Eva: Exploring the limits of masked visual representation learning at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.331731Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:a5a3b1cf2aba84fa5c1a61cde01c943292d720c37ea8aed6f53d0943ec230392","observation_id":"5500eab6-e1e9-4c38-9631-29edbf09d0df","resolution":{"observed_at":"2026-08-07T15:38:50.331731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T15:38:50.389463Z","title":"Llama 2: Open foundation and fine-tuned chat models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.389463Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6f97905f16c0dac0f0b11243be3ab5a209ac72cc4409445771d5325c8b120bbd","observation_id":"1c4f9e10-9e25-444d-86ff-83b58f8829a4","resolution":{"observed_at":"2026-08-07T15:38:50.389463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T15:38:50.452910Z","title":"Llama: Open and efficient foundation language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.452910Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:8b9b4472c989a0f458d3105e6bc4e84e02cd6fee8d0a328e899334adb7652d1c","observation_id":"d4b0ffc7-3a98-4cb9-96ee-0dd05d2b16e0","resolution":{"observed_at":"2026-08-07T15:38:50.452910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T15:38:50.540598Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.540598Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:be5d88556f496f4518c60738e3ad9797636d54f1832a7770c2347c309ad2537f","observation_id":"c88bc01b-3d2c-4893-8763-3df3bf9063a1","resolution":{"observed_at":"2026-08-07T15:38:50.540598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.620624Z","title":"Exploring models and data for remote sensing image caption generation,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.620624Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:13eb4874b4e560fe94cb2bafc2c3b304a25ceea29ceff76ed04f2d3ed56d5ce1","observation_id":"31a8632f-e268-4e83-93ab-9ab05bc6b133","resolution":{"observed_at":"2026-08-07T15:38:50.620624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.727487Z","title":"Exploring a fine-grained multiscale method for cross-modal remote sensing image retrieval,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.727487Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:cf8bb90aaf247f8a301d23a9a108271c020b1bd12b55a80fc6ab6cf79ef7c258","observation_id":"1440f466-6029-4b44-b24c-01920da4a6d2","resolution":{"observed_at":"2026-08-07T15:38:50.727487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:50.886595Z","title":"Deep semantic understanding of high resolution remote sensing image,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:50.886595Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:faa23c9a2f8c1fe6b004cc85e20b0d9dd3129cebc46e269f9fd7e05a62b4f491","observation_id":"89e8dec0-2306-41a3-8e16-e1017e737596","resolution":{"observed_at":"2026-08-07T15:38:50.886595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.023865Z","title":"Nwpu- captions dataset and mlca-net for remote sensing image captioning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.023865Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:cca0d5aaa4af8fe3fb28a4fb316caf067d6bf50036e24b2ba41e01f4b04d7035","observation_id":"d18e7c63-ea7e-4c00-8f97-e88ef95621ac","resolution":{"observed_at":"2026-08-07T15:38:51.023865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.137450Z","title":"Capera: Captioning events in aerial videos,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.137450Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:9600d3e68d57cf648bd0916d2885890d83268e1e158c8cd892471cb0fad67579","observation_id":"7f3341c5-52cf-46e0-8ea0-0256fed5e53e","resolution":{"observed_at":"2026-08-07T15:38:51.137450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.255800Z","title":"Mutual attention inception network for remote sensing visual question answering,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.255800Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:15c4d79d39c3885f72742e170907ed91705e3ff817d5230c805720075fd0652d","observation_id":"25f376d8-5c9c-435d-bc12-7a7ed19908a3","resolution":{"observed_at":"2026-08-07T15:38:51.255800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.389367Z","title":"Visual grounding in remote sensing images,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.389367Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:e16a3ac78d8beb6a2785e9915779806695d41536d213b1472cb652c052550c6f","observation_id":"b6989cdd-a7e0-46fe-a1e1-60f529be1bc9","resolution":{"observed_at":"2026-08-07T15:38:51.389367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.485572Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.485572Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:326295bb1f1fa94c1c7e882b6e23023c43b90c8e40e551a0e0a626f0702d7129","observation_id":"a2e78898-96b9-4583-a0a5-d2aba730a934","resolution":{"observed_at":"2026-08-07T15:38:51.485572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.603773Z","title":"Multistep question-driven visual question answering for remote sensing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.603773Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:4f0d7c916baf7d27d6c391399a4391aac9b1d8e13da0670bb5a6719aa76a9604","observation_id":"9d34bc30-b6d2-4f1d-aebf-8a53983c8299","resolution":{"observed_at":"2026-08-07T15:38:51.603773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.743120Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.743120Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:0ad24a2b0ced30dc009b621bbc9cd51148ce407c235e3daa0c345306e56ff1d8","observation_id":"ccf42811-0ac5-4cd3-8ef2-9250060d525c","resolution":{"observed_at":"2026-08-07T15:38:51.743120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.805151Z","title":"Bag-of-visual-words and spatial extensions for land-use classification,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.805151Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:ebd04e825a752d34a996c6a2022efa7109716a023ec610da218492880a4096d1","observation_id":"3ea23881-6c26-41c5-9df3-ad95e3888724","resolution":{"observed_at":"2026-08-07T15:38:51.805151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:51.888925Z","title":"Satellite image classification via two-layer sparse coding with biased image representation,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:51.888925Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6c3c8d0a82d2084fd6d42bfb16067fffb5295b1cf3b0cf149f8f60ff5d8a8e92","observation_id":"58fa19a6-1021-4da3-bed6-8d4e35b57de7","resolution":{"observed_at":"2026-08-07T15:38:51.888925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.018569Z","title":"Deep learning based feature selection for remote sensing scene classification,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.018569Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b62bd44d5499b1cfdf39f3807ffc47b8183b7998660b8bbdaff6bc8267e2d1d2","observation_id":"7c38ff30-6b01-4a80-b7e1-d6e732b0cb26","resolution":{"observed_at":"2026-08-07T15:38:52.018569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.137785Z","title":"A public dataset for ship classification in remote sensing images,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.137785Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:36ef1e5792870f0171ab40436a773b72bfb983bd42986ee3750f3b173f869db4","observation_id":"10335210-ebb5-4d98-9f17-e7c17fa4500d","resolution":{"observed_at":"2026-08-07T15:38:52.137785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.252457Z","title":"A public dataset for fine-grained ship classification in optical remote sensing images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.252457Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b38f67efc27a00577394fe943161340adfac6f222b6d1b651d9d64e52100d5bd","observation_id":"feb5e806-9622-4061-ad42-36407c2f244d","resolution":{"observed_at":"2026-08-07T15:38:52.252457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.381176Z","title":"Rotation-insensitive and context- augmented object detection in remote sensing images,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.381176Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:f78367dea1f847e3e0ee1adaeab721b1ceabb13bd74884c876667e765c171a82","observation_id":"0d191b95-75dc-4fbe-845b-24ce179a9a42","resolution":{"observed_at":"2026-08-07T15:38:52.381176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.474659Z","title":"Hierarchical and robust convolutional neural network for very high-resolution remote sensing object detection,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.474659Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:b41cfd2b3323d0275c273099b6b58f6ef4e7794c3cff8a8664fd026d1d52d8ef","observation_id":"987be9d5-082a-450f-a7de-9a3295fa2199","resolution":{"observed_at":"2026-08-07T15:38:52.474659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.600351Z","title":"Orientation robust object detection in aerial images using deep convolutional neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.600351Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:df4358c9fd38221dfdd7afcd216670a015e65319a7216ac26bbe8cec285f3675","observation_id":"38664c2c-4e0d-44bc-bc9f-1bfaab473bec","resolution":{"observed_at":"2026-08-07T15:38:52.600351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.772576Z","title":"Detection and tracking meet drones challenge,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.772576Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:3ae36559023293a02e6ffc68cd959e808c22248130fc35be5c817a92c445d011","observation_id":"81d5eaa9-da89-4d24-89c5-e57d9c5408c1","resolution":{"observed_at":"2026-08-07T15:38:52.772576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:52.902513Z","title":"Sar ship detection dataset (ssdd): Official release and comprehensive data analysis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:52.902513Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:9bf3355233271ad959e1278ec7eee630d13f2c23fc64aa47daca9adad74de3ff","observation_id":"d30c5c91-1183-494a-82a4-8f749811cec9","resolution":{"observed_at":"2026-08-07T15:38:52.902513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.061271Z","title":"Hit-uav: A high-altitude infrared thermal dataset for unmanned aerial vehicle- based object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.061271Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:353531b69909590bcc079d3a8dbb50624724b0043e3805ea4d63feb802e3317c","observation_id":"d759d29c-a0ae-45d9-881c-8c582e48f16b","resolution":{"observed_at":"2026-08-07T15:38:53.061271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.201727Z","title":"Sea-shipping,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.201727Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:97e48b59c962d227d9bc09caa513fa94152bfca82a8c1c6af65ef31088d442f5","observation_id":"208bc1da-2418-4272-9cf4-39f93be24714","resolution":{"observed_at":"2026-08-07T15:38:53.201727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.334467Z","title":"Infrared-security,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.334467Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:72e55f34fb9bfd3862941be6a879dac00206dafab594d467b62483959f34d5f3","observation_id":"799f5ea0-37b9-4163-8f3e-e1e650e6c49d","resolution":{"observed_at":"2026-08-07T15:38:53.334467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.458005Z","title":"Aerial-mancar,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.458005Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:0497e871fc6a7f13e9792011074d242d2f0dabef7dc51c9a624eca5210bfc930","observation_id":"22d82886-fbba-4fa1-aa18-76e1ab140edd","resolution":{"observed_at":"2026-08-07T15:38:53.458005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.615236Z","title":"Double-light-vehicle,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.615236Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:4fdb620bdfa8708e2e83af9c0af0a444a000cf27f30aa96629f7b08ff4634553","observation_id":"934f876c-0fa5-459f-9829-7b47cf2efbb0","resolution":{"observed_at":"2026-08-07T15:38:53.615236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.767902Z","title":"Oceanic-ship,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.767902Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:864f09fb4be407a408fa649ab48c6b3883f87f305b764fb62dd804aa867de5e9","observation_id":"c9252e02-6cb8-4857-a81d-dabf6f28d5f6","resolution":{"observed_at":"2026-08-07T15:38:53.767902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.856194Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.856194Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:a7afa62891b13fe26cc673d93c90a8b6bcc2f6952257fc0b3924ad550061abc3","observation_id":"bd39e153-1de2-4451-b5bf-85dd1427fe7e","resolution":{"observed_at":"2026-08-07T15:38:53.856194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:53.940975Z","title":"A novel svm-based decoder for remote sensing image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:53.940975Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:cdfc779d3ed78cfe061c42481cde689915780b7cff44976e02278df0a6f16adf","observation_id":"8d669b70-2684-4702-98cd-2f6004dbf9cc","resolution":{"observed_at":"2026-08-07T15:38:53.940975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.042866Z","title":"Star: A first- ever dataset and a large-scale benchmark for scene graph generation in large-size satellite imagery,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.042866Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:5de834c9fd92174d29b2da5c3eb696699eb265dcf820bea8e2d35eb4fe8cf9ba","observation_id":"f94161d5-5c71-4a9e-a1f3-0b29eebc6008","resolution":{"observed_at":"2026-08-07T15:38:54.042866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.193358Z","title":"Fine-grained recognition for oriented ship against complex scenes in optical remote sensing images,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.193358Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:202b3b23ff88b5fffd7184a5bf3f6a1b4d34a8756d9130e511c1db1c4f981ed0","observation_id":"0f6ab84d-fb29-4562-8e98-555a0e36d4b6","resolution":{"observed_at":"2026-08-07T15:38:54.193358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.375287Z","title":"Hrsid: A high-resolution sar images dataset for ship detection and instance segmentation,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.375287Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:74e5be721bcf5bd666f19422438c9c83838f1202639015e142000b3671c6098c","observation_id":"12e4f184-fb94-4dd7-a226-7c059ac8fdb4","resolution":{"observed_at":"2026-08-07T15:38:54.375287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.541073Z","title":"Deepsat: a learning framework for satellite imagery,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.541073Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:00aba9c5ba1c96def93ec1b72cb39f0cb3d4009a148973eec8a4b7c6fbfc0882","observation_id":"9767e98b-45c8-4f16-bb92-16656e945f49","resolution":{"observed_at":"2026-08-07T15:38:54.541073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.677808Z","title":"Nasc-tg2: Natural scene classification with tiangong-2 remotely sensed imagery,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.677808Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:d9ea93dc021b70f0cdc053741c7be7a240211aa05edad1299899ae13f2cfbf15","observation_id":"092404e3-5ee1-4800-9439-a696adec9209","resolution":{"observed_at":"2026-08-07T15:38:54.677808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.847291Z","title":"Feature significance-based multibag- of-visual-words model for remote sensing image scene classification,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.847291Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:0f0e977b92e99610677c14167acc928f2b947e2fb6a4000d01f06c39d2e8d333","observation_id":"24ddc95e-49e5-4702-afdd-33cfdf9e1ce2","resolution":{"observed_at":"2026-08-07T15:38:54.847291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:54.995650Z","title":"Dirichlet-derived multiple topic scene classification model for high spatial resolution remote sensing imagery,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:54.995650Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:79ac459f38502467832187b051e3bd687e227cbd1cec472308dae121c965730e","observation_id":"6b49a768-8919-4179-afc5-6c7c478e92c9","resolution":{"observed_at":"2026-08-07T15:38:54.995650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.164443Z","title":"Patternnet: A benchmark dataset for performance evaluation of remote sensing image retrieval,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.164443Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:342d3bfed8399a893e8818978aca5c4b7618af6b458867308b8cdc64d04cc08e","observation_id":"25deeedd-14ab-498b-a3d1-7a4f4784a03f","resolution":{"observed_at":"2026-08-07T15:38:55.164443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.256524Z","title":"Accurate object localization in remote sensing images based on convolutional neural networks,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.256524Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:57348d6b8cfcdef153b97ca430df8a0d2b993d8decbfbcdbcb61ded692f61e70","observation_id":"3a7e90a7-a976-4e2f-ba1d-b185f8b532f6","resolution":{"observed_at":"2026-08-07T15:38:55.256524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.326585Z","title":"Land-cover classification with high-resolution remote sensing images using transferable deep models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.326585Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:6ac664e9c01323b13bf3f8a623de51f1db6897e60c152ca73b33fb8c0fb0e4f4","observation_id":"d7d6f5c8-e6fa-446a-b1cc-fb89c5014327","resolution":{"observed_at":"2026-08-07T15:38:55.326585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.387112Z","title":"Scene classification with recurrent attention of vhr remote sensing images,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.387112Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:4dc3d365a91b3edd90093a023d488f708e34a9d0a5857b99ac61c53d9d47db56","observation_id":"101371cc-8551-4285-99eb-cec4523d8062","resolution":{"observed_at":"2026-08-07T15:38:55.387112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.503910Z","title":"Clrs: Continual learning benchmark for remote sensing image scene classification,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.503910Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:5c6ce3d62e07767505adaefa324f12b958917b32e0634cd423c182467aaba8b4","observation_id":"3e4482f4-aff9-45e9-b94c-ed82e06fa7af","resolution":{"observed_at":"2026-08-07T15:38:55.503910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:38:55.619271Z","title":"On creating benchmark dataset for aerial image interpreta- tion: Reviews, guidances, and million-aid,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T15:38:55.619271Z"},"links":{"citing_paper":"/paper/2505.14361"},"observation_digest":"sha256:855567c23740232327983f802896f300c33352adf9eea324e972dc12cb20a15f","observation_id":"29b7051a-932f-48f1-8806-dfd06eb16a7c","resolution":{"observed_at":"2026-08-07T15:38:55.619271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14361","last_updated":"2025-05-20T13:47:40Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T20:27:13.425753Z","submitted_at":"2025-05-20T13:47:40Z","title":"Vision-Language Modeling Meets Remote Sensing: Models, Datasets and Perspectives"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":99,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":299},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 100 of 299 outbound references and 1 inbound Pith citation observation for arXiv:2505.14361."}