{"as_of":"2026-08-10T08:04:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e69bbd2486dff36831e315ae62ea0f0d3bcdb09eac05fc5f0085951d3248f45","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:07:36.719119Z","state":"measured"},{"denominator":74,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":74,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:21:05.683216Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T05:27:39.981179Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"cited_work":{"arxiv_id":"2507.16716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16716","snapshot_observed_at":"2026-07-03T05:27:39.981179Z","title":"Enhancing remote sensing vision-language models through mllm and llm-based high-quality image-text dataset generation","venue":null,"work_id":"afb15462-8637-4d13-bca1-3eaabc3ae9dd","year":2025},"citing_paper":{"arxiv_id":"2510.22665","last_updated":"2026-05-15T05:24:29Z","snapshot_observed_at":"2026-07-06T22:34:08.878520Z","submitted_at":"2025-10-26T13:04:50Z","title":"SARVLM: A Vision Language Foundation Model for Semantic Understanding in SAR Imagery","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-21T20:58:23.547519Z"},"links":{"cited_paper":"/paper/2507.16716","citing_paper":"/paper/2510.22665"},"observation_digest":"sha256:411686199d1f2d74ed202c4c94250747c99b3bedf8f1ec312b092aca7498cb73","observation_id":"ad87c5ab-c97f-485a-bc60-f317710a0b24","resolution":{"observed_at":"2026-05-21T21:00:39.069199Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"cited_work":{"arxiv_id":"2507.16716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16716","snapshot_observed_at":"2026-07-03T05:27:39.981179Z","title":"Enhancing remote sensing vision-language models through mllm and llm-based high-quality image-text dataset generation","venue":null,"work_id":"afb15462-8637-4d13-bca1-3eaabc3ae9dd","year":2025},"citing_paper":{"arxiv_id":"2605.15558","last_updated":"2026-05-15T02:54:43Z","snapshot_observed_at":"2026-07-06T23:26:51.110846Z","submitted_at":"2026-05-15T02:54:43Z","title":"Text-RSIR: A Text-Guided Framework for Efficient Remote Sensing Image Transmission and Reconstruction","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-19T19:59:48.949689Z"},"links":{"cited_paper":"/paper/2507.16716","citing_paper":"/paper/2605.15558"},"observation_digest":"sha256:e1095e59254e8dcb482f706cc3bce7b924309fcea31ab36a33b10bc78d206436","observation_id":"a688868a-95e4-474c-af29-dc3b48572498","resolution":{"observed_at":"2026-05-19T20:02:44.850390Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"cited_work":{"arxiv_id":"2507.16716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.16716","snapshot_observed_at":"2026-07-03T05:27:39.981179Z","title":"Enhancing remote sensing vision-language models through mllm and llm-based high-quality image-text dataset generation","venue":null,"work_id":"afb15462-8637-4d13-bca1-3eaabc3ae9dd","year":2025},"citing_paper":{"arxiv_id":"2606.10819","last_updated":"2026-06-09T13:01:51Z","snapshot_observed_at":"2026-07-06T23:49:56.404171Z","submitted_at":"2026-06-09T13:01:51Z","title":"Earth-OneVision: Extending Remote Sensing Multimodal Large Language Models to More Sensor Modalities and Tasks","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-27T13:16:12.768793Z"},"links":{"cited_paper":"/paper/2507.16716","citing_paper":"/paper/2606.10819"},"observation_digest":"sha256:27ad3a515792d4db11d096bea0559217b430be1447c1163622b723efce3204d8","observation_id":"845c2058-bf22-452e-9da9-5916dbfac331","resolution":{"observed_at":"2026-07-03T05:27:39.982689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16716","snapshot_observed_at":"2026-07-13T01:59:27.974045Z","title":"Enhancing remote sensing vision-language models through mllm and llm-based high-quality image-text dataset generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09583","last_updated":"2026-07-10T16:33:05Z","snapshot_observed_at":"2026-08-07T01:25:01.289313Z","submitted_at":"2026-07-10T16:33:05Z","title":"Promptable Concept Segmentation from Above: Evaluating SAM 3's Zero-Shot and One-Shot Capabilities in Remote Sensing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-13T01:59:27.974045Z"},"links":{"cited_paper":"/paper/2507.16716","citing_paper":"/paper/2607.09583"},"observation_digest":"sha256:88abec9013d6932d9bcf9cf095c1f6909cd07aabf41630409a29b745431a6274","observation_id":"413cc070-4f9d-4d42-9fac-5912104cc4e3","resolution":{"observed_at":"2026-07-13T01:59:27.974045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16716","snapshot_observed_at":"2026-08-01T10:21:05.683216Z","title":"arXiv preprint arXiv:2507.16716 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20284","last_updated":"2026-07-22T15:30:08Z","snapshot_observed_at":"2026-08-09T18:33:19.700255Z","submitted_at":"2026-07-22T15:30:08Z","title":"Multimodal Large Language Models for Remote Sensing Image Understanding: Domain-Specific or General-Purpose?","version":1},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-08-01T10:21:05.683216Z"},"links":{"cited_paper":"/paper/2507.16716","citing_paper":"/paper/2607.20284"},"observation_digest":"sha256:cded6208f59f90f4708555473a775abaeb9253824032c20f966521274f4474cc","observation_id":"4d2f9e03-9bd0-4dd7-937b-356e2d925030","resolution":{"observed_at":"2026-08-01T10:21:05.683216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.16716/citation-record","integrity":"/paper/2507.16716/integrity","json":"/paper/2507.16716/citation-record.json","paper":"/paper/2507.16716"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:31.071744Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.071744Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:0752dba19b5694f2d6a503f164c6480e713d26915d2fe94f78395b0803a2a03b","observation_id":"e2806d67-64b6-4911-81da-35e16fd7a72c","resolution":{"observed_at":"2026-08-06T15:07:31.071744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:45.089783Z","title":null,"venue":null,"work_id":"d764c2c1-266c-43d7-9609-b7a6b537c6a9","year":2021},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.122878Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:c2b28d90868859d06999e5b49b0ce445e0506ef29e69e14e4f9f774cb3a4ebb0","observation_id":"3019f3c6-92bd-4dd9-a3ef-3dcb089ff482","resolution":{"observed_at":"2026-08-06T15:07:45.137584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05208","last_updated":"2022-03-14T08:53:07Z","snapshot_observed_at":"2026-08-07T07:07:45.501871Z","submitted_at":"2021-10-11T12:17:32Z","title":"Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05208","snapshot_observed_at":"2026-08-06T15:07:31.213119Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.213119Z"},"links":{"cited_paper":"/paper/2110.05208","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:565cd90cc5db55d8bdb11f89d01756d50e416000235327a5c15dabadc5b29616","observation_id":"a9d6ab1f-8d29-4de2-b802-510eeafda76c","resolution":{"observed_at":"2026-08-06T15:07:31.213119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T15:07:31.303382Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.303382Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:cd99f72c7f8cd984893e735533c2b550f59f553eb4cbe0dae13427fb9322d966","observation_id":"7a8c014c-382e-43f9-951c-22a96bef6602","resolution":{"observed_at":"2026-08-06T15:07:31.303382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-06T15:07:31.391534Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.391534Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:10c6a884e0b2a27905388a5a1dc233165bc81fd42265f473aa50819c22a2b923","observation_id":"8c9ccf41-81f7-442a-9f57-cce6a39ec905","resolution":{"observed_at":"2026-08-06T15:07:31.391534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:44.895830Z","title":null,"venue":null,"work_id":"835773c5-7fe6-449a-a325-98b4ca8ef994","year":2022},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.484169Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:a1d3bc0fd2fa599edafee8716851a13bdb475ace15875b7c46c7380cd8a46e86","observation_id":"29d824d2-72f4-4880-abf4-379da2137c6a","resolution":{"observed_at":"2026-08-06T15:07:44.983240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-06T15:07:31.581723Z","title":"Gu, T.-Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.581723Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:e35cea8acc7b9193f59ad5c818f2af769439438a99c42783df30cd304acc3c83","observation_id":"f31d2c5d-d876-4a47-aeca-499d7dd1d79a","resolution":{"observed_at":"2026-08-06T15:07:31.581723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T15:07:31.643197Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.643197Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:b5f2f1b0625e77d9afc90339cdc79bdf981d67e4ad35290b4830d1dd68731f3f","observation_id":"4b2d807e-fe8f-405d-9432-e9dd4bc960fb","resolution":{"observed_at":"2026-08-06T15:07:31.643197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:44.680073Z","title":"Guzhov, F","venue":null,"work_id":"79c3825f-7ad5-4436-9064-d02ea4271435","year":2022},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.721276Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:1902f231c29f029c35c3650a8cc509e3eff1b3fb7c8d23aea2b2828a8dd2f32c","observation_id":"b8b641c1-5144-4cb4-8d91-4ff30c4b3e16","resolution":{"observed_at":"2026-08-06T15:07:44.756793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:44.473999Z","title":"Zhang, Z","venue":null,"work_id":"258ea95a-7b8d-447c-b71a-afa7db50e3aa","year":2022},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.813448Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:00487d55c35ab19199a84c9538c0f8147cf4b4f96c3ef1b0314142922bd4a72e","observation_id":"f41a9961-96eb-4c30-bea4-a2e3c3bb2ea1","resolution":{"observed_at":"2026-08-06T15:07:44.546880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:44.243350Z","title":null,"venue":null,"work_id":"24fc02e7-57f9-4518-9e21-7dc97c27fb0c","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:31.898431Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:648317ff3dc349bb2cec60bc5dce7720a6ccc883885ca65a8094376c0e619958","observation_id":"eef33338-2fcd-4956-a72c-68b423128418","resolution":{"observed_at":"2026-08-06T15:07:44.361197Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-06T15:07:32.007151Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.007151Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:001aad9f77080bad430f77e4f1bb71ecf43d8225db45b8785d33d2915f7985d3","observation_id":"a27b1289-e4f8-44f9-afb6-193e35d6becb","resolution":{"observed_at":"2026-08-06T15:07:32.007151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-06T15:07:32.081476Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.081476Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:7c6da506ceb017110224cc0151b3831583bdfb645aeaa960cdc6950ec37699af","observation_id":"62e063e9-8e0c-4272-9650-6ab3f511cce6","resolution":{"observed_at":"2026-08-06T15:07:32.081476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-08-06T15:07:40.203199Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.09540","snapshot_observed_at":"2026-08-06T15:07:32.156701Z","title":"Abbas, K","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.156701Z"},"links":{"cited_paper":"/paper/2303.09540","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:8684eab04e5ca8f306ea5d90b8bd01bb66d2e4eb1ad363bccb86135608d7cfa5","observation_id":"86f846a9-fb58-4047-9aa5-1a139a4bf6ec","resolution":{"observed_at":"2026-08-06T15:07:32.156701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:44.062785Z","title":"Doveh, A","venue":null,"work_id":"a1cb1be3-49e4-42e5-aa55-10626a268ac9","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.269218Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:e2fe82dc35f3066a20bc034ab170af1ebaa48d137e4e3e6ebd62136d5600beef","observation_id":"c17bb975-54a7-435b-b4f1-2f0c2214e2f8","resolution":{"observed_at":"2026-08-06T15:07:44.134853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:43.862020Z","title":"Barham, A","venue":null,"work_id":"cadff8ad-e8d6-4680-af91-aa1902da23b3","year":2022},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.326428Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:ff0fd0efb0680dec9c18948c72b61844a952c3f19daf14214bcf760ce33389e8","observation_id":"cb002f0b-3314-4303-bba3-99dd465ea32a","resolution":{"observed_at":"2026-08-06T15:07:43.946085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:43.671177Z","title":null,"venue":null,"work_id":"f98b2e9f-8516-4f81-ba7c-29eeaaeb710c","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.408084Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:97cb021fd1afc8c0f58d3a878dec0f67f4b98657fbfddc0e22d7bcf83696aa36","observation_id":"cf3829c2-7d83-4951-9146-66ae920f309b","resolution":{"observed_at":"2026-08-06T15:07:43.754120Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:43.492381Z","title":null,"venue":null,"work_id":"2d0ffce6-b502-4a4a-99f9-4e5a520a8e04","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.478176Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:04e684d6502adc169d7587d0d99c4c1fab35be037f6a014dc0943db32cb4a29b","observation_id":"96ed866d-55eb-4ac4-99cf-8564ea5d0eea","resolution":{"observed_at":"2026-08-06T15:07:43.570887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11300","last_updated":"2024-01-02T14:18:02Z","snapshot_observed_at":"2026-07-06T15:44:27.766505Z","submitted_at":"2023-06-20T05:30:59Z","title":"RS5M and GeoRSCLIP: A Large Scale Vision-Language Dataset and A Large Vision-Language Model for Remote Sensing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11300","snapshot_observed_at":"2026-08-06T15:07:32.575935Z","title":"Zhang, T","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.575935Z"},"links":{"cited_paper":"/paper/2306.11300","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:f56edf25ab397d1c3d1838937aa8deecbe050170e265af6901927d28d622e38b","observation_id":"110fd7b9-844a-4393-b313-32597c7dba4f","resolution":{"observed_at":"2026-08-06T15:07:32.575935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:43.296185Z","title":null,"venue":null,"work_id":"b32f9971-bd65-4795-98f9-97e53d5cd4f2","year":2023},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.658852Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:30f2bde9c8321f870dc6ebbc77807ebcaaee87b34c7362ed12a9228ad9b98b53","observation_id":"b5e327e3-98ae-4d06-b3e6-8a9679e9e056","resolution":{"observed_at":"2026-08-06T15:07:43.382356Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:43.114894Z","title":"Djoufack Basso, Clip-rs: A cross-modal remote sens- ing image retrieval based on clip, a northern virginia case study, Ph.D","venue":null,"work_id":"18b6401e-a407-4427-b08f-1a639e7afc38","year":2022},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.746480Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:32fb09393d9e3fb1859b08339974b572ddf049376ae3849991d8212b106c150a","observation_id":"93ce4775-1446-443f-9774-75b34a954438","resolution":{"observed_at":"2026-08-06T15:07:43.198979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:42.961310Z","title":null,"venue":null,"work_id":"f733dcf5-6dc6-477e-8b39-8879ed271a50","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.822757Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:23ad47032a2ff3ed873ff85b02358004de1bf40b68690c3831365527539f7f11","observation_id":"7c77d13b-af35-40ef-a0f2-b47fa981f50a","resolution":{"observed_at":"2026-08-06T15:07:43.019575Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-05T09:46:05.780158Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-06T15:07:32.895752Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.895752Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:90259be351016b87b896227dd652040651dbd592e750059402af31e3cb72b887","observation_id":"88f2835b-5272-4196-83ea-6c24caab3b65","resolution":{"observed_at":"2026-08-06T15:07:32.895752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09712","last_updated":"2024-01-18T04:10:20Z","snapshot_observed_at":"2026-08-09T18:33:23.224974Z","submitted_at":"2024-01-18T04:10:20Z","title":"SkyEyeGPT: Unifying Remote Sensing Vision-Language Tasks via Instruction Tuning with Large Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09712","snapshot_observed_at":"2026-08-06T15:07:32.957953Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:32.957953Z"},"links":{"cited_paper":"/paper/2401.09712","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:bea5c264a60b6a5a20cd20a018466a5306778911f83d542da52b236664d797b1","observation_id":"8c20c456-09d7-4605-89a6-7cf0ff664e8d","resolution":{"observed_at":"2026-08-06T15:07:32.957953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:42.767029Z","title":"Goyal, P","venue":null,"work_id":"18698878-0739-4348-86f1-3e3d3c082f6c","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.049180Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:6e71da3427785abeb5d552ec251ae3a3a447c9d641e523d8d82c54dec9b85b75","observation_id":"7d6495d9-a38b-4755-bf58-d828f63d00dd","resolution":{"observed_at":"2026-08-06T15:07:42.875544Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:42.540301Z","title":null,"venue":null,"work_id":"5ff3f47e-7e1d-49ea-bfc4-a28fd6a5681c","year":2017},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.127918Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:14414ffaaa28db14e432d6b3ac16b3829ed5a6b4838d55cd1855f853313fcc62","observation_id":"75051ead-b0f2-4a3d-b10d-a6e5699e43c4","resolution":{"observed_at":"2026-08-06T15:07:42.658881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:42.392557Z","title":"Urbanek, F","venue":null,"work_id":"ea1956b4-85bf-421b-832a-dde2ef30346d","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.211766Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:14ce2f0a2aed05b99d24a649df0fefedcb3e951332d8a166b564f8b8e854cd2e","observation_id":"14586e91-342f-48d9-b683-c7e61f2fe498","resolution":{"observed_at":"2026-08-06T15:07:42.469658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:42.236132Z","title":null,"venue":null,"work_id":"2be5c99d-8a2d-483c-8cdd-d40a2d6c54ce","year":2018},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.321211Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:0aa92ec5da11c427bcd674a2e31ff037f1ab148c2378f2e58066eb4a15da6940","observation_id":"94e35f08-5ba2-4f15-b849-4ec187ca6933","resolution":{"observed_at":"2026-08-06T15:07:42.287567Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:42.070575Z","title":null,"venue":null,"work_id":"62e2a356-d811-40b9-ad2f-73d6d42673e8","year":2017},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.384366Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:20ec850dd7ccd889851cd118e6057c3d574ba027070bc9a0dbad4cafb1033feb","observation_id":"954217d9-196f-4d2a-828e-636b4d65180f","resolution":{"observed_at":"2026-08-06T15:07:42.160207Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11325","last_updated":"2024-02-26T20:29:22Z","snapshot_observed_at":"2026-07-06T17:31:37.574049Z","submitted_at":"2024-02-17T16:38:40Z","title":"ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models","version":2},"cited_work":{"arxiv_id":"2402.11325","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.11325","snapshot_observed_at":"2026-08-06T15:07:37.791798Z","title":"ChatEarthNet: A Global-Scale Image-Text Dataset Empowering Vision-Language Geo-Foundation Models","venue":"cs.CV","work_id":"f1fd0e1a-70b7-4026-8e27-3711a82da6c3","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.491935Z"},"links":{"cited_paper":"/paper/2402.11325","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:7da5dbc342f72027d839f34ab3fa243ab80cd07f7aad8ded60666b5b7d5593b0","observation_id":"4f1da913-ba2d-4fa8-afa2-1e25e0606f2c","resolution":{"observed_at":"2026-08-06T15:07:37.894089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:41.887828Z","title":null,"venue":null,"work_id":"a1f726da-b537-44ee-b2c6-8b4b739cd6aa","year":2025},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.578500Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:901260be96b5c7748ea5171a8db0f980ad26cd8eae55efcb2731a3ee33ae3333","observation_id":"76988e93-2368-47fa-97b6-1432262c3646","resolution":{"observed_at":"2026-08-06T15:07:41.972271Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:41.700294Z","title":"Grubinger, P","venue":null,"work_id":"baff1fdf-e2fd-4c59-a6e2-9dac905c8ffb","year":2006},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.642950Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:d8f6c26fa8ccb99744ae99241ba485af1c1b77ebc8db71c0a5e18fe46432660d","observation_id":"0730433b-393e-4297-b842-fa15c1255689","resolution":{"observed_at":"2026-08-06T15:07:41.788871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:41.495637Z","title":"Rashtchian, P","venue":null,"work_id":"30c7b111-e376-4dcd-983b-29047ef685a9","year":2010},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.711589Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:e1d9b654cb62e5ee0f543ea129d83fbb2d310709a3f01cb3e0ec37ddfa23551a","observation_id":"ca173249-0ede-493f-8201-acbd3fa2336b","resolution":{"observed_at":"2026-08-06T15:07:41.583558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:41.266393Z","title":"Hodosh, P","venue":null,"work_id":"16baca7a-930c-43ad-99c5-667a65d3d146","year":2013},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.785063Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:5cedfaf0f3cb84808a63314f2eec7f875bad50f564db27dec80e6c01d008b1eb","observation_id":"4dd10b93-6818-4d88-b412-4d26a8dc9d43","resolution":{"observed_at":"2026-08-06T15:07:41.351780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:41.069856Z","title":"Young, A","venue":null,"work_id":"df47cfa3-ac6a-43bf-ad56-5342540e502d","year":2014},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.858999Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:2ab3201bbcaf1ff062edcb300c4f72e8f6f05564a13a0f2552a81bece009b721","observation_id":"7690a2dd-8e54-493a-be30-ff01d64a64b5","resolution":{"observed_at":"2026-08-06T15:07:41.153893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1504.00325","last_updated":"2015-04-03T20:21:16Z","snapshot_observed_at":"2026-08-04T18:05:27.145522Z","submitted_at":"2015-04-01T18:13:43Z","title":"Microsoft COCO Captions: Data Collection and Evaluation Server","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1504.00325","snapshot_observed_at":"2026-08-06T15:07:33.933719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:33.933719Z"},"links":{"cited_paper":"/paper/1504.00325","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:80bca7aad8d62ebff00d16287421ac9ea79cba5d3b6e7ca82f2162549a4365da","observation_id":"2589d916-88c9-4f7f-a76e-c7ba9a1a587c","resolution":{"observed_at":"2026-08-06T15:07:33.933719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:40.913673Z","title":"Ordonez, G","venue":null,"work_id":"1e908402-78d6-4483-b406-7c1d946e54af","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.022933Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:c0ee1dd3883b6d56d8877ad28df0a6956a7ed6bc57372046aa508d23fb5a6531","observation_id":"c7edbe8a-a924-4ed8-8801-66eb9cabf258","resolution":{"observed_at":"2026-08-06T15:07:40.988854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:40.746793Z","title":"Sharma, N","venue":null,"work_id":"ff325c81-77f7-4b87-89de-a54a65bd9016","year":2018},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.119137Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:0681dddc8053cb9836bc8c7450522687b4a90280e6b0ae44cab46fbe3ceb1307","observation_id":"347efc2a-5043-4014-90d9-01444e8d4ea2","resolution":{"observed_at":"2026-08-06T15:07:40.822078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-06T15:07:34.209867Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.209867Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:39dd65db9c0b1e7b033ad74a2c3f8564fd007a3c3efd5007d4b8b960f2244b7a","observation_id":"3663b2d3-f848-425a-8d24-f0108e5604e6","resolution":{"observed_at":"2026-08-06T15:07:34.209867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01852","last_updated":"2024-01-22T03:11:15Z","snapshot_observed_at":"2026-08-07T05:10:33.059352Z","submitted_at":"2023-10-03T07:33:27Z","title":"LanguageBind: Extending Video-Language Pretraining to N-modality by Language-based Semantic Alignment","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01852","snapshot_observed_at":"2026-08-06T15:07:34.268017Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.268017Z"},"links":{"cited_paper":"/paper/2310.01852","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:be46ba9869cdb3ddde30f5c9aee5cd985da1364c943637a37815fe6d11c41c02","observation_id":"ea14d85b-de72-45ec-824f-dfb1eaa81fff","resolution":{"observed_at":"2026-08-06T15:07:34.268017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-06T15:07:34.353853Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.353853Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:f6844a0a82f8835c87ef89dc805f830ac33ffb99584db850661ef39bdcb2b868","observation_id":"0f8b4573-f24a-4936-861e-2e9dc61584a4","resolution":{"observed_at":"2026-08-06T15:07:34.353853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:40.556365Z","title":null,"venue":null,"work_id":"b261b5f1-6f9b-49d4-88a9-6ba39e468e9e","year":2016},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.448679Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:ab9d2afe1849e5e4bcc0b240b40ba35423c0532346eed23a7fe6ded49438a38a","observation_id":"f9150fbb-f3d0-48f0-9122-1b6977b3fcc9","resolution":{"observed_at":"2026-08-06T15:07:40.670584Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.09868","last_updated":"2022-04-21T03:53:19Z","snapshot_observed_at":"2026-08-05T04:18:21.689354Z","submitted_at":"2022-04-21T03:53:19Z","title":"Exploring a Fine-Grained Multiscale Method for Cross-Modal Remote Sensing Image Retrieval","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.09868","snapshot_observed_at":"2026-08-06T15:07:34.529414Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.529414Z"},"links":{"cited_paper":"/paper/2204.09868","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:e3411c798f968177bbca2fe59f7e3bc3c29d74ffc183fd61f1796525e1c94a88","observation_id":"b37f7e74-1af2-4020-9195-a83a2d0ae509","resolution":{"observed_at":"2026-08-06T15:07:34.529414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:40.360036Z","title":"Cheng, H","venue":null,"work_id":"16bf0c18-8f99-4c31-ad99-a54963b5a6f2","year":2022},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.656706Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:cd4dd3df5fadc9af070da9e900883afc1a2b3d4ee6267857cd1e847dece05111","observation_id":"c0ed3e2a-92e4-4056-ae62-e5c6c5d12642","resolution":{"observed_at":"2026-08-06T15:07:40.450875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15535","last_updated":"2023-09-27T09:53:38Z","snapshot_observed_at":"2026-08-09T04:05:40.067320Z","submitted_at":"2023-09-27T09:53:38Z","title":"From LAION-5B to LAION-EO: Filtering Billions of Images Using Anchor Datasets for Satellite Image Extraction","version":1},"cited_work":{"arxiv_id":"2309.15535","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.15535","snapshot_observed_at":"2026-08-06T15:07:37.360578Z","title":"From LAION-5B to LAION-EO: Filtering Billions of Images Using Anchor Datasets for Satellite Image Extraction","venue":"cs.CV","work_id":"05d0b2e7-1afd-44d7-b09e-8aca4c39d25b","year":2023},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.741128Z"},"links":{"cited_paper":"/paper/2309.15535","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:7fe6db158516db08479c681f825ef0be82fb03be115e49cbf483e5184498c832","observation_id":"7c54aa3f-1e57-4b99-bbf6-69277fa249b5","resolution":{"observed_at":"2026-08-06T15:07:37.430966Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:40.168769Z","title":"Vaswani, Attention is all you need, Advances in Neural Information Processing Systems","venue":null,"work_id":"4c5bfd2c-7b05-40ef-a2ef-d1c73a08118a","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.855746Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:0d012daab7e9d0366bb08e1c7b7716eae6224bb5b56ffda361a4ccbd6f403892","observation_id":"ad146f19-99ca-4a85-a9be-d1e13d1ce6de","resolution":{"observed_at":"2026-08-06T15:07:40.275687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-06T15:07:34.944450Z","title":"Bommasani, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:34.944450Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:924b0e45cb96fab0d5c95c2a0a353c48b92463a2691f14d8d269d88904ff3362","observation_id":"ce5d8fda-a3eb-44aa-a21f-d9c27bf9bf36","resolution":{"observed_at":"2026-08-06T15:07:34.944450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-06T15:07:35.003254Z","title":"Devlin, Bert: Pre-training of deep bidirectional trans- formers for language understanding, arXiv preprint arXiv:1810.04805","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.003254Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:02c59a64beafd3d98c8df67a20801c491af24704f7fb30642667d46e49f5d688","observation_id":"0edfebda-9437-452a-a738-70c5ba6eb63c","resolution":{"observed_at":"2026-08-06T15:07:35.003254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:39.992009Z","title":"Raffel, N","venue":null,"work_id":"8748ce1d-ee05-4905-8253-fb1d3463f033","year":2020},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.047715Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:6019fc38e5004c9af22c72a55b66310552b3a1c667b49c86edfe29a7836f7152","observation_id":"95a7c317-bb1b-470a-be22-3c84feaae38b","resolution":{"observed_at":"2026-08-06T15:07:40.085017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.13461","last_updated":"2019-10-29T18:01:00Z","snapshot_observed_at":"2026-07-06T08:33:12.534026Z","submitted_at":"2019-10-29T18:01:00Z","title":"BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.13461","snapshot_observed_at":"2026-08-06T15:07:35.138206Z","title":"Lewis, Bart: Denoising sequence-to-sequence pre- training for natural language generation, translation, and comprehension, arXiv preprint arXiv:1910.13461","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.138206Z"},"links":{"cited_paper":"/paper/1910.13461","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:79b7f8f7d8b179e879eaf68dc48c3242022fef855d124c4f152c54b39c7d73f6","observation_id":"9036f220-3ec9-42fe-a5f3-fb951e80e1c7","resolution":{"observed_at":"2026-08-06T15:07:35.138206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:39.863257Z","title":"Radford, Improving language understanding by gen- erative pre-training","venue":null,"work_id":"a1bf33b4-d51c-49aa-9200-6d9180ccd378","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.206762Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:cf2d13d030da62b61de44a625ed16162c8313ba1fc9c22116754f019254aafcd","observation_id":"13a0a87d-d211-492f-b574-f33bf80026b0","resolution":{"observed_at":"2026-08-06T15:07:39.895312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:35.298863Z","title":"Radford, J","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.298863Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:3e89bf04cb9bf3f716511ea824981e3933cda9ba6646f69335dc880307b71f67","observation_id":"00b914e3-94a0-4e25-a2fa-376d44716be0","resolution":{"observed_at":"2026-08-06T15:07:35.298863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-06T15:07:35.371773Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.371773Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:e4b6ef541802af6058065a8f1e8e862d7b6e0fc0b470e8d79438672ec5497f4e","observation_id":"2bf4641f-09ff-4f91-886b-8962dfa96c4a","resolution":{"observed_at":"2026-08-06T15:07:35.371773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.10163","last_updated":"2022-10-18T21:06:29Z","snapshot_observed_at":"2026-08-07T02:27:07.862492Z","submitted_at":"2022-10-18T21:06:29Z","title":"MedCLIP: Contrastive Learning from Unpaired Medical Images and Text","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.10163","snapshot_observed_at":"2026-08-06T15:07:35.467843Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.467843Z"},"links":{"cited_paper":"/paper/2210.10163","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:832c7c71483578a054e666a8d6eb7594b7ac578550085239e68b968fe0b545d3","observation_id":"398e7cd7-12fd-4477-af08-efd6b7fd90ad","resolution":{"observed_at":"2026-08-06T15:07:35.467843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:39.638262Z","title":null,"venue":null,"work_id":"1e84712b-cb1a-47ec-af67-9672c3894447","year":2023},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.505872Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:e4726cf826196c63fc31626604f287dcd6e5e7f7a529334377bd92c78e675df0","observation_id":"b6d4fc7f-e93a-4e2e-9602-8b056f547379","resolution":{"observed_at":"2026-08-06T15:07:39.734292Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-06T15:07:35.541462Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.541462Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:3234a14fc9a50854dff586e81c0cbcbb1a6c887f301c50f3a568ac02ebcd33fa","observation_id":"14263db4-eec7-4caf-9ce0-ef05a3500b0d","resolution":{"observed_at":"2026-08-06T15:07:35.541462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:39.472979Z","title":"Huang, L","venue":null,"work_id":"33d9ff7f-200d-4682-b3e4-f1ab9cea3156","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.637520Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:872fba0628796cf5bbaecbeeaafe91f47e3c5cae7f0bfdec13915861186966a5","observation_id":"27730787-4906-434f-a67d-00eadcbbcd96","resolution":{"observed_at":"2026-08-06T15:07:39.546684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:39.307870Z","title":null,"venue":null,"work_id":"8b430dee-4f21-4b72-8ddf-e764570e9a93","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.745952Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:c024b3b34e2408e611c003522f2de83fc3018474922d36120c268c47a33c4d4f","observation_id":"65cd06ce-46b6-4ea5-b24f-43a937201175","resolution":{"observed_at":"2026-08-06T15:07:39.365797Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:39.112890Z","title":null,"venue":null,"work_id":"0d070a63-e460-42a6-b338-c8f60755634c","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.827427Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:f1c272921d28660c5c95439318a912f21c0e81061bec3e2b1171aa12b5ad4c1a","observation_id":"ef783ec8-52f9-4678-8984-7b9c3610543a","resolution":{"observed_at":"2026-08-06T15:07:39.198202Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:38.961872Z","title":null,"venue":null,"work_id":"069abafa-fc61-47b7-bbb4-4b4d2a8f484a","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:35.944750Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:0435d29a4aa4c6200749665c0667ce819914a53935dfd257d78b3824c3ec1020","observation_id":"47885ffc-c36c-42b6-ad61-9e60a70e8979","resolution":{"observed_at":"2026-08-06T15:07:39.076573Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:07:36.055878Z","title":"Achiam, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.055878Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:3f91c0c8bf3c593c8060b0573c883681bb0d70c06abb70f2ca3ccee3454e38b5","observation_id":"368d043a-9dc6-4604-969f-68b8ace2ea1e","resolution":{"observed_at":"2026-08-06T15:07:36.055878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-06T15:07:36.148470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.148470Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:73deebc8f2a19a8adde0b405b35026e1f42d17831a0bae250af851cd1bb20667","observation_id":"814d1c89-eee6-4521-ab8a-accee864e2d6","resolution":{"observed_at":"2026-08-06T15:07:36.148470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-06T15:07:36.248721Z","title":"Young, B","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.248721Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:ca271a4ad9292291ea58ce9ee0086ae35ed422b7dfd2d8f3aea6c46d2a5e4a1a","observation_id":"b46f3ac1-96b7-4fa3-886b-e91bd2c935d9","resolution":{"observed_at":"2026-08-06T15:07:36.248721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:38.755144Z","title":null,"venue":null,"work_id":"2c8daa63-f38c-4470-b5a6-745d1332fa06","year":2023},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.326511Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:7ad849bef781e806c3f2e8b2a9761cfb1752e46e788184ce9cc99bf416461dae","observation_id":"24495e67-8534-4999-827c-9f57de71b58b","resolution":{"observed_at":"2026-08-06T15:07:38.851295Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01328","last_updated":"2023-10-19T17:58:05Z","snapshot_observed_at":"2026-07-06T14:47:48.494911Z","submitted_at":"2023-02-02T18:58:05Z","title":"IC3: Image Captioning by Committee Consensus","version":3},"cited_work":{"arxiv_id":"2302.01328","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.01328","snapshot_observed_at":"2026-08-06T15:07:36.928436Z","title":"IC3: Image Captioning by Committee Consensus","venue":"cs.CV","work_id":"85d82d90-3749-4d07-876c-03aec5058ca3","year":2023},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.419533Z"},"links":{"cited_paper":"/paper/2302.01328","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:96d54fb42eaf390c6ef2eac147158685c1194d56d3ceea7c809076bd19e2cf45","observation_id":"933a4636-e22b-4520-bcc2-504e5720cc4b","resolution":{"observed_at":"2026-08-06T15:07:36.985958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:38.591134Z","title":"Teo, How i won singapore’s gpt-4 prompt engineering competition, Towards Data Science, Medium 29","venue":null,"work_id":"e3c659b2-c4f8-4553-b0e7-745ef5b6d97c","year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.508125Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:aa86331894b766154129a9b223de1e11b16f143138c0e30a7091e0f68c4feeba","observation_id":"d6a2c483-0b6d-4c9e-a238-26af21359dc9","resolution":{"observed_at":"2026-08-06T15:07:38.655896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T15:07:36.579523Z","title":"Loshchilov, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.579523Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:bfc10f3c677a33c0687e8e7d7c0313c365bb391bc17f2481d2a33ff0cdd2a1eb","observation_id":"f5abce0b-faeb-4d1a-ae2a-ca7288474770","resolution":{"observed_at":"2026-08-06T15:07:36.579523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-06T15:07:36.669916Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.669916Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:d97d92870799e515f858c7d4afcb3661e1d8248f37d26fc07d48bb86ea1aa523","observation_id":"15f6d0d4-241b-4c13-a9d6-8ef33aff7977","resolution":{"observed_at":"2026-08-06T15:07:36.669916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:07:38.422661Z","title":null,"venue":null,"work_id":"05d2d5d6-a7fc-481e-aaa9-d1def1b6a532","year":2024},"citing_paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:07:36.719119Z"},"links":{"citing_paper":"/paper/2507.16716"},"observation_digest":"sha256:56408948224bb325d9b3326b0bab923c15c4138aa63613ef927df8891d9246e7","observation_id":"171f3b2c-7076-45c6-a8c3-b5824cc7083b","resolution":{"observed_at":"2026-08-06T15:07:38.507667Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16716","last_updated":"2025-07-22T15:54:53Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T05:30:53.359696Z","submitted_at":"2025-07-22T15:54:53Z","title":"Enhancing Remote Sensing Vision-Language Models Through MLLM and LLM-Based High-Quality Image-Text Dataset Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":47,"verified_exact":3,"verified_fuzzy":19},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 5 inbound Pith citation observations for arXiv:2507.16716."}