{"as_of":"2026-08-23T05:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6e412833a091f7e2022158d07f17e2ef599ab42a04f0dd91ca34bc532c85085a","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T21:47:04.669204Z","state":"measured"},{"denominator":53,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":53,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2602.19190/citation-record","integrity":"/paper/2602.19190/integrity","json":"/paper/2602.19190/citation-record.json","paper":"/paper/2602.19190"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T21:47:00.159441Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.159441Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:189d87b2542a0cb0f4f99bb09b705a976f69691537b4fb4afb8c495f56bc2c35","observation_id":"4a1d9cd5-0a6d-4593-9242-8ac4b7c4089f","resolution":{"observed_at":"2026-08-02T21:47:00.159441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.243122Z","title":"Qwen2.5-vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.243122Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:624a2b3b35a25761f085e86f769079608fa996e4472f6bec2b244edf6a76a96e","observation_id":"c1827d55-dcf3-4c0b-943e-13b6e65721fa","resolution":{"observed_at":"2026-08-02T21:47:00.243122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.336448Z","title":"Multi-spectral remote sensing image retrieval using geospatial foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.336448Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:2fb75098deeb77adc32f1e3bdd337353b110fcb00f255d3684075de56a0b84cd","observation_id":"3b652e5c-b10f-48b8-936a-634a3b9bbb24","resolution":{"observed_at":"2026-08-02T21:47:00.336448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.410631Z","title":"Brown, Michal R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.410631Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:eafa4bbfd50a124db93b85cf695448620b95d625b3808ec1528327334ddc99c6","observation_id":"b273c935-9a05-44a3-8c12-5d0dbca40fbc","resolution":{"observed_at":"2026-08-02T21:47:00.410631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.522548Z","title":"Changeclip: Remote sensing change detection with multi- modal vision-language representation learning.ISPRS Jour- nal of Photogrammetry and Remote Sensing, 208:53–69,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.522548Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:aeab693a5337d6c33b5dcc8f844e9f582f07540e148047f11b60f6059da5a6ad","observation_id":"87f84470-04b8-4af2-bd58-cd47c4e25988","resolution":{"observed_at":"2026-08-02T21:47:00.522548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.660623Z","title":"Combining sam with limited data for change detection in remote sensing.IEEE Transactions on Geoscience and Remote Sensing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.660623Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:04e779a5348f1d338dc1e272766fed54b8aa013fcfcca14761f93cb659eb8d82","observation_id":"68c87035-719c-4166-99ad-cb66105ee3b2","resolution":{"observed_at":"2026-08-02T21:47:00.660623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.765883Z","title":"Deep- learning for radar: A survey.IEEE Access, 9:141800– 141818, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.765883Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:f237953b2ce8a319bd167d1f19621c9a35d590f71c6da6b6c4422eaaaee45c6d","observation_id":"8e6191f6-3429-40ae-b4ac-d04e8106f2f8","resolution":{"observed_at":"2026-08-02T21:47:00.765883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.835884Z","title":"Unpaired image-text match- ing via multimodal aligned conceptual knowledge.IEEE Transactions on Pattern Analysis and Machine Intelligence, 47(7):5160–5176, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.835884Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:fb3e486840f21c240517368cbbfb7001aeab0b75ec1ec1b4bcde0bd4e812eeb4","observation_id":"ff677ab4-c154-48ea-98f6-b7fb1b3fe55f","resolution":{"observed_at":"2026-08-02T21:47:00.835884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:00.913150Z","title":"A fast progressive ship detection method for very large full-scene sar images.IEEE Transactions on Geo- science and Remote Sensing, 62:1–15, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:00.913150Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:4a7bb692827847b44bb84ae5d89917f19b9d47536036b8672948145c726e2ebc","observation_id":"1333c661-a96d-48ed-8c37-e926d8c7622a","resolution":{"observed_at":"2026-08-02T21:47:00.913150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.005862Z","title":"Sarclip: a multimodal foundation framework for sar imagery via con- trastive language-image pre-training.ISPRS Journal of Pho- togrammetry and Remote Sensing, 231:17–34, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.005862Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:29025d3a6a81d8072367db4c70214721f093bc4ae1903496cad238f95a7a349f","observation_id":"f658c8b6-1846-4ea6-91b4-655424f225e8","resolution":{"observed_at":"2026-08-02T21:47:01.005862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.094296Z","title":"Em-yolo: A fine-grained recognition model for aircraft targets in sar im- ages","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.094296Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:0d5d4dc1d09bcf17dd395faccf6fdc8c40334affa56e78e9675fc9dd5ee5bbaf","observation_id":"1097abd9-5ccd-4918-8392-7e27724164c9","resolution":{"observed_at":"2026-08-02T21:47:01.094296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.191491Z","title":"Sar ship detection based on an improved faster r-cnn using deformable convolution","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.191491Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:4cecd0575751fac58c10b69189fcb88bcb53624f7dd14b9535db390b5cba4cc1","observation_id":"6fbf4849-38ec-4ddc-91a9-68f123c00731","resolution":{"observed_at":"2026-08-02T21:47:01.191491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.320843Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.320843Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:737bd66a17e768feab8d257114d45d09327f8163be27792e703be7451448cea9","observation_id":"dd608eeb-097d-4140-91d0-b0131a9f4319","resolution":{"observed_at":"2026-08-02T21:47:01.320843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.407673Z","title":"Llava-onevision: Easy visual task transfer, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.407673Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:9cb291e7a48a7efef98865667b0ff5bff32b4a07d82d5f5d23f099dde87c9009","observation_id":"9751cc24-2318-45f1-81d5-29457cb8fdae","resolution":{"observed_at":"2026-08-02T21:47:01.407673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.472873Z","title":"BLIP: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.472873Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:4a4b8ee0755b16e9f73fa7a0d0dd687bc7c9152815ec7756a4e51730e977893f","observation_id":"e5d53f27-2f39-481a-86ea-8ac61c154189","resolution":{"observed_at":"2026-08-02T21:47:01.472873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.532051Z","title":"A new learn- ing paradigm for foundation model-based remote-sensing change detection.IEEE Transactions on Geoscience and Re- mote Sensing, 62:1–12, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.532051Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:4b512eab0a0737fbcba75d88bece66d43f5fa56a701a5db27662e2252854ce28","observation_id":"7311518f-8bce-4cb2-bcc6-c30ccc2b0cb1","resolution":{"observed_at":"2026-08-02T21:47:01.532051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.587363Z","title":"Co-training vision-language models for remote sensing multi-task learning.Remote Sensing, 18(2): 222, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.587363Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:264ad6c58804adf503cd994c88ad89e7a4eb374561d7182db4706bf447b48d83","observation_id":"e879ceb5-1487-4b10-8b70-c2a7e1ecd95a","resolution":{"observed_at":"2026-08-02T21:47:01.587363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.671693Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.671693Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:4889bb7505f2899dd3a32e4f34b930497c3279e17d2253fb8ca0cc3e3e6a4d2c","observation_id":"847853ec-32d5-4941-8a1a-5d055eace7ee","resolution":{"observed_at":"2026-08-02T21:47:01.671693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.763737Z","title":"Star: A first-ever dataset and a large-scale benchmark for scene graph generation in large-size satellite imagery.IEEE Trans","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.763737Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:1be861a28d238336cc0fa9cddae4502e4bf8e399b1e9620051062dbe880beafa","observation_id":"0e0e6b94-402e-40df-ba6a-7a596b1b1ff3","resolution":{"observed_at":"2026-08-02T21:47:01.763737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.872284Z","title":"Re- moteclip: A vision language foundation model for remote sensing.IEEE Transactions on Geoscience and Remote Sensing, 62:1–16, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.872284Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:97f8e301b21eb0b0e2a6d5f160c3fd261eefea9bf90be8be328b5eca96a8646b","observation_id":"c9fdb410-9f36-48a5-9c1a-b7a390f4f9c4","resolution":{"observed_at":"2026-08-02T21:47:01.872284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:01.967690Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:01.967690Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:d8a73f4d2ea8cf78a969183683d5fea23e0b33d4deecf620da481e18e18634cb","observation_id":"03b5fdf9-576d-4099-9e96-56769a1dc7b1","resolution":{"observed_at":"2026-08-02T21:47:01.967690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.043624Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.043624Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:0297744c32a373007b0a40550fdbb79eafbb527ea5dc6f5f5ae13872c680da2f","observation_id":"5032543d-858d-44c0-973a-38b5391247a7","resolution":{"observed_at":"2026-08-02T21:47:02.043624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.107226Z","title":"Texture classification from random features.IEEE transactions on pattern analysis and machine intelligence, 34(3):574–586, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.107226Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:9821e582cffe39c31b2384d72a4ab558004241043365d1df87be37c51173f4df","observation_id":"ddc3ecea-cfcf-48ed-b64b-d11515d66ad4","resolution":{"observed_at":"2026-08-02T21:47:02.107226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.222057Z","title":"A causal adjustment module for debiasing scene graph generation.IEEE Trans- actions on Pattern Analysis and Machine Intelligence, 47(5): 4024–4043, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.222057Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:f3d3feaad1fec153ab7f75877f548ee837042c27330e9540342609bed5ca0b20","observation_id":"e0cd5172-886c-4a57-81e2-e6c552f1d6c2","resolution":{"observed_at":"2026-08-02T21:47:02.222057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.350777Z","title":"Atrnet-star: A large dataset and benchmark to- wards remote sensing object recognition in the wild.IEEE Transactions on Pattern Analysis and Machine Intelligence,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.350777Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:521869bf9eb7351989fecd2cfb3d2dac4819f2a74daec9410c61a40593a61f69","observation_id":"c1ff220c-0a5e-48d5-a3a8-aa6cdda9d966","resolution":{"observed_at":"2026-08-02T21:47:02.350777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.475420Z","title":"Vhm: Versatile and honest vision language model for remote sensing image analysis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.475420Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:07eef33ed713149cf00648442c84fb5e74cb2763feaadc4a3ea1eea2b8d2e622","observation_id":"94f33e6d-503a-4e36-8815-f7a98e71e93f","resolution":{"observed_at":"2026-08-02T21:47:02.475420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.578235Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.578235Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:5c73bee9281bc6e9254a1b86feedcda39dfe4627cc6dd5d00f4bbbca7335dfc7","observation_id":"a8237ffe-93fd-4ffe-80e4-be3551e3f696","resolution":{"observed_at":"2026-08-02T21:47:02.578235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.10554","last_updated":"2026-04-02T03:14:28Z","snapshot_observed_at":"2026-08-11T12:33:58.665102Z","submitted_at":"2025-12-11T11:38:50Z","title":"Grounding Everything in Tokens for Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.10554","snapshot_observed_at":"2026-08-02T21:47:02.670792Z","title":"Grounding everything in to- kens for multimodal large language models.arXiv preprint arXiv:2512.10554, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.670792Z"},"links":{"cited_paper":"/paper/2512.10554","citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:f6db209ae37c28e7488e727ceb310b684556eeaf49aea34a07bf570bbee72d30","observation_id":"30ee7653-332c-433a-8396-7340f9a605da","resolution":{"observed_at":"2026-08-02T21:47:02.670792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.720036Z","title":"Earthdial: Turning multi-sensory earth observations to interactive dialogues","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.720036Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:7da14f1bd807337c6ede5026f8795ad849dc7f4820eb116c294a8fff9c8613ff","observation_id":"2636d552-4451-4f70-91ad-669b5defe258","resolution":{"observed_at":"2026-08-02T21:47:02.720036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.806763Z","title":"Fully polsar image reconstruction for enhanced land cover mapping.Pattern Recognition, 169:111895, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.806763Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:0aefff3a1a543724e8b8cd538b7e4473b890b519fd79458774e0479d6bc04ab7","observation_id":"96b05514-31a5-43ba-9864-c4080fbe7bfb","resolution":{"observed_at":"2026-08-02T21:47:02.806763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.865615Z","title":"Vi- sual position prompt for mllm based visual grounding.IEEE Transactions on Multimedia, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.865615Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:5af9b5be6d736de94d53850028de169e65bd4557692d2b0f3a5c3c827cb56a89","observation_id":"65ae49c1-3117-4d2d-8a93-1474b238facf","resolution":{"observed_at":"2026-08-02T21:47:02.865615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:02.926297Z","title":"Re- ferring expressions as a lens into spatial language grounding in vision-language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:02.926297Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:90a5fb4b71e181db5dcc855a275ccbd7e0262b24305cff827a51e18c70ad03f7","observation_id":"82e796d5-c171-4dcc-957d-5ec0b4323b50","resolution":{"observed_at":"2026-08-02T21:47:02.926297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.020406Z","title":"Group equivariant u-net for the semantic segmentation of sar im- ages","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.020406Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:46c2a88a5375b5411c54738810c66b0613dfd0ed331788be9b1c702b23aec016","observation_id":"e5f1c877-975e-4832-8af8-9d7fa80254c8","resolution":{"observed_at":"2026-08-02T21:47:03.020406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.077134Z","title":"Annotation-free, high-fidelity sar oil-spill image synthesis via classification-guided diffusion model.IEEE Transactions on Geoscience and Remote Sens- ing, 63:1–11, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.077134Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:5261aad22c298dcd46f7b7d0dcc6a326a8526da02ca0c61033ed970044cfe556","observation_id":"5f93fb2f-fb8d-416b-b3ab-ebae82e92f7b","resolution":{"observed_at":"2026-08-02T21:47:03.077134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.159165Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.159165Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:94cd4bdf9960ef3d9e2e25282d223d2c7146e20faa85e244f6df0af5b8b6d831","observation_id":"c106161f-313b-42c0-af97-81130340cb03","resolution":{"observed_at":"2026-08-02T21:47:03.159165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-08-17T12:32:16.575866Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-02T21:47:03.238957Z","title":"Internvl3.5: Advancing open-source multimodal models in versatility, reasoning, and efficiency","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.238957Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:b6a4d85adef312e6a5f50e55dedb6aeed66cc4083d511d1f5901f005fb49b564","observation_id":"7219751a-a3fc-4116-9c8a-9f13a82b205e","resolution":{"observed_at":"2026-08-02T21:47:03.238957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.364687Z","title":"Skyscript: A large and seman- tically diverse vision-language dataset for remote sensing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.364687Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:9c35d8b2ce72f594e32aa5c0e5d1c8f652f838c0823b97f276e51e1ed86d71c6","observation_id":"40e3341b-a7dd-43d5-bcae-e3e217765fad","resolution":{"observed_at":"2026-08-02T21:47:03.364687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.430443Z","title":"Sarlang-1m: A benchmark for vision-language modeling in sar image un- derstanding.IEEE Transactions on Geoscience and Remote Sensing, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.430443Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:e9d1f83e5ed6d2dbb89d692278c57def2414dc3dd80b0f2a14d3d4878c8671e3","observation_id":"f4c42a91-38f8-494f-850e-962fcfcf5088","resolution":{"observed_at":"2026-08-02T21:47:03.430443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.497183Z","title":"Bootstrapping interactive image–text alignment for remote sensing image captioning.IEEE Transactions on Geoscience and Remote Sensing, 62:1–12, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.497183Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:6c70def0d9b302cf99541f5cfc2eddd39201c90686165af6d79b6214502fd6dd","observation_id":"8e2d6445-020a-4461-a9a0-9fe298599595","resolution":{"observed_at":"2026-08-02T21:47:03.497183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.564279Z","title":"R3det: Refined single-stage detector with feature refinement for ro- tating object","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.564279Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:1964ebb8f0b53bc1de8de63a496f18378cc64f8b4e33ca3d4774efab2c5fec1a","observation_id":"7278e134-5a14-46b5-9afc-5348ab33b4c4","resolution":{"observed_at":"2026-08-02T21:47:03.564279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.659956Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.659956Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:c20d014dce28ecc24f910cf226e7a96ede0ffca8a59f43b0ace0159125ff565f","observation_id":"65a717dc-5683-4db1-9176-8ce0a9c40e60","resolution":{"observed_at":"2026-08-02T21:47:03.659956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.766569Z","title":"Fusar-klip: Towards multimodal foundation models for remote sensing, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.766569Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:daa89056b3d00c98ac70d0e482dbbe0dd8ac63a66689ef1139f2f7c53ba42394","observation_id":"3f3da96d-90ac-4bee-86a2-de6914c4fedf","resolution":{"observed_at":"2026-08-02T21:47:03.766569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.820210Z","title":"Object fidelity diffu- sion for remote sensing image generation.arXiv preprint arXiv:2508.10801, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.820210Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:60d5b0388b6816176388b22d6266daf6f479b209555d794645a3bdbaa0dca095","observation_id":"8ae3e397-d85e-4bf1-99c4-058d6ad952f2","resolution":{"observed_at":"2026-08-02T21:47:03.820210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.888503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.888503Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:f2a487ac581e72aa8f6d9d75e8c8d5e900921a3539fc7686863c9069950947cd","observation_id":"ae798bc3-940e-4d09-a463-f9e2b0589c94","resolution":{"observed_at":"2026-08-02T21:47:03.888503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:03.977426Z","title":"Earthgpt-x: A spatial mllm for multi-level multi-source re- mote sensing imagery understanding with visual prompting,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:03.977426Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:1d43fd677e06aa2e5a4392381d3c5ce1cdf6791ea7950ac315bdf030278b1f30","observation_id":"51e2950d-11f2-497b-9fd0-a9c76a72eac4","resolution":{"observed_at":"2026-08-02T21:47:03.977426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.061253Z","title":"A fast training method for sar large scale samples based on cnn for targets recognition","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.061253Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:44cd3654cb6cd0f22e2fa552379b1ba81d617f822f68b70fa40bbc0e874f1c3c","observation_id":"a035c27e-c4e5-4ddd-9e5c-80ce78f2d639","resolution":{"observed_at":"2026-08-02T21:47:04.061253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.164672Z","title":"Rs5m and georsclip: A large-scale vision-language dataset and a large vision-language model for remote sensing.IEEE Transactions on Geoscience and Remote Sensing, 62:1–23,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.164672Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:a7b46e6eebb34234bbd1f0140b644d199e037d27320681242fd1180e3e39e85e","observation_id":"affe2e7f-db1b-4d46-b862-806b358bf36c","resolution":{"observed_at":"2026-08-02T21:47:04.164672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.259014Z","title":"Geo-r1: Improving few-shot geospatial referring expression understanding with reinforcement fine- tuning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.259014Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:3215f190885dcf6eda43c2e1b743beae71de58a0208a51d7e504b38da1e53b2c","observation_id":"4b761e81-d0b8-4935-9497-958a3d42c5fd","resolution":{"observed_at":"2026-08-02T21:47:04.259014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.363440Z","title":"Towards vision- language geo-foundation model: A survey.arXiv preprint arXiv:2406.09385, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.363440Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:c5d681ef85bd8b68b925285337717d6cc02c8efdc34b61ba4389ecd3ab15919c","observation_id":"c7ca8b52-d712-4670-a9e3-8dd4b11d2891","resolution":{"observed_at":"2026-08-02T21:47:04.363440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.441518Z","title":"6, SAR imagery exhibits inherent lim- itations that constrain visual–semantic understanding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.441518Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:973cda4807dae0734df7b0da3b2c1ab84057fee54eb3476ba8135e4cd6352bff","observation_id":"ca862e42-4fd8-44d8-98e6-2d9ab1192f37","resolution":{"observed_at":"2026-08-02T21:47:04.441518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.531930Z","title":"FUSAR-GPT consistently outperforms all competing methods by a signif- icant margin across counting, grid-based localization, and classification tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.531930Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:274f3d6aef832734dd80bc15daaec503afc98e70602b08e5ac82d7df44cbf2c8","observation_id":"1110d89e-08a1-4980-a8e7-9da1ed3e5c91","resolution":{"observed_at":"2026-08-02T21:47:04.531930Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.613602Z","title":"Ablation results on the target counting task","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.613602Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:62e42013bdf49b62c0f94463b19ba3b1a9ef2458822a42e3b3fceb9038a09b85","observation_id":"b4d696b9-b1ea-42fe-a303-415949e6328e","resolution":{"observed_at":"2026-08-02T21:47:04.613602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T21:47:04.669204Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T21:47:04.669204Z"},"links":{"citing_paper":"/paper/2602.19190"},"observation_digest":"sha256:3c52ab2d029a1bdf5cb3a53207c783392c2bd184aa76b5ad8c65e01ef363a63a","observation_id":"bbf26c0e-e3ff-4fd3-a6e4-530933cdbcb8","resolution":{"observed_at":"2026-08-02T21:47:04.669204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.19190","last_updated":"2026-06-04T06:50:26Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T15:45:06.129450Z","submitted_at":"2026-02-22T13:40:17Z","title":"FUSAR-GPT : A Spatiotemporal Feature-Embedded and Two-Stage Decoupled Visual Language Model for SAR Imagery"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 0 inbound Pith citation observations for arXiv:2602.19190."}