{"as_of":"2026-08-12T14:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:60a9c9c1d41dbfe8302e93609ed25979ddc7eb9af72a42cd54aed051fb11d942","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T23:25:10.376115Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.02531/citation-record","integrity":"/paper/2412.02531/integrity","json":"/paper/2412.02531/citation-record.json","paper":"/paper/2412.02531"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.229124Z","title":"Deep learning for remote sensing image scene classification: A review and meta-analysis,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.229124Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:bcf22c961df886301098daa0f1dce4286450fcd278f619cab0e93708bf5f48bc","observation_id":"7071abf1-6c2f-486f-9014-4107d615da74","resolution":{"observed_at":"2026-08-11T23:25:10.229124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.874455Z","title":"Scene and environment monitoring using aerial imagery and deep learning,","venue":null,"work_id":"13ee14b8-aa8e-4c2d-bbb1-03198473624a","year":2019},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.233407Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:4a9ad9daaf72616c86f8a598cf17d97a7c873e43e5fbbc24c433c20eb19b08d6","observation_id":"527e1dd8-255b-4880-bccb-718267df7479","resolution":{"observed_at":"2026-08-11T23:25:10.877827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.864427Z","title":"Spatial context-aware method for urban land use classification using street view images,","venue":null,"work_id":"e7b3d1f1-5580-49bd-b922-f6264c6251b0","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.237070Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:7f87d759657795ec30839a9fd44e620ab194d027f3ecfdc66cdc6216ce7186db","observation_id":"7212442e-d9ac-4b65-abb3-523425eee87a","resolution":{"observed_at":"2026-08-11T23:25:10.868141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.854014Z","title":"Urban scene understanding based on semantic and socioeconomic features: From high-resolution remote sensing imagery to multi-source geographic datasets,","venue":null,"work_id":"ff8eeae9-a82c-4a1b-a419-3c857ac59f31","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.240960Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:fd7581a86d7942f4a56a59d95edef445be062c840fa90984342adc56a0ead0ee","observation_id":"05b9dae7-3a75-4c1a-8286-27dd85fd1598","resolution":{"observed_at":"2026-08-11T23:25:10.857464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.844094Z","title":"A survey on deep learning-driven remote sensing image scene understanding: Scene classification, scene retrieval and scene-guided object detection,","venue":null,"work_id":"de5cc543-a7b3-4c83-af52-70677a479054","year":2019},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.244642Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:922980110d8d9cf2671fd32c8fc75c3e54e58d4702b4b5528ea413df4f0a7e17","observation_id":"28541f4f-d411-41b0-b11e-a7d2d2c02d7e","resolution":{"observed_at":"2026-08-11T23:25:10.847730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.834400Z","title":"Evaluating the potential of texture and color descriptors for remote sensing image retrieval and classification,","venue":null,"work_id":"8f9915ce-b9ae-431f-8745-9b4032d629d3","year":2010},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.248249Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:509ad17f7090ba405ee225348d79a5462b3fa171881ec4a472f683ee68683ad8","observation_id":"2410f6e5-b6ba-4c04-ac03-4d9cfec9ad72","resolution":{"observed_at":"2026-08-11T23:25:10.838031Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.824443Z","title":"Indexing of remote sensing images with different resolutions by multiple features,","venue":null,"work_id":"1efd93ed-6ab6-4d86-adca-b233b3759bef","year":1912},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.252196Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:60b4d3b68432af8c8035d967ccecae7a6822ef60f0e4be81cb4dc3a3e987e0cf","observation_id":"010b672d-a5bd-4dbf-9510-83834df5fac8","resolution":{"observed_at":"2026-08-11T23:25:10.828162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.814726Z","title":"High-resolution satellite scene classification using a sparse coding based multiple feature combination,","venue":null,"work_id":"9e28798f-82f2-4b5d-8e35-a4bb246aaea6","year":2012},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.255697Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:5502d40b5d6aac3887e6575e87b4e4daddb16a813d8ed1490470891d0daa23c8","observation_id":"2a2bf74e-c86c-4c47-86cd-481d6a9a096f","resolution":{"observed_at":"2026-08-11T23:25:10.818269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.259030Z","title":"Remote sensing image scene classification meets deep learning: Challenges, methods, benchmarks, and opportunities,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.259030Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:a98a74331912fddbd3fa4e3ae0c6427a5dfd9614741df12f3f774f958dd5544d","observation_id":"ba22cb26-5dba-4745-ac5f-ac9a67248489","resolution":{"observed_at":"2026-08-11T23:25:10.259030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.798275Z","title":"Scene classification based on multiscale convolutional neural network,","venue":null,"work_id":"ef328887-edf8-4ab3-8a87-4a263e6f2f9f","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.262380Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:60a87550061d46253362cd9b2ff9087797a58bcd20f4a238a512991774941ecf","observation_id":"49046a35-f649-43e9-8e76-6bfea94693c2","resolution":{"observed_at":"2026-08-11T23:25:10.801839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.788602Z","title":"Gan-based semisupervised scene classifi- cation of remote sensing image,","venue":null,"work_id":"4cdb0635-30a6-476e-b8a3-65b768c776f5","year":2020},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.265554Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:4982b32963e8e3ade4a1b47056cc4c8d6aae927c17e69ff07de502d1ad539fe1","observation_id":"0a0b01d1-c752-4d27-bf41-b941df70e6f3","resolution":{"observed_at":"2026-08-11T23:25:10.792178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.778943Z","title":"Scvit: A spatial-channel feature preserving vision transformer for remote sensing image scene classification,","venue":null,"work_id":"d1e8ce36-06c1-49a5-bd9c-b374897700e0","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.269031Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:42d08f3257f35a934809dfbb5a76603056bc52d1341cd4ac7f03886ba29b15b2","observation_id":"e7b264d0-4fd4-4d44-8d17-6190cd718c63","resolution":{"observed_at":"2026-08-11T23:25:10.782374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.769633Z","title":"Vision transformer with contrastive learning for remote sensing image scene classification,","venue":null,"work_id":"7629faf0-3357-4ba6-8ed4-e2a4957a805d","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.272302Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:8944ee5101cd214ff337b0a155d343475a5fcda8562077cfdbc851c9cffdff15","observation_id":"e7619c2e-677c-4029-a957-1d1e4a755059","resolution":{"observed_at":"2026-08-11T23:25:10.772943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.759531Z","title":"Deep learning-a new approach for multi-label scene classification in plan- etscope and sentinel-2 imagery,","venue":null,"work_id":"456a5d8a-f59c-4b75-a6b5-f25efaa814d9","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.275625Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:6adb41531267d185fb83ae831a77685b400f9b3a0df335c1d989fccb957f3190","observation_id":"17e4a056-52c8-47bd-a3ed-22c767a01698","resolution":{"observed_at":"2026-08-11T23:25:10.763313Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.278716Z","title":"A multi- level label-aware semi-supervised framework for remote sensing scene classification,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.278716Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:5458c571dcb9ae913028937b1e2c668ed378766af368d0181809cf2545e7d91a","observation_id":"441c68e4-96bc-4e07-911f-356a7cf9cf4b","resolution":{"observed_at":"2026-08-11T23:25:10.278716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.744200Z","title":"He and Q","venue":null,"work_id":"f9ea88f7-40a2-415b-b5d2-67c73be56dad","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.281890Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:b7555d891bfc1c4d68e09a19ced9c93c329e0e56b3fa2fb8b04bd944f99456c1","observation_id":"2a250829-f0c9-41c7-ac3e-bfda466284fc","resolution":{"observed_at":"2026-08-11T23:25:10.747640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.734063Z","title":"A lightweight multi-scale crossmodal text-image retrieval method in remote sensing,","venue":null,"work_id":"71c1d870-681b-476c-8e23-181cfd307f22","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.285092Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:6ddb207d845d69f623aaba47f9563f2474116663485ab8373b0aac9f1dd804c4","observation_id":"711cc84a-e56f-4dbd-bfac-3865f06ea4dc","resolution":{"observed_at":"2026-08-11T23:25:10.737549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.724416Z","title":"Multi-label semantic feature fusion for remote sensing image captioning,","venue":null,"work_id":"7b2bf7b4-76c6-4f4b-9267-6dee73615b92","year":2022},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.288191Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:1aa748f956a06b22485cfad3c41e7d92bb2a461f17ec1e7d1145c509ea57145b","observation_id":"48b40467-48a4-495b-9d03-6b880c100835","resolution":{"observed_at":"2026-08-11T23:25:10.727851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.714572Z","title":"Teaw: Text-aware few-shot remote sensing image scene classification,","venue":null,"work_id":"8bc21e27-b4a2-4341-bf49-184e2d397d39","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.291364Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:1b24cbe432a6adb0fa7c544526e1768207628170f102934b8abb386a387b2cdc","observation_id":"58169b2b-4533-4cab-ac3d-e44861e1151f","resolution":{"observed_at":"2026-08-11T23:25:10.718106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.294762Z","title":"Remoteclip: A vision language foundation model for remote sensing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.294762Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:c36f42992233dae9f741d25a5c39cbe5bd9084d976bdf6a80d075b37d4d5c363","observation_id":"4e715f2b-7443-4163-9a93-995601a9a425","resolution":{"observed_at":"2026-08-11T23:25:10.294762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.699308Z","title":"Land-cover classification with high-resolution remote sensing images using transferable deep models,","venue":null,"work_id":"a2f25a5f-048f-4d7d-b214-e4f11f1f5098","year":2020},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.297929Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:6d59565e6b257dc10ab91e0b9c8cf654c518e62c6e5c538045add8cc6fc9f95a","observation_id":"bbccb5ff-034d-402f-884d-77d00a688a07","resolution":{"observed_at":"2026-08-11T23:25:10.702609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.689941Z","title":"A dual- model architecture with grouping-attention-fusion for remote sensing scene classification,","venue":null,"work_id":"2196fd67-ac41-4a85-ad05-5192c25c12c2","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.301005Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:fc7e33e6d7286773eabb85ba0cec8bede57d9c2aa8b5ca03ca486e357541f247","observation_id":"4f9966a2-fa2b-4011-864c-199deac4b070","resolution":{"observed_at":"2026-08-11T23:25:10.693529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.680904Z","title":"Scene classification with recurrent attention of vhr remote sensing images,","venue":null,"work_id":"fd786b3c-18e7-446b-9056-687eb2863ced","year":2018},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.304137Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:2404f3a7fdd46b0f7203aaaced5fb10f282123620872e94f21a56bea47d0d545","observation_id":"bd3c34a4-8aa0-4bef-9741-1be01d262657","resolution":{"observed_at":"2026-08-11T23:25:10.684148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.671884Z","title":"Classification of remote sensing images using efficientnet-b3 cnn model with attention,","venue":null,"work_id":"9592d24a-2c4e-4c60-88a9-72a7fbe7c324","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.307138Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:14806970c8927c00191904ef5a2d1dc7021a40962b6547cb1129f447c79056fb","observation_id":"2dc92c41-72be-498f-8556-d556561b435b","resolution":{"observed_at":"2026-08-11T23:25:10.675233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.662812Z","title":"Rs-deepsuperlearner: fusion of cnn ensemble for remote sensing scene classification,","venue":null,"work_id":"a6552b99-853c-48e7-9423-c29da834fbfa","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.310320Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:617acd2c951825d93b6c2d36375db8f55063356a2d8fccfb52e18b6589eb3428","observation_id":"7fb639c1-91dc-49ac-8e32-69e74a0c8722","resolution":{"observed_at":"2026-08-11T23:25:10.666022Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.653414Z","title":"Contextual spatial-channel attention network for remote sensing scene classification,","venue":null,"work_id":"a685b873-4ee0-43ca-8123-f68dc6283159","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.313382Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:f3f9dc76728235a57f85dc5b48a83bd9225c4c3f62e6fc6c232592b358273f22","observation_id":"f157f96c-6b35-445a-b4c4-d9fb71c36280","resolution":{"observed_at":"2026-08-11T23:25:10.656970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.643609Z","title":"A local–global interactive vision trans- former for aerial scene classification,","venue":null,"work_id":"2eca305d-016e-4106-8ee9-63c673f6a22d","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.316600Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:21fe2da191b9d2dfaed2cb15b27c7350307045d3be5547b21f06e8a7a74d0604","observation_id":"78461957-93eb-4f2d-a992-370049753e55","resolution":{"observed_at":"2026-08-11T23:25:10.647236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.633667Z","title":"Nir/rgb image fusion for scene classification using deep neural networks,","venue":null,"work_id":"4519c142-5d46-4413-b382-1062bbfd66a9","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.319967Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:bf93c0ddfdfa5940646e2bcfe59657bad316f5ffc7567845076dedb94b662f99","observation_id":"753af8c8-49a9-410e-b950-ef4ead80cb6c","resolution":{"observed_at":"2026-08-11T23:25:10.637260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.623888Z","title":"Mrssc: a benchmark dataset for multimodal remote sensing scene classification,","venue":null,"work_id":"2a1bf802-b278-4854-acad-928dcfdb32d0","year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.323038Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:5fbd8c04822b5a8cf0940ddf98c7b12a9b7a2280684894cc179d513f7375378d","observation_id":"c746d677-d954-478a-a1d1-2aa7ff562e09","resolution":{"observed_at":"2026-08-11T23:25:10.627429Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.613685Z","title":"An optical image-aided approach for zero-shot sar image scene classifica- tion,","venue":null,"work_id":"543f9de5-f94e-4446-9937-733124a2596c","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.326298Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:bc8c14544266b579665ce729d60b82e7c6f036ae983a48ac597bb234a32312cd","observation_id":"63606dcf-7ef1-48ca-96c8-42c6ef88bc77","resolution":{"observed_at":"2026-08-11T23:25:10.617723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.603840Z","title":"Alignment and fusion using distinct sensor data for multimodal aerial scene classification,","venue":null,"work_id":"2f250528-c72e-4b6d-95d8-ed271402c29b","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.329375Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:f430a8f7dac79d1c5c842f944629040b02f42192f767265570731486bb17f0d0","observation_id":"a1a2c3d8-c511-4dae-a7ec-1a7bdb13eaf7","resolution":{"observed_at":"2026-08-11T23:25:10.607260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.332515Z","title":"Text2seg: Remote sensing image semantic segmentation via text-guided visual foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.332515Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:98323beb04832e9501d795615fddd0939d106addeba0153c82f25644d3994635","observation_id":"a75a814f-958d-4879-9e2a-90e740063b27","resolution":{"observed_at":"2026-08-11T23:25:10.332515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.593870Z","title":"Parameter-efficient transfer learning for remote sensing image-text retrieval,","venue":null,"work_id":"363f56a2-5b1a-4262-a8db-cc9b187bf6e7","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.335765Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:1b6ecc87f0a9a120054a049739304697ed7650322818b66dee1f78d00e345f80","observation_id":"4de625c1-270d-4dbe-b0df-17d64887ab11","resolution":{"observed_at":"2026-08-11T23:25:10.597502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.583998Z","title":"Interacting- enhancing feature transformer for cross-modal remote-sensing image and text retrieval,","venue":null,"work_id":"8e31b96d-82a2-41c2-9e56-21a70233ba37","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.338847Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:4ea840079c203d4810f7e78394ef7dc8292fea1be8c3c8492db2b83ef90785c7","observation_id":"f7b8332f-69e6-4264-b83f-52d170207ec3","resolution":{"observed_at":"2026-08-11T23:25:10.587501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.573962Z","title":"Few-shot remote sensing image scene classification: Recent advances, new baselines, and future trends,","venue":null,"work_id":"408b032e-eb42-4a0e-a1ea-345e33b7606b","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.341993Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:245f9e4640f891c2d87e05a11eef43959563ad1edd5f78807f7e28a6d0768a83","observation_id":"1f16899c-85ef-45dd-a398-b31376b6ccbb","resolution":{"observed_at":"2026-08-11T23:25:10.577824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04005","last_updated":"2023-08-08T02:48:46Z","snapshot_observed_at":"2026-08-11T22:08:50.774801Z","submitted_at":"2023-08-08T02:48:46Z","title":"Few-shot medical image classification with simple shape and texture text descriptors using vision-language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04005","snapshot_observed_at":"2026-08-11T23:25:10.345426Z","title":"Few-shot medical image classification with simple shape and texture text descriptors using vision- language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.345426Z"},"links":{"cited_paper":"/paper/2308.04005","citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:93f7e5fd1895540be1c6abb874fef624bda92267b534bbd5b7181ab454a3182a","observation_id":"18f3fbe3-8b87-4d28-a26f-8ac5abeffb9c","resolution":{"observed_at":"2026-08-11T23:25:10.345426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.563886Z","title":"Vision-language model for generating textual descriptions from clinical images: model development and validation study,","venue":null,"work_id":"a671bb64-73d5-46d6-946d-89c2cd18b84c","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.349243Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:c0fb612f00502da17c3b5562be177c30e9f0da81ef864198917be6a2c043e31d","observation_id":"c94b1f13-b0d8-48a9-860f-f6d705d5e643","resolution":{"observed_at":"2026-08-11T23:25:10.567331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.553891Z","title":"Medical image understanding with pretrained vision language models: A comprehensive study,","venue":null,"work_id":"12abc977-7bf1-4653-a85c-357965656ad9","year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.352529Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:a0c52768fd7b2306489bdf0f064b44d4bd5b26599899950bc65a73e2373add36","observation_id":"da38a411-eb5e-4bb6-9795-dbdbf2926c31","resolution":{"observed_at":"2026-08-11T23:25:10.557266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15836","last_updated":"2025-07-29T02:33:12Z","snapshot_observed_at":"2026-08-03T10:58:43.509887Z","submitted_at":"2024-03-23T13:24:30Z","title":"VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification","version":3},"cited_work":{"arxiv_id":"2403.15836","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.15836","snapshot_observed_at":"2026-08-11T23:25:10.413986Z","title":"VLM-CPL: Consensus Pseudo Labels from Vision-Language Models for Annotation-Free Pathological Image Classification","venue":"cs.CV","work_id":"fb23fc0f-f8f3-4df6-b973-32ffe19ae4ba","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.355724Z"},"links":{"cited_paper":"/paper/2403.15836","citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:6abbbe3de21b7e188855c66dd03ca58a424d088cb512ad60e3979ee745d60777","observation_id":"64a15a57-9d45-4872-9e6a-b2d36ecd8e68","resolution":{"observed_at":"2026-08-11T23:25:10.419574Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.543739Z","title":"Improved zero-shot classification by adapting vlms with text descriptions,","venue":null,"work_id":"596390eb-aaf4-4a63-b217-fb4c67869e44","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.359331Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:71e7b03e5883b6c7f7666fdd90f4619c128557cf32e969e81a5b5d736515045d","observation_id":"42cf6449-0ff5-4167-a4f4-40965193b14d","resolution":{"observed_at":"2026-08-11T23:25:10.547199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.533030Z","title":"Exploiting lmm-based knowledge for image classification tasks,","venue":null,"work_id":"594d165c-337d-4cd6-ba2a-9ca579df53d0","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.362556Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:50479ed3318fbfe7e6fb3eb145a7855b8d709300848c0c65bfa3e21ed073e7a9","observation_id":"33fd1be0-9798-49a7-b681-d2b250db52ac","resolution":{"observed_at":"2026-08-11T23:25:10.536941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.523081Z","title":"Visual instruction tuning,","venue":null,"work_id":"638f74fe-89d7-48b6-bc71-7332808c7517","year":2024},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.366014Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:cf2c1d44de3e49b4500133128a4841b36609e1a39f5766e5bc3a3c8b7e57a5df","observation_id":"72d59773-5176-4f51-8408-cf63cff6aafa","resolution":{"observed_at":"2026-08-11T23:25:10.526594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T23:25:10.369305Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.369305Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:383de5cbcdb45c8492d8f0513161b6a24ada36f9eace7e151cda1bfb499e0fc5","observation_id":"80dc399b-2693-4174-ad2f-2f4381ea9fdf","resolution":{"observed_at":"2026-08-11T23:25:10.369305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.372826Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.372826Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:b597a1939d6b00e2e24e1f3a03777302e5f8a1beb7ecba3c842dcdbe3225f108","observation_id":"6a9a74f2-f280-466b-a6cb-68413ec2a2f5","resolution":{"observed_at":"2026-08-11T23:25:10.372826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T23:25:10.376115Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T23:25:10.376115Z"},"links":{"citing_paper":"/paper/2412.02531"},"observation_digest":"sha256:9526f62a7b2be9290a33c1ea0802c64769268198c6547b827e702377d5b4c928","observation_id":"f43a904c-1605-4580-8050-66cb49da067f","resolution":{"observed_at":"2026-08-11T23:25:10.376115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.02531","last_updated":"2024-12-03T16:24:16Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-11T23:19:02.151319Z","submitted_at":"2024-12-03T16:24:16Z","title":"Multimodal Remote Sensing Scene Classification Using VLMs and Dual-Cross Attention Networks"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":35},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2412.02531."}