{"as_of":"2026-08-16T02:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:578691d55b9f7db46630a5ccf673b9089ddfbd6fa7fb895a36c633bd1261ddaf","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T22:06:12.034163Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07172/citation-record","integrity":"/paper/2606.07172/integrity","json":"/paper/2606.07172/citation-record.json","paper":"/paper/2606.07172"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:0ce5e3a5d8e1f1978d53e04de3564e1a5d4f8d6076410fd9497b3e28ea020cc6","observation_id":"69a00fb7-d0b8-4902-90e6-fc7af31d63ee","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:d07c64de2e3453aa732f441612755310cf179710415c9ace29c866482397e7ba","observation_id":"5d31b4df-f8ca-4d6b-b945-d815ba60b067","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:c162fcf9d86a3bf1a9cf4a4294f1d9c2fdc678059b4254ce3a074ce8032373e3","observation_id":"df6cacb8-9b4a-4ffd-9998-cf7811b9e012","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Demystifying","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:be739e72ebad02e5e9669d05b235db08edd6461b77d22e4d8687bc5967180d1a","observation_id":"2d9a852e-7781-4610-a444-7999ae75af9c","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:f0dab71434f9b829f0d0a0c520937af09dbc5a768e13a903894ae16ed0c4e8bf","observation_id":"5691bffc-b420-4a64-a141-519ed09174a8","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:f6175ae9e5c7bff04baa60ef373d1b364e23dbee50e15df0396f9ce7a7720ef0","observation_id":"bc4c313e-e960-4146-b7f3-574895345789","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Transformer Circuits Thread , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:eae89d8a20580ffa35e5af8e3dad51052f75cca28dd45ed2b14e0eb833cb6705","observation_id":"f258aabe-79df-48ee-a650-94ebf23b0fe9","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:0c57b3faa4f6c3592f0c10482d2e2b7c27af1998245a48f754c90ac774de34e4","observation_id":"f344cef6-aa83-48c3-8e75-928ea24fe8fa","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:99e0590a861af85a69a5694c0cf580136ddcefcfc333b3c75e13dbb0fb41020e","observation_id":"1b7b267c-9e1a-4a8d-b0c8-021a195e2e87","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:29ea162ca756a2e8eff5d9320f7301819a35d1f12c881a07f3a8d8e57482ae99","observation_id":"9bc7f7e0-9b40-45a5-9f13-df59827555cd","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:2469ac771f303ce0d99e9f0948f0a55a2bc18b0953c7228a34899ad5766cbe5d","observation_id":"5aa30d2f-e161-4456-8084-367bb1270063","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:65abd2c008ed6fc17253e8f8df4448359bb5c69aa51f3737b5ff60a2fc28357f","observation_id":"8e582683-26b0-4522-971d-da9ce24cc1a7","resolution":{"observed_at":"2026-07-02T17:17:14.969927Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06727","last_updated":"2022-12-13T16:55:12Z","snapshot_observed_at":"2026-08-13T13:22:40.427545Z","submitted_at":"2022-12-13T16:55:12Z","title":"What do Vision Transformers Learn? A Visual Exploration","version":1},"cited_work":{"arxiv_id":"2212.06727","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.06727","snapshot_observed_at":"2026-07-02T17:17:14.971022Z","title":"What do vision transformers learn? a visual exploration","venue":null,"work_id":"1799a8a3-6c8c-42f7-be7c-aceca9edd041","year":2022},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"cited_paper":"/paper/2212.06727","citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:c0758f7c021dafbfe9e803e553c733418eb1f96fead7baa82e7fb8953b211b1f","observation_id":"54c4e797-6c7b-49d6-a5d0-fce4f59bd905","resolution":{"observed_at":"2026-07-02T17:17:14.972599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"International Conference on Machine Learning , pages=","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:3faa58a394b9fe6a4ea2c933972220f7ec85d588cbea990d5892faaba6f33b62","observation_id":"aecfdf97-a521-400e-ac62-90c7c10089ed","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Transactions on Machine Learning Research , issn=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:397c40751376b7fac2d61eac0311ffeebe686227a981a3b6262e4255db4cec8e","observation_id":"c6c68267-40cc-4624-8c0b-834acc581e5b","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Transactions on Machine Learning Research , issn=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:f8301f5f2269952ba9f57eb0de4a9d83f5954b1c268046d08cb08fbedadd656d","observation_id":"3fdb4ec0-3865-4a7f-bda5-2101268eaf54","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:45996687f8743aa0a5480f5f9be095436d48be5108c2417098e4bd5df846a52e","observation_id":"f2d0858f-e673-4616-b6dd-f6cb5c3894fc","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:f3341799622a261a0a16fc4fc2d5d170891dddc939ab9e207627f50701769193","observation_id":"7ada665c-2f3b-4618-9a5a-760acd0b06f1","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:b1ed2c68e3665ac5f38a42c74f29b61092292f568fef445777d812e053b329b6","observation_id":"e43e6c96-fe40-4779-8b8b-6c9dc3ef0f9f","resolution":{"observed_at":"2026-07-02T17:17:14.967827Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"2024 , booktitle=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:35f89b6f59c903e58234fa0ba4faed225c3c9044af0844343b926988484f89bf","observation_id":"72f52cee-7417-4d61-937e-caf6d20dd71a","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Charting new territories: Exploring the geographic and geospatial capabilities of multimodal","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:193ffbe193baf746649d912fc096a379a65b7b7fc6dedcdada28d9efe21892b6","observation_id":"f1a3c326-cbad-4b86-bfc2-dfd486738d11","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:05d2c9d0e1454fa3f497f3556439598a2c9fc8ea16c4fe50c9b85832c197b811","observation_id":"058b1ed9-60d7-492f-b340-c820b0a0b83c","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:f39ebdd19b2c7ed27da0157715b65eeaaea27f7da666ef8bb90f636bf07f3103","observation_id":"0c3f93fd-eb10-4c64-a545-1699f9be0d0b","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"2017 , journal=","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:4eb95352997c09ef9fc33d5ae301bad0c69873660a9ff45cb43a471c3f9998fc","observation_id":"394d3a56-3a56-4b18-bf0e-63ea01fc556c","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"2016 , publisher=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:65a3dce12c36d8599a47e36814c4d90b460e595f54d4e619d7365ab8faaded1b","observation_id":"dee5dad3-777f-4dbf-8c0d-cd2353058d34","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"2009 , organization=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:c908223f41a3539bd2b7f554e84dddcb79be1a8da614d5986c50daca18e85a39","observation_id":"2077718d-c2a9-4cb1-9c4f-69600123dd56","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Psychometrika , volume=","venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:cec9f3c42ba98538e23227d2d540bde9af316df7659d5e56e2d46e7f27fa96c1","observation_id":"820967b4-3667-4d81-aa00-c43aad1cf045","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"2016 , organization=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:14289b59131bb3639289dd9348b1c7974abd1c0b062edb449fb774a1a8d346fb","observation_id":"a35d24f1-aa88-4e92-afb1-0b6d81bc5cd3","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:933838807d1a1c4e32036077534340a4440fffe107fc584700d022e1460d3ec7","observation_id":"ca68bad9-91d2-423c-a3ab-f71fbc307a38","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":", booktitle=","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:452809e6e2e3345b271d5543401dbf2d2c145097fff84d35b69186e7958aea9f","observation_id":"c080a9ea-3bd4-47dc-800e-0908d5115591","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:e7015522e6facec466bf2d4d84e651c5ca664a2971219f6b2820a9902a4c0a3a","observation_id":"ee61eefb-5e70-485e-8420-701d089bb858","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-08-14T23:20:42.336514Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":"1409.1556","doi":"10.48550/arxiv.1409.1556","metadata_source":"pith","pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","venue":"cs.CV","work_id":"1c4b4409-c14b-488b-a086-c57a5aab8a29","year":2014},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:173126ec9b17543beaf8549bc616cb16f45a4a31323c90cc1982b193b9b0f37e","observation_id":"5b16110f-07b7-45d3-8a67-305ce80eed81","resolution":{"observed_at":"2026-07-02T17:17:14.974985Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Technometrics , volume=","venue":null,"work_id":null,"year":1979},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:21e7769e223569c9d8ef47600799f03d3287e7ddde811574b486e4335f5b8ad2","observation_id":"5c01e82e-16a0-40ff-a045-2d4426f0e70b","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"2011 , isbn =","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:b28339b5f9af0f42957bab99e182832f2d0e3cb2ef6d548238f80e8acff81f20","observation_id":"ddfef5d0-ce97-4893-a323-2f942dc0135a","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:d788d7e5ef9e575ead6a4257c5a8ad6884c151dd6550754f1fe1f674ccabd7b6","observation_id":"f397d33b-393b-4568-b42a-f004a60410f9","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the 2024 Joint International Conference on Computational Linguistics, Language Resources and Evaluation (LREC-COLING 2024) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:a2be7c64d3433280b0a0a92b2f249618c232825ef65ec954b83a9f306a43a42a","observation_id":"8b961c05-a902-4170-a615-4c781ba0f56f","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:145bf8c376e3ce3341a2499bc58defe2bce0d83b9d674ef8db4a9e3d81857a6e","observation_id":"3ec697b0-6c9a-4ba4-b5c5-53d482cad5b9","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"MediaEval Benchmarking Initiative for Multimedia Evaluation , year=","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:6c2e1adbb66dacff9b165452ddc0c00617c9ce58f76afd35bb8471b90ae03783","observation_id":"ce80efaf-a58f-49b1-8f40-933a185a81aa","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:f6f3281db5d9fee80ba3bd2770c6efd28767b1587a3bdb403427f95fecec3f4b","observation_id":"951249cd-8491-442b-974b-e472b54a8390","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:0b36535185adcb9561a86cf605441da5e48b37e8762dc3f4bbe340a648286f1d","observation_id":"fc222b02-d93e-4ffa-a6d4-3cfaf1efdaf7","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T22:06:12.034163Z","title":"International Conference on Machine Learning , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T22:06:12.034163Z"},"links":{"citing_paper":"/paper/2606.07172"},"observation_digest":"sha256:0e64abb551a42228f482359eeebf52ef1bf5a52ea01a48cbfc0c4e302cbda65e","observation_id":"464d4b17-f84f-4dd0-b106-40195cc3571e","resolution":{"observed_at":"2026-06-27T22:06:12.034163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07172","last_updated":"2026-06-05T11:40:13Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T23:46:51.468468Z","submitted_at":"2026-06-05T11:40:13Z","title":"Textual Supervision Enhances Geospatial Representations in Vision-Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":37,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2606.07172."}