{"as_of":"2026-08-15T14:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:efdb395b4d9758e6099da802259fad6ed2e0da254d4cf116eaf683b57c7fed7e","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:32:30.556929Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.24340/citation-record","integrity":"/paper/2505.24340/integrity","json":"/paper/2505.24340/citation-record.json","paper":"/paper/2505.24340"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T12:32:29.518410Z","title":"A., Bach, N., Bahree, A., Bakhtiari, A., Bao, J., Behl, 6https://github.com/microsoft/ geo-vision-labeler 8 GeoVision Labeler H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.518410Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:a4d627b380d28f9f2fe31dc6474d3bdce3e26603be87d540d87718bc0fc65ea6","observation_id":"dad22c73-f48a-456d-92b5-cce0c37daba9","resolution":{"observed_at":"2026-08-07T12:32:29.518410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.00125","last_updated":"2025-03-31T18:19:41Z","snapshot_observed_at":"2026-08-09T01:11:09.941267Z","submitted_at":"2025-03-31T18:19:41Z","title":"LLMs for Explainable AI: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.00125","snapshot_observed_at":"2026-08-07T12:32:29.744760Z","title":"Llms for explainable ai: A comprehensive survey","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.744760Z"},"links":{"cited_paper":"/paper/2504.00125","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:eb5d5ee55a58a322b03100efdfa8c1dbc832c15cf333d0936a40a4ddf65412cb","observation_id":"1a0f4c1b-f7b7-4d64-ad80-0f0e38b51fae","resolution":{"observed_at":"2026-08-07T12:32:29.744760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-13T14:05:48.329373Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-08-07T12:32:30.129101Z","title":"and V ondrick, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.129101Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:4639551cefffb5462ace19cb517cf4a23ea0ea288e79e9ddeaf9178869b6b597","observation_id":"d21fe554-45c5-4153-ac4d-f257fae3698e","resolution":{"observed_at":"2026-08-07T12:32:30.129101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T12:32:30.331687Z","title":"Peng, Z., Wang, W., Dong, L., Hao, Y ., Huang, S., Ma, S., and Wei, F","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.331687Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:5478b870554fb49978cafc6a2cb700076292fc0481229a1a5a921e89a60882a9","observation_id":"bd62e7a4-c7cf-44dc-9aa4-c8b5d0dbfdf5","resolution":{"observed_at":"2026-08-07T12:32:30.331687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.11958","last_updated":"2021-05-20T19:12:39Z","snapshot_observed_at":"2026-08-13T20:09:36.544750Z","submitted_at":"2021-02-23T22:01:22Z","title":"The SpaceNet Multi-Temporal Urban Development Challenge","version":2},"cited_work":{"arxiv_id":"2102.11958","doi":null,"metadata_source":"pith","pith_arxiv_id":"2102.11958","snapshot_observed_at":"2026-08-07T12:32:30.759939Z","title":"The SpaceNet Multi-Temporal Urban Development Challenge","venue":"cs.CV","work_id":"62289098-b00f-45bc-bfc9-052eb7e1c97e","year":2021},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.491776Z"},"links":{"cited_paper":"/paper/2102.11958","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:fcf8b84d8e2e786b3de2118886cf6be4adf170d1a9364a6a5591f0a006619dc9","observation_id":"5531cd96-abb5-4fb5-987d-6041670511b4","resolution":{"observed_at":"2026-08-07T12:32:30.837086Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:32:29.855808Z","title":"The Llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.855808Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:64c25fb3b8a54c3999bf24569e7db2dc6bbe35d7bf096cb46120d6e23986b2b1","observation_id":"de1da1ea-d7b6-49c1-8044-8c25a2711e61","resolution":{"observed_at":"2026-08-07T12:32:29.855808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.06721","last_updated":"2019-11-15T16:09:38Z","snapshot_observed_at":"2026-08-13T20:42:23.562418Z","submitted_at":"2019-11-15T16:09:38Z","title":"In-domain representation learning for remote sensing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.06721","snapshot_observed_at":"2026-08-07T12:32:30.216555Z","title":"S., Zhai, X., and Houlsby, N","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.216555Z"},"links":{"cited_paper":"/paper/1911.06721","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:80d71b870f1c7023f4855022991f94d03e80c115d3f2b0ed481ab56baf97277c","observation_id":"70f415d4-94db-4251-8c1c-f1739eabfae4","resolution":{"observed_at":"2026-08-07T12:32:30.216555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18415","last_updated":"2024-11-03T18:23:45Z","snapshot_observed_at":"2026-08-12T23:55:53.030179Z","submitted_at":"2024-05-28T17:57:06Z","title":"Why are Visually-Grounded Language Models Bad at Image Classification?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18415","snapshot_observed_at":"2026-08-07T12:32:30.556929Z","title":"Why are visually-grounded lan- guage models bad at image classification? arXiv preprint arXiv:2405.18415,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.556929Z"},"links":{"cited_paper":"/paper/2405.18415","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:426b3840139fb26e04655981c3cc6943189fda8163c17055749985f51161891c","observation_id":"22352f41-f8c3-4b2c-851f-73ded0b38e90","resolution":{"observed_at":"2026-08-07T12:32:30.556929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.13364","last_updated":"2020-09-28T14:34:15Z","snapshot_observed_at":"2026-07-06T09:59:26.000400Z","submitted_at":"2020-09-28T14:34:15Z","title":"RS-MetaNet: Deep meta metric learning for few-shot remote sensing scene classification","version":1},"cited_work":{"arxiv_id":"2009.13364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2009.13364","snapshot_observed_at":"2026-08-07T12:32:31.226111Z","title":"RS-MetaNet: Deep meta metric learning for few-shot remote sensing scene classification","venue":"cs.CV","work_id":"179485f8-6ded-42dd-809d-7972926ba4ad","year":2020},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.945727Z"},"links":{"cited_paper":"/paper/2009.13364","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:1566cb78c77b5d44e8b7f03b60b5b8287ce944c995f4dfdea7951298358ea146","observation_id":"3b9caf7d-bcce-49ff-8e1f-4aa3eb8e0df9","resolution":{"observed_at":"2026-08-07T12:32:31.280271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:32:31.484925Z","title":"Leverage weekly annotation to pixel-wise annota- tion via zero-shot segment anything model for molecular- empowered learning","venue":null,"work_id":"f0220278-a8c5-4584-8cb1-28f113dc5ad2","year":2024},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.014550Z"},"links":{"citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:a4d4e9cdefe15616b6d7bc3dd148a4bd5fbc7385bacdc2e15be489b77a23e91d","observation_id":"91c6165c-321b-4645-a026-080eaa4379fc","resolution":{"observed_at":"2026-08-07T12:32:31.546428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:32:29.646943Z","title":"L., Almeida, D., Altenschmidt, J., Altman, S., Anadkat, S., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:29.646943Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:74362c326f8222269dff4efb532dd8c82b73c5eda2c81f848764823dfa84f88d","observation_id":"613bf321-c6bf-4800-8cff-12924cffa3a6","resolution":{"observed_at":"2026-08-07T12:32:29.646943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05457","last_updated":"2025-04-07T19:46:59Z","snapshot_observed_at":"2026-08-14T05:36:58.798533Z","submitted_at":"2025-04-07T19:46:59Z","title":"Taxonomy-Aware Evaluation of Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2504.05457","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.05457","snapshot_observed_at":"2026-08-07T12:32:30.926153Z","title":"Taxonomy-Aware Evaluation of Vision-Language Models","venue":"cs.CV","work_id":"92863d65-16b0-4fe4-a103-c4ba1280c7a0","year":2025},"citing_paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T12:32:30.425414Z"},"links":{"cited_paper":"/paper/2504.05457","citing_paper":"/paper/2505.24340"},"observation_digest":"sha256:ceefda71e2fed8a88eac5ee0eb022543786ed63b0982603ea234322b74b6acf0","observation_id":"74002761-3f58-4783-8bb4-a4d373d2fa3b","resolution":{"observed_at":"2026-08-07T12:32:30.994782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24340","last_updated":"2025-05-30T08:32:37Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T04:21:05.862812Z","submitted_at":"2025-05-30T08:32:37Z","title":"GeoVision Labeler: Zero-Shot Geospatial Classification with Vision and Language Models"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":8,"verified_exact":3,"verified_fuzzy":1},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2505.24340."}