{"as_of":"2026-08-10T12:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8e538b2eeed6261e64dbe85d82f32a4aa2bd24b98a48b7bcfc83694a04535eea","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:52:10.218789Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:12:10.857306Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T23:06:20.239381Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-08-06T23:12:10.857306Z","title":"Geolocsft: Efficient visual geolocation via supervised fine-tuning of multimodal foundation models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.19406","last_updated":"2025-06-24T08:20:08Z","snapshot_observed_at":"2026-08-09T15:42:40.230036Z","submitted_at":"2025-06-24T08:20:08Z","title":"A Global-Local Cross-Attention Network for Ultra-high Resolution Remote Sensing Image Semantic Segmentation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:10.857306Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2506.19406"},"observation_digest":"sha256:46d7ea0890df70a1d7f92090b2777c03232625b23c7d8093cfd9d74c646e610f","observation_id":"5da9a71f-b019-499b-aeee-179f85ab3b52","resolution":{"observed_at":"2026-08-06T23:12:10.857306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-08-06T23:00:29.112400Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20688","last_updated":"2025-06-25T03:23:16Z","snapshot_observed_at":"2026-08-09T08:17:06.215899Z","submitted_at":"2025-06-25T03:23:16Z","title":"Building Lightweight Semantic Segmentation Models for Aerial Images Using Dual Relation Distillation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T23:00:29.112400Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2506.20688"},"observation_digest":"sha256:3011f4a011392825526a02981e761a3657cd14f40163753ba5a19964e238efa4","observation_id":"c1b68c6f-60f2-4d40-b263-be1b4624e2e8","resolution":{"observed_at":"2026-08-06T23:00:29.112400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-08-06T21:24:31.913301Z","title":"Geolocsft: Efficient visual geolocation via supervised fine-tuning of multimodal foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00363","last_updated":"2025-07-01T01:29:31Z","snapshot_observed_at":"2026-08-09T08:18:45.833448Z","submitted_at":"2025-07-01T01:29:31Z","title":"GDGS: 3D Gaussian Splatting Via Geometry-Guided Initialization And Dynamic Density Control","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:24:31.913301Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2507.00363"},"observation_digest":"sha256:aad66fd463edd325f602e7824ca7faba933da03cef2f6312fdeaf9cc1c13c7e4","observation_id":"0a34a1ef-010f-4b43-8de7-cf7d9ee70961","resolution":{"observed_at":"2026-08-06T21:24:31.913301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-07-01T23:06:20.239381Z","title":"arXiv preprint arXiv:2506.01277 , year=","venue":null,"work_id":"fd4414ae-7062-4d6e-90d9-b1dc4078e7d5","year":2025},"citing_paper":{"arxiv_id":"2508.01608","last_updated":"2026-05-15T21:06:13Z","snapshot_observed_at":"2026-07-06T22:06:58.031276Z","submitted_at":"2025-08-03T06:04:33Z","title":"From Pixels to Places: A Systematic Benchmark for Evaluating Image Geolocalization Ability in Large Language Models","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-21T23:49:59.795575Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2508.01608"},"observation_digest":"sha256:0d6627323df877786a7efe235485008b37156e0778e3293a18759cca3e6d174a","observation_id":"4aab417b-4cd4-4650-9ded-b40c41c22580","resolution":{"observed_at":"2026-05-21T23:50:47.271597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":"2506.01277","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-07-01T23:06:20.239381Z","title":"arXiv preprint arXiv:2506.01277 , year=","venue":null,"work_id":"fd4414ae-7062-4d6e-90d9-b1dc4078e7d5","year":2025},"citing_paper":{"arxiv_id":"2606.07642","last_updated":"2026-06-01T18:46:43Z","snapshot_observed_at":"2026-08-01T21:19:56.423505Z","submitted_at":"2026-06-01T18:46:43Z","title":"Do VLMs See What Sensors Feel? A Scalable Expert-Guided Design for Wheelchair Accessibility Assessment from Street View","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-28T14:42:47.815192Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2606.07642"},"observation_digest":"sha256:87b1890111b4948dd40ecd0ccdb19011e384347a10e55087adc36ac9207f76a6","observation_id":"556d334e-529f-4853-a0ff-ca369f038b59","resolution":{"observed_at":"2026-07-01T23:06:20.241225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01277","snapshot_observed_at":"2026-07-30T22:45:19.083071Z","title":"Geolocsft: Efficient visual geolocation via supervised fine-tuning of multimodal foundation models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.24856","last_updated":"2026-07-26T02:51:53Z","snapshot_observed_at":"2026-08-07T06:47:06.770145Z","submitted_at":"2026-07-26T02:51:53Z","title":"DisasterTD: Disaster Toponym Disambiguation Using Multimodal LLMs and Cross-View Geolocalization","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-30T22:45:19.083071Z"},"links":{"cited_paper":"/paper/2506.01277","citing_paper":"/paper/2607.24856"},"observation_digest":"sha256:211d3d0002d616442c60eb86d303b8ceec3c165df29ddd6d81e73ad6e2ea6e19","observation_id":"33241b1a-4fed-42af-80bf-13ec998b5cfb","resolution":{"observed_at":"2026-07-30T22:45:19.083071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.01277/citation-record","integrity":"/paper/2506.01277/integrity","json":"/paper/2506.01277/citation-record.json","paper":"/paper/2506.01277"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-07T11:52:08.326032Z","title":"Learning transferable visual models from natural language supervision.arXiv preprint arXiv:2103.00020, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.326032Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:8b7043beb34f424206ceb6b0ddd939f48476cbcdb041a5061da5f246ccd039d5","observation_id":"5b870ec5-2ecf-4f1f-9453-a203fb34e9ec","resolution":{"observed_at":"2026-08-07T11:52:08.326032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:13.289589Z","title":null,"venue":null,"work_id":"d4be31f2-215e-4efa-88bf-bfa8198ee3d9","year":2008},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.362373Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:baebf0554a4a56829fc14f2cc43c2d61313adcd6bb01b71cff1d23f7ece8ce88","observation_id":"6a14bccb-dcf5-45f6-b2a3-7a98fa9acb10","resolution":{"observed_at":"2026-08-07T11:52:13.349011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:08.387126Z","title":"PlaNet - photo geolocation with con- volutional neural networks","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.387126Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:a78f52126c8d873dd12d706447dff83a95f81881ba5ac3aa538e1dc6ef01ed07","observation_id":"1141b9f7-2500-4a76-8e86-177824a35b62","resolution":{"observed_at":"2026-08-07T11:52:08.387126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.05845","last_updated":"2024-05-28T22:00:10Z","snapshot_observed_at":"2026-08-09T08:19:08.177076Z","submitted_at":"2023-07-11T23:36:49Z","title":"PIGEON: Predicting Image Geolocations","version":6},"cited_work":{"arxiv_id":"2307.05845","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.05845","snapshot_observed_at":"2026-08-07T11:52:10.837728Z","title":"PIGEON: Predicting Image Geolocations","venue":"cs.CV","work_id":"1d23e233-24e7-44bd-bde8-a9618993a59c","year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.433343Z"},"links":{"cited_paper":"/paper/2307.05845","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:0f20f0411f74fc51e418e39b6e197c403690d89b1f377716214c46237792a482","observation_id":"148ace07-28fb-49c5-85a7-6ba3ad394ec2","resolution":{"observed_at":"2026-08-07T11:52:10.869770Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09474","last_updated":"2024-08-18T13:39:43Z","snapshot_observed_at":"2026-08-05T18:35:37.834773Z","submitted_at":"2024-08-18T13:39:43Z","title":"Image-Based Geolocation Using Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09474","snapshot_observed_at":"2026-08-07T11:52:08.551981Z","title":"Image-based geolocation using large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.551981Z"},"links":{"cited_paper":"/paper/2408.09474","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:d64eac5a037ea085fd3c4b9e3e94692d7f4933a02ce72c71c14075e5d674a66f","observation_id":"fee7286f-50b1-4b48-a43b-13fa9eb5c07f","resolution":{"observed_at":"2026-08-07T11:52:08.551981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T11:52:08.601226Z","title":"Chain-of-thought prompting elicits reasoning in large language models.arXiv preprint arXiv:2201.11903, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.601226Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:ac8d3463767acee98300b2227e8f28e48977f3ee8879ff45903a9c9871f00270","observation_id":"a2dc9744-dbad-4f52-852a-7bfcb6c5134f","resolution":{"observed_at":"2026-08-07T11:52:08.601226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T11:52:08.630800Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.630800Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:56918dfb44ca272817e94b5f7bbb6b4e710bc141f46dca04e5a3c302a42fe312","observation_id":"7b13da83-2661-40bd-b0f2-60b00ee1c4f7","resolution":{"observed_at":"2026-08-07T11:52:08.630800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:13.188486Z","title":"Neural network ensembles.IEEE Transactions on Pattern Analysis and Machine Intelligence, 12(10):993–1001, 1990","venue":null,"work_id":"ed10b193-0363-476c-afb5-e3011a861516","year":1990},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.677012Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:6818dcbb97a8a8710a83041652a66288209317a24e855b55dbd940155b500271","observation_id":"30c03c75-74da-45cd-a91b-d1218652f3af","resolution":{"observed_at":"2026-08-07T11:52:13.244819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:08.724712Z","title":"Shamma, Gerald Friedland, Benjamin Elizalde, Karl Ni, Douglas Poland, Damian Borth, and Li-Jia Li","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.724712Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:1000e14da316d24dffadd0ed0f0375264e8152226b3bc97661958bd8c2d8b3a5","observation_id":"a64f0ec5-2882-4c39-8759-e00d3c24ef5a","resolution":{"observed_at":"2026-08-07T11:52:08.724712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04249","last_updated":"2023-03-07T21:47:58Z","snapshot_observed_at":"2026-08-08T08:18:07.576649Z","submitted_at":"2023-03-07T21:47:58Z","title":"Where We Are and What We're Looking At: Query Based Worldwide Image Geo-localization Using Hierarchies and Scenes","version":1},"cited_work":{"arxiv_id":"2303.04249","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.04249","snapshot_observed_at":"2026-08-07T11:52:10.590806Z","title":"Where We Are and What We're Looking At: Query Based Worldwide Image Geo-localization Using Hierarchies and Scenes","venue":"cs.CV","work_id":"d8dbfe6d-243d-4b70-80ba-ff2fd3941743","year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.764186Z"},"links":{"cited_paper":"/paper/2303.04249","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:4f588a8584e323fdc44f6fd9b4eb4bff151de057b3aa4056b9593921d0a8545a","observation_id":"8dcf04f6-b1eb-42bb-9bd8-6608e1952def","resolution":{"observed_at":"2026-08-07T11:52:10.616398Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:13.037849Z","title":"The Mapil- lary Vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"b298ae9e-5784-4d58-8928-a7d6954ab6b3","year":2017},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.801352Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:21820fd4ab95fd001b7325a947b7808ccea71048de2634d2b98659ccc8c54c13","observation_id":"eb76507a-c259-486b-a3ce-9e3b118146cc","resolution":{"observed_at":"2026-08-07T11:52:13.100674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.921169Z","title":"GeoNames geographical database","venue":null,"work_id":"e291033d-9b95-4501-a7d1-76f1ec2484b8","year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.826571Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:edaadaac78188c4f9c6c9fb32059aa3b5b24f2b1e8977a6ea4787b5174a1e5d9","observation_id":"25452abf-1357-45ad-88ff-b01d1e19727f","resolution":{"observed_at":"2026-08-07T11:52:12.947008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T11:52:09.047711Z","title":"Qwen2.5-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.047711Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:91c7a4398f5e9ab65ab4b7df9fd2dea10184df86748c675891ad148d8c524a48","observation_id":"5169bda4-4f7d-42c3-a9a2-4dcc23558192","resolution":{"observed_at":"2026-08-07T11:52:09.047711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T11:52:09.081528Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.081528Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:645e8088ebcc2889c0b84ff80a6154d64d7742e3d5fd550fd8810fda350cb9da","observation_id":"54ddb3a1-3421-4792-a162-fd35c6d2a87d","resolution":{"observed_at":"2026-08-07T11:52:09.081528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18873","last_updated":"2024-04-29T17:06:44Z","snapshot_observed_at":"2026-08-10T10:42:18.679191Z","submitted_at":"2024-04-29T17:06:44Z","title":"OpenStreetView-5M: The Many Roads to Global Visual Geolocation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18873","snapshot_observed_at":"2026-08-07T11:52:09.120531Z","title":"OpenStreetView-5M: The many roads to global visual geolocation.arXiv preprint arXiv:2404.18873, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.120531Z"},"links":{"cited_paper":"/paper/2404.18873","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:39f89dce6000a0b3c969967a2a5a96d7b3b896bd66b33235e3a9e55f20ecd9bc","observation_id":"9ad4f2a6-8671-4596-87c9-e9dc77b2b336","resolution":{"observed_at":"2026-08-07T11:52:09.120531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.824477Z","title":"The Claude 3 model family: Opus, Sonnet, Haiku","venue":null,"work_id":"5a378a6a-80ef-4096-b301-16dc1a78aa91","year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.193032Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:31f125912336f13cea2c5c8561fb2f58a820f52e4821240add03d6c5e42e67cf","observation_id":"193b1e22-a3e6-49ce-8702-3dc16a604b34","resolution":{"observed_at":"2026-08-07T11:52:12.868679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-07T11:52:09.261284Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.261284Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:ad01869b8808c498aff2ac0be2c5e742d29cce71e4e9151cadb8f879e1d3b90c","observation_id":"7631d502-cc44-4fdb-9cae-f977578e16e5","resolution":{"observed_at":"2026-08-07T11:52:09.261284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.727369Z","title":"Mistral-Small-3.1-24B-Instruct-2503","venue":null,"work_id":"65544a3e-78f9-4f43-ac8d-c7a95cef6d57","year":2025},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.302998Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:3506d19cdfffb809fafe92a5627efe6f07d040d64ee68770feab1ed2941e8c70","observation_id":"b8c927a4-7674-4873-acef-447b02dfb975","resolution":{"observed_at":"2026-08-07T11:52:12.768597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.04838","last_updated":"2017-05-13T14:43:02Z","snapshot_observed_at":"2026-08-04T03:05:02.256122Z","submitted_at":"2017-05-13T14:43:02Z","title":"Revisiting IM2GPS in the Deep Learning Era","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.04838","snapshot_observed_at":"2026-08-07T11:52:09.371329Z","title":"Revisiting IM2GPS in the deep learning era.arXiv preprint arXiv:1705.04838, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.371329Z"},"links":{"cited_paper":"/paper/1705.04838","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:0f37669f98ac9d10c5163d801d7e26405e2f67f34cdff37c9b903410058c2f08","observation_id":"00ff3373-43a2-4640-9a60-16d45423daa3","resolution":{"observed_at":"2026-08-07T11:52:09.371329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T11:52:09.515725Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.515725Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:ac732b1c6ca215f56a41b97966fd68500146244864519c81f9f401d48afb3eaa","observation_id":"fe163f24-9bf9-4a1e-9068-23c0b9512cd1","resolution":{"observed_at":"2026-08-07T11:52:09.515725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T11:52:09.555930Z","title":"Consensus- Geo","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.555930Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:ce97dd4f68c27d8da8e1ec50769352bf23a97690de0122284f3284b347aca386","observation_id":"4c703f5e-d585-4cf8-9785-e4d83a4ec20f","resolution":{"observed_at":"2026-08-07T11:52:09.555930Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06781","last_updated":"2024-12-09T18:59:04Z","snapshot_observed_at":"2026-08-04T15:57:31.052276Z","submitted_at":"2024-12-09T18:59:04Z","title":"Around the World in 80 Timesteps: A Generative Approach to Global Visual Geolocation","version":1},"cited_work":{"arxiv_id":"2412.06781","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.06781","snapshot_observed_at":"2026-08-07T11:52:10.374159Z","title":"Around the World in 80 Timesteps: A Generative Approach to Global Visual Geolocation","venue":"cs.CV","work_id":"2f6aa69b-7435-430b-8f95-0602cfddd3e9","year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.473416Z"},"links":{"cited_paper":"/paper/2412.06781","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:daef805d70c39351d244083413ffcdf19f7605ebf3ba29cea915d0a98ebdc3ea","observation_id":"e70fda6e-38f2-403b-a5b8-43f8a2764ae7","resolution":{"observed_at":"2026-08-07T11:52:10.415712Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.641716Z","title":"Guidelines: • The answer NA means that the abstract and introduction do not include the claims made in the paper","venue":null,"work_id":"c5c39428-4834-41b2-b2dd-1056d4d50342","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.594635Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:4a19f793ea07b1daf4a9ae9c37e34d69c9e4640c42a31fef1eb683d11c4861b8","observation_id":"7dbbf803-2ed1-4664-ac0f-00481042e4bb","resolution":{"observed_at":"2026-08-07T11:52:12.675504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.560026Z","title":"Guidelines: • The answer NA means that the paper has no limitation while the answer No means that the paper has limitations, but those are not discussed in the paper","venue":null,"work_id":"d9b45eac-9f55-4958-9ed9-b3f9009cf646","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.627183Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:81af25292ca767c931e1ac89d7e3003ffa8f7df64f30f53fbb7e1cf2b3ed46b9","observation_id":"947e2810-6378-40e2-b3cf-419d7b1409a3","resolution":{"observed_at":"2026-08-07T11:52:12.601524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.431751Z","title":"Guidelines: • The answer NA means that the paper does not include theoretical results","venue":null,"work_id":"bba09b3a-ecda-457b-b275-932b3914d760","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.687952Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:0f7cfc8b8265e5f0fa7e02bf4433b4712a97abaec08600dff035d61e6ab99de2","observation_id":"9bcd7b9a-f880-435d-aec0-4ad3a7a11462","resolution":{"observed_at":"2026-08-07T11:52:12.486517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.349310Z","title":"The appendices include hyperparameters for SFT and information about computational resources used","venue":null,"work_id":"997ca7a1-2cb9-4b36-907a-31c5a19fe79e","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.751346Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:6586e883c3fda89d80134a1da70fb8062fe01211fab5aa6264fcfa575ca82c5e","observation_id":"62811774-990e-4f8c-9518-4fa0e1845b78","resolution":{"observed_at":"2026-08-07T11:52:12.393269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.275377Z","title":"Our appendices provide detailed instructions regarding implementation, hyperparameters, and experimental setup to facilitate reproduction","venue":null,"work_id":"b3f9c6ae-47c8-48e1-80cc-311808d2dad8","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.792357Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:94d31824cb496c1348d346451ed99759a291dbe06856c37a463b91d2b731edb1","observation_id":"7dc63ab1-963b-4bcd-b217-e92994f77b42","resolution":{"observed_at":"2026-08-07T11:52:12.301578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.195443Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"27a81c63-af6e-42ff-8142-de8871d1fa60","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.842854Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:6ed586119da22a2f743576a3443f1c0f39d649c65117a65769a85f978e5a603e","observation_id":"1dba0e3d-4065-44e2-a2ff-01d772224858","resolution":{"observed_at":"2026-08-07T11:52:12.220821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:12.054432Z","title":"Guidelines: • The answer NA means that the paper does not include experiments","venue":null,"work_id":"ac16147d-641a-4ec8-ae1f-1e498b972e3d","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.878555Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:595899d4fbc35cb75442911134822163f3a737efcf471fdfe71baf03e0399d23","observation_id":"5cc46a9c-3c83-45bd-a47d-a8079eb9fd12","resolution":{"observed_at":"2026-08-07T11:52:12.110456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.951722Z","title":"We also report model sizes and memory requirements","venue":null,"work_id":"56a42f48-94a9-4b09-89ec-d88c8ec9c661","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.888164Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:0efddf060f92c50d570fe0cf132484dd49c918eae3f8b4a6efe76aad9c038f28","observation_id":"180e1af7-572b-4d03-8655-1beb3d7b8761","resolution":{"observed_at":"2026-08-07T11:52:11.988746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.839129Z","title":"We use publicly available datasets, acknowledge relevant prior work, and are transparent about our methodologies","venue":null,"work_id":"86c19e8d-13ce-410d-8f66-b22295c5283e","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.925377Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:4674dab7c452a46801f161360f72b04bb0b1ec9071db3643234de5fe9a16f408","observation_id":"13c45ece-fa9c-4e7a-836b-b714c48619b8","resolution":{"observed_at":"2026-08-07T11:52:11.886563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.676194Z","title":"Guidelines: • The answer NA means that there is no societal impact of the work performed","venue":null,"work_id":"99381cfa-c34c-4597-b92a-cc5299c28cf8","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:09.978969Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:7b29a45f8f0c5793e6c370a4526cf89dc8e2a2d9731380a5ee7a04fd0ca193f0","observation_id":"54276147-772a-4883-9c90-95322fe4ce64","resolution":{"observed_at":"2026-08-07T11:52:11.755852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.583501Z","title":"27 Guidelines: • The answer NA means that the paper poses no such risks","venue":null,"work_id":"8fb1a132-8387-4f31-92e5-0723f562443c","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.027853Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:7b7795a82c3fb48c1c693eeb7d15e94bf64f61c00c892be20399967b5ed29891","observation_id":"bbf48e5d-e190-40dd-9d6b-1ed9331aa26a","resolution":{"observed_at":"2026-08-07T11:52:11.621881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.433916Z","title":"Guidelines: • The answer NA means that the paper does not use existing assets","venue":null,"work_id":"e472879b-8be8-4428-9748-880b2721430a","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.068261Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:91f628ed819f45b4b8d303ca794ea5fcebe7f047848d6bdf443bfe2c8dc31f29","observation_id":"3ef73617-d963-4be5-98a5-33ed5ad543e8","resolution":{"observed_at":"2026-08-07T11:52:11.507759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.249571Z","title":"This documentation will be released alongside the dataset","venue":null,"work_id":"feca53e1-6fa0-4c6a-8066-cb018f23914a","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.112687Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:8fdf065637a97500036eb6946e44882b009902393d7859c680aa46a145645a82","observation_id":"8125e676-e808-4062-8bd4-3cebc78c0535","resolution":{"observed_at":"2026-08-07T11:52:11.310523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:11.093236Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"5650df39-6511-415b-bc80-c3ea809ddf62","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.143213Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:2d25704366d5f61146e32dfd8c2758482adad262b616989263bb21417bd44bb3","observation_id":"04d645b3-ad62-46d9-a66e-d21e141be845","resolution":{"observed_at":"2026-08-07T11:52:11.158826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:52:10.938516Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"b46db30f-d8b6-4e0b-8740-1ad435785ce5","year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:10.218789Z"},"links":{"citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:8c92d39d8544eb6aea66ecc3b2bdd7452c5fe2a98131fa552f8a0ff71e4465c6","observation_id":"c14f16c0-6101-481f-82fd-6053b2217ae5","resolution":{"observed_at":"2026-08-07T11:52:10.997861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14702","last_updated":"2024-10-31T09:08:48Z","snapshot_observed_at":"2026-07-06T18:18:43.328203Z","submitted_at":"2024-05-23T15:37:06Z","title":"G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models","version":2},"cited_work":{"arxiv_id":"2405.14702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14702","snapshot_observed_at":"2026-08-07T11:52:10.752165Z","title":"G3: An Effective and Adaptive Framework for Worldwide Geolocalization Using Large Multi-Modality Models","venue":"cs.CV","work_id":"ce5761c1-68fa-4c2b-ad2f-f97f4f549dca","year":2024},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.501464Z"},"links":{"cited_paper":"/paper/2405.14702","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:5ff63edfe952374744b56171f3a2496dbf93b2842aac1e7b7de199f930a40e0a","observation_id":"2183609d-e1a8-486a-821c-40d15e3a9070","resolution":{"observed_at":"2026-08-07T11:52:10.788245Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T11:52:08.967423Z","title":"arXiv preprint arXiv:2503.19786","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T11:52:08.967423Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.01277"},"observation_digest":"sha256:11cc2924282328bf31350e78979ca54cbb453ed7d6fca4016aace9c874c0bbef","observation_id":"b42b2fe3-b71a-4bb4-a522-2881740e889e","resolution":{"observed_at":"2026-08-07T11:52:08.967423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.01277","last_updated":"2025-06-02T03:16:19Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T08:18:36.762628Z","submitted_at":"2025-06-02T03:16:19Z","title":"GeoLocSFT: Efficient Visual Geolocation via Supervised Fine-Tuning of Multimodal Foundation Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":4,"verified_fuzzy":20},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 6 inbound Pith citation observations for arXiv:2506.01277."}