{"as_of":"2026-08-18T05:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:919851739aa4fb2d2e5fbaca7a85f7f212743bbb3526b7987bce7edb04cf5c72","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:43:52.244483Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21565/citation-record","integrity":"/paper/2508.21565/integrity","json":"/paper/2508.21565/citation-record.json","paper":"/paper/2508.21565"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.653226Z","title":"Google street view: Capturing the world at street level","venue":null,"work_id":"b574c1d1-7335-4656-8229-aa7aba597769","year":2010},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.819293Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:7417c8d8f95264b2955fff60c472de1f94dccc439e8f3c48e3f2857ed84b9232","observation_id":"fa73e3e2-8e30-475d-92a4-f9dd7715655b","resolution":{"observed_at":"2026-08-15T16:43:53.663051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.629011Z","title":"Evaluation methods for landscapes with greenery","venue":null,"work_id":"7e7aef2f-72e4-4b09-8cbf-11aeb9ed2157","year":1991},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.827290Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:f38de8408fceb16da64e974f16ed065fddd3a2e6ebd22497aeba181dc5a373aa","observation_id":"3aab4094-9239-493d-864c-2edac5b47858","resolution":{"observed_at":"2026-08-15T16:43:53.639234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.605466Z","title":"Browning, Jiaying Dong, Kuiran Zhang, Shuai Yuan, H¨useyin Ertan ˙Inan, Olivia McAnirlin, Dani T","venue":null,"work_id":"96a30de8-5937-442a-b222-b7f5d3ec9a95","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.847823Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:0187b6755727992d5f670a850df7adccd654f588857bf98f36b7c62cc1446204","observation_id":"a1fb3897-2151-4dca-947c-80252575d21d","resolution":{"observed_at":"2026-08-15T16:43:53.612154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.582642Z","title":"The green window view index: automated multi-source visi- bility analysis for a multi-scale assessment of green window views","venue":null,"work_id":"577f3768-5cd1-4960-8f0b-ba33306b227b","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.859841Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:48ac14f973cf7f4904b311927982a4a598b591d9fe5dcc67e2baf287238d6398","observation_id":"e8d66e39-f41c-437c-a787-4cba57e8efd7","resolution":{"observed_at":"2026-08-15T16:43:53.589324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:51.870945Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.870945Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:1312213df1d259d3a8981a2433ea13903e24b761310b4f70119ccd646c5c28de","observation_id":"74d718cc-de8b-481c-9e96-cbea460508ac","resolution":{"observed_at":"2026-08-15T16:43:51.870945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.535194Z","title":"End-to- end object detection with transformers","venue":null,"work_id":"8f798646-98ce-4f5d-8577-4060657fcba2","year":2020},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.879017Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:1eca9ffa05842c2f7f1d1025161803742a3838d03a5754679f5b5154407f3926","observation_id":"afb504ce-f976-4375-bcc5-24f1e60f4a60","resolution":{"observed_at":"2026-08-15T16:43:53.546217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.515843Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"bb5aea27-949b-4d33-9955-6048bf618757","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.886291Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:f8e9cc83859704fc7d9c962da27cefb6bb188576d5a03387cb92f7a746daede8","observation_id":"c147cb24-a1c3-4ea8-bd4f-47b197d61d61","resolution":{"observed_at":"2026-08-15T16:43:53.521387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.492590Z","title":"Evaluating implied urban nature vital- ity in san francisco: An interdisciplinary approach combining census data, street view images, and social media analysis","venue":null,"work_id":"df52662b-95ba-462b-a234-a65afefea836","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.893409Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:e5fc292edc692a8f12dcace170d08e14bf8811ae0c231789cf22f0810cc4399a","observation_id":"a1ea861b-0d50-4ccb-a644-ed1ec0c13e3a","resolution":{"observed_at":"2026-08-15T16:43:53.500260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.472635Z","title":"Visual chain- of-thought prompting for knowledge-based visual reasoning","venue":null,"work_id":"59ba3d54-5839-45e7-aafa-d46573240cc0","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.899935Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:1309d32a6815218fcb4b0a3c22abcb7cde22908baedd6ed7daa7093eeff9aebb","observation_id":"9251068b-ef49-40f2-95f1-c7f4d905fe27","resolution":{"observed_at":"2026-08-15T16:43:53.479241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.440284Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"06d6d35e-ba22-4a2c-a256-b7be2436fb9c","year":2016},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.907753Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:4c3f4a0586c63dd7727b1aa146cf089ab836eb386deb3ed7dfd696b2f6f450ea","observation_id":"034e278e-a75c-4733-bb7b-0bc140cb65fd","resolution":{"observed_at":"2026-08-15T16:43:53.450500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.414957Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"1ad9ad75-f552-42b3-8b73-01f69e58dc83","year":2023},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.916567Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:9a5558c7ed34ca5dda1a83187e419dea0487c19dbddeb7a8f6e3fe76aa6e0880","observation_id":"8ac9be47-7346-48d5-963b-985d87dbaeb4","resolution":{"observed_at":"2026-08-15T16:43:53.421217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.393397Z","title":"Feeling Nature: Measuring perceptions of biophilia across global biomes using visual AI,","venue":null,"work_id":"c40f6a25-19e9-4492-9418-917e0d1755e9","year":null},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.922767Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:9eec0b55c7392f8cdd2e886ee570002d94981b703726a09ec2df267de8d5a5f3","observation_id":"30e2affe-ff1b-4eac-af09-77c67577f38a","resolution":{"observed_at":"2026-08-15T16:43:53.401105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.371739Z","title":null,"venue":null,"work_id":"65849fcf-6ac1-486f-90f5-50b15ed9a097","year":2016},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.931046Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:f22f7e9b8634afe7d017d629ad357f18a1e7acb77fb264f9aa16026e39d2c305","observation_id":"59eb0f1b-c05a-4a86-b9c0-572a2d45cd4d","resolution":{"observed_at":"2026-08-15T16:43:53.380042Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.333010Z","title":"The processing of negation and polarity: An overview","venue":null,"work_id":"66be2d43-702d-44ff-bf13-02921100557e","year":2021},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.938652Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:61c37f9199624f039b050d590ac7b348bcfd691f2f4203aa1fbfd866138cf45a","observation_id":"896a4ee2-26e0-48dc-a808-025e6a3038c5","resolution":{"observed_at":"2026-08-15T16:43:53.339939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.313238Z","title":"Vqa-lol: Visual question answering under the lens of logic","venue":null,"work_id":"42844ea8-45ed-416b-9352-cfe34ebccb27","year":null},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.952079Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:9d5e1f3089acd1d74924c4c90747ac66274fab66aba3a4592f0cf49925136b80","observation_id":"1e2386f4-122c-4e00-96f1-806d80b07ccd","resolution":{"observed_at":"2026-08-15T16:43:53.318735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.293297Z","title":null,"venue":null,"work_id":"7d485814-5824-40b7-800a-cd7d4811c67f","year":2018},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.963718Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:4eb447b6d3cea1c1b10b21457666d74f3a320868f3f7c9da625e5cfd970f6d99","observation_id":"e4a42176-215c-4c1e-9e75-0355d00db18d","resolution":{"observed_at":"2026-08-15T16:43:53.299469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.272610Z","title":null,"venue":null,"work_id":"40bfc3ec-edcc-43d9-8ab3-eaf0f2a5573d","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.969332Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:cfb25033dfb315ad05cbd90fa14f219ee18e1d62a1ff196fe659b24240b446fd","observation_id":"a27f872f-ccec-46c1-8cf2-84ec2b934bd4","resolution":{"observed_at":"2026-08-15T16:43:53.278062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.07174","last_updated":"2021-03-04T21:56:19Z","snapshot_observed_at":"2026-08-14T16:05:21.540101Z","submitted_at":"2019-07-16T17:56:30Z","title":"Natural Adversarial Examples","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.07174","snapshot_observed_at":"2026-08-15T16:43:51.975849Z","title":"Natural Adversarial Examples, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.975849Z"},"links":{"cited_paper":"/paper/1907.07174","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:9ea421536d15aa70737b9a195a486bac5d7f8f79c6cd40327e91630c9b4ed8d7","observation_id":"8f65b9f8-92b4-47b9-a2ed-7820c2fceb60","resolution":{"observed_at":"2026-08-15T16:43:51.975849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.243528Z","title":"Which street is hotter? street morphol- ogy may hold clues -thermal environment mapping based on street view imagery","venue":null,"work_id":"83013b0c-a8c2-4e98-be0f-c94c45dc4159","year":null},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.984863Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:ad3175bb7c11db182c892df832c1d663ae910362e0420876bd51cc44af80a708","observation_id":"ad873a86-b2d6-4301-afae-49cd838a606f","resolution":{"observed_at":"2026-08-15T16:43:53.250774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.213985Z","title":"Hudson and Christopher D","venue":null,"work_id":"aa9f63f4-4aa6-4bf3-a583-740b729a8223","year":null},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:51.993458Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:d3c4888b29170aa86e0a476334811b29169a09b129f15ec594fdfc1b99d2baff","observation_id":"c20955f7-af37-40ca-b428-c52899b1d746","resolution":{"observed_at":"2026-08-15T16:43:53.222186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.182230Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":"372355ec-e990-4b08-8182-4e79eb52ccce","year":2017},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.001857Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:0b8b3e957589ed7b777a44b33a7135d9bd805be9ab43012547b15ee8d968975c","observation_id":"ef39f770-dd50-4905-b031-0f75a8d8f645","resolution":{"observed_at":"2026-08-15T16:43:53.194527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03343","last_updated":"2020-05-15T17:11:56Z","snapshot_observed_at":"2026-08-09T15:30:04.999774Z","submitted_at":"2019-11-08T16:08:48Z","title":"Negated and Misprimed Probes for Pretrained Language Models: Birds Can Talk, But Cannot Fly","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03343","snapshot_observed_at":"2026-08-15T16:43:52.008408Z","title":"Negated and misprimed probes for pretrained language models: Birds can talk, but cannot fly","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.008408Z"},"links":{"cited_paper":"/paper/1911.03343","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:3c8162e5629cedc8932531ab5d89dc9323fa228ada4161cba15552e239230dfd","observation_id":"a516bb51-ec3e-4461-9433-bf4296dd86a9","resolution":{"observed_at":"2026-08-15T16:43:52.008408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.156241Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":"a34ccff5-6acb-4e3e-b976-587030435196","year":2022},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.015411Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:fe4c3421a218ab899807b9b1d6163cc6dcadf18ed7d0cab41bb377aec205ff34","observation_id":"f1b6b3ae-0fe0-4dbc-a7a4-73c76d0983dc","resolution":{"observed_at":"2026-08-15T16:43:53.162260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.128028Z","title":"Understanding counterfactuality: A review of experimental evidence for the dual meaning of counterfactuals","venue":null,"work_id":"1785f159-5041-4950-a642-44e178276394","year":2016},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.021415Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:43e3f2d2bb0312ec3dfd72f6862ae8e2433fc774f2e038204fadb1da46b6eec5","observation_id":"321bfdfc-88b5-43fd-9f77-bad28e8087ba","resolution":{"observed_at":"2026-08-15T16:43:53.135549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.096115Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen im- age encoders and large language models","venue":null,"work_id":"6f3c8d7c-2429-4180-ab5b-c567edc06bd6","year":2023},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.027458Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:c103b5202cca1413c82286bc488e1afd3736e336dd55262fedee54e0c0e50c0d","observation_id":"73401931-cbf7-4d71-ab53-b03723f9f749","resolution":{"observed_at":"2026-08-15T16:43:53.111299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.067212Z","title":"Assessing street-level urban greenery using google street view and a modified green view index","venue":null,"work_id":"9159c0e9-7d75-4d5a-883e-098b77bddf7e","year":null},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.034515Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:705906afdc18686fa8afce57795f361e1fec28e39ae2c69871ff2342bab36b3e","observation_id":"8a271aaf-a8e8-4376-8eda-b2f5c4d56c29","resolution":{"observed_at":"2026-08-15T16:43:53.078958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18504","last_updated":"2025-06-30T05:24:22Z","snapshot_observed_at":"2026-08-16T09:44:26.567520Z","submitted_at":"2025-06-23T10:56:37Z","title":"Generalizing vision-language models to novel domains: A comprehensive survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18504","snapshot_observed_at":"2026-08-15T16:43:52.041500Z","title":"Generalizing Vision-Language Mod- els to Novel Domains: A Comprehensive Survey, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.041500Z"},"links":{"cited_paper":"/paper/2506.18504","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:f38d66f7c1e4cac3136ff026e000ab5f1cfd0790e581c55164513b82155dc3aa","observation_id":"73a49552-63b5-4c00-9117-49fdd9df3423","resolution":{"observed_at":"2026-08-15T16:43:52.041500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.041121Z","title":"Eyes can deceive: Benchmarking counterfactual rea- soning abilities of multi-modal large language models","venue":null,"work_id":"66c2bc72-a400-4739-b592-c3dc68fe9226","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.048824Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:aab297d523ac559ee867435402d41a0592462ca9f7dba5466beb31f597b1e316","observation_id":"57ba5a6c-0101-40fd-bde1-f45f0b336c66","resolution":{"observed_at":"2026-08-15T16:43:53.051160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:53.011169Z","title":"Evaluating human perception of building exteriors using street view imagery","venue":null,"work_id":"e3b28e39-3972-4d8d-826c-e2183ec6b7cb","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.060380Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:aff025b07277284d9e89bd924964e9c38a8f374dabbe526dea5138d7381c56b7","observation_id":"3ce008d1-5d7e-4e8a-8b80-0ffb16569066","resolution":{"observed_at":"2026-08-15T16:43:53.020377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.066628Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.066628Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:1f54692a5a684dbd956ddaf5983557574efa5fe029f3dc8f110198c413d554ee","observation_id":"54854b56-3587-41bf-9ac8-c81ee1c67148","resolution":{"observed_at":"2026-08-15T16:43:52.066628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11968","last_updated":"2024-09-18T13:20:23Z","snapshot_observed_at":"2026-08-16T13:17:29.705424Z","submitted_at":"2024-09-18T13:20:23Z","title":"Efficacy of Synthetic Data as a Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11968","snapshot_observed_at":"2026-08-15T16:43:52.076558Z","title":"Efficacy of synthetic data as a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.076558Z"},"links":{"cited_paper":"/paper/2409.11968","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:d81a45346bceec0dfccaebd10daf9f3655c98d599ab595a95ab0ab311dd7d33f","observation_id":"cfd2e46e-acbe-4658-83bd-ff45a21775ac","resolution":{"observed_at":"2026-08-15T16:43:52.076558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.964949Z","title":"Review of methods used to es- timate the sky view factor in urban street canyons","venue":null,"work_id":"33ca266e-307d-4850-a8b4-7db44f7239be","year":2020},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.084073Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:46b91338c0051dab04d86729e47fbbe90a4b53c7e950c55b08d0e057428aabd2","observation_id":"5f6f332f-f551-458e-bf6d-e67a7ebae481","resolution":{"observed_at":"2026-08-15T16:43:52.972412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.938986Z","title":"Objective scoring of streetscape walkability related to leisure walking: Statistical modeling approach with semantic segmentation of google street view images","venue":null,"work_id":"618db9e7-5bf2-4595-8cfe-083eec1ff448","year":2020},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.090882Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:d6177768ac5d6b5ec14720c45bead078f842031fa7f978303ac8fdaaf1fc15a6","observation_id":"4d6efcc9-874f-485c-b432-09bc7612846a","resolution":{"observed_at":"2026-08-15T16:43:52.948854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.913281Z","title":"Streetscore - predicting the perceived safety of one mil- lion streetscapes","venue":null,"work_id":"ec3e73e3-b96b-4c86-a614-3752716cd054","year":2014},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.096672Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:c030df1acae06308a1b5fec25c7d9e06d4a62cf39062abda7ec12063684bdbfd","observation_id":"8d40bd89-9d58-421e-bacc-c3b29d53fe68","resolution":{"observed_at":"2026-08-15T16:43:52.920991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.890598Z","title":"The mapillary vistas dataset for semantic understanding of street scenes","venue":null,"work_id":"33952637-699c-41ac-aec7-c71df8717a44","year":2017},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.102021Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:36f1535e08a5772a1054b8f717cca4267eb5a84f7f0951b52414f6bc39b55f89","observation_id":"f7984d46-b145-4026-bdba-89620c64ac7c","resolution":{"observed_at":"2026-08-15T16:43:52.897550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.864273Z","title":"Counterfactual vqa: A cause- effect look at language bias","venue":null,"work_id":"7c7c75ea-b2bc-4044-8eea-779fad8e702e","year":2021},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.108525Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:f0e6eb0a5b19dae5f012e7f6749a1742e1abd2debce3479ed8e793213da99904","observation_id":"714a7014-80c6-4efc-8125-cbfcf2e43b1b","resolution":{"observed_at":"2026-08-15T16:43:52.875949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.832241Z","title":"Evaluating the subjective percep- tions of streetscapes using street-view images","venue":null,"work_id":"410670d4-8880-491a-bffa-c59f3a82e5b7","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.117459Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:3e2409fda2ba5c79b59cadc2db9a333431f90529eebb4c6426724e12372423c1","observation_id":"565549e6-5b89-4887-9a93-0608d7d0247d","resolution":{"observed_at":"2026-08-15T16:43:52.840854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.803044Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"b2eec3e2-e74c-4c60-a25d-95bd0418ae3e","year":2021},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.124226Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:e6763370abec89a595a50ddad14b3366573b7e452f16083025ee54eee14869c5","observation_id":"5c478263-af87-4d41-9a62-0384e917d7c4","resolution":{"observed_at":"2026-08-15T16:43:52.810090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.770670Z","title":"Towards robust monocular depth estimation: Mixing datasets for zero-shot cross-dataset transfer","venue":null,"work_id":"5595c9c0-d7f2-4df6-b850-c461aa202392","year":2020},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.134226Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:b9f48d47777ee73bb6578204f68f8fff0ba0c5acdbc190f0314c69d890f24cc8","observation_id":"f4217137-e637-49d5-baad-d2f8a655fbf9","resolution":{"observed_at":"2026-08-15T16:43:52.783106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.741518Z","title":"Visual cot: Advancing multi-modal language models with a compre- hensive dataset and benchmark for chain-of-thought reason- ing","venue":null,"work_id":"e6c25df0-9df1-4349-b1bf-14441d50eb90","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.145483Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:02500b55727cd96a501b2e586458450ad0c775628480f2e7a2e39198d7f09157","observation_id":"c7917aaf-da19-4f57-91ae-3ff0fdab65e3","resolution":{"observed_at":"2026-08-15T16:43:52.749086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.716781Z","title":"Is synthetic data all we need? benchmarking the robustness of models trained with synthetic images","venue":null,"work_id":"545f0b99-b88f-43a1-bdbe-f21273d4c95c","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.151861Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:c8a611aa508a0090cb8dd41bcf072afef4ab79ee0c5781b1b811e0d6b55820d7","observation_id":"d06398fc-d73b-4ba4-aaa4-61ac3c064d4d","resolution":{"observed_at":"2026-08-15T16:43:52.724551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.690809Z","title":"Svensson","venue":null,"work_id":"eb19ee00-38d6-4459-9c9a-82bb9fadcca8","year":2004},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.157932Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:86853fb4c93e5a636c8197df88b5b2cbc4506e6cbffb0f537cb20441f79d01c4","observation_id":"314146b7-e38e-4fac-9014-88c5c09a5ab6","resolution":{"observed_at":"2026-08-15T16:43:52.698831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.656524Z","title":"A new benchmark: On the util- ity of synthetic data with blender for bare supervised learn- ing and downstream domain adaptation","venue":null,"work_id":"104b01d6-685a-4f4f-af53-a3150bf584e4","year":2023},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.165500Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:37094e166b94ab0a8bb0fc079956db53d640a9f224fea1e6cf1677080e4df98e","observation_id":"c045f472-8ee5-47ff-8d08-9841f4de7986","resolution":{"observed_at":"2026-08-15T16:43:52.663049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-15T16:43:52.173641Z","title":"Gemini 1.5: Unlocking mul- timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.173641Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:e853084ff5c3911d0fa59c1573f65b4ceae3c360debe808bff9d0e750f4bdf4e","observation_id":"5ed35ed8-5924-49c6-82f0-ecdeb80ea2b2","resolution":{"observed_at":"2026-08-15T16:43:52.173641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22395","last_updated":"2025-06-03T08:17:50Z","snapshot_observed_at":"2026-08-16T12:45:58.519366Z","submitted_at":"2025-03-28T13:04:41Z","title":"Negation: A Pink Elephant in the Large Language Models' Room?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22395","snapshot_observed_at":"2026-08-15T16:43:52.181805Z","title":"Negation: A pink elephant in the large language models’ room? arXiv preprint arXiv:2503.22395, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.181805Z"},"links":{"cited_paper":"/paper/2503.22395","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:16979d218467a8732a040b114b6bfe09982733a246245393878ca04e58254cb4","observation_id":"31c188cc-dbb3-4a3c-b4c1-5d5c0a230415","resolution":{"observed_at":"2026-08-15T16:43:52.181805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.622793Z","title":"Al- varez","venue":null,"work_id":"1c3f11ca-0e6d-4fc9-9f93-00835e082efd","year":2025},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.187965Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:e0ae0b21d0b0e1cf871f926a48d6968edf5e0ab0dd0aa9a4cefc8a9ffd55b493","observation_id":"d676c83d-a650-4194-9a1e-d672822df9e4","resolution":{"observed_at":"2026-08-15T16:43:52.630835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.592540Z","title":"Self-consistency improves chain of thought reasoning in lan- guage models","venue":null,"work_id":"695708f6-1153-409c-af4a-536affa47e3c","year":2023},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.195234Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:54602fedb2e2482cedf64b0e008ee84a9c6d40e394a505f8edd4330518d2951d","observation_id":"a065ad02-441c-4927-83fa-cdfbcdeeb656","resolution":{"observed_at":"2026-08-15T16:43:52.598326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.565174Z","title":"Chi, Quoc V","venue":null,"work_id":"c04be54d-5121-4af9-ac94-93cfd64334eb","year":2022},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.201830Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:9e3855f863e0350f9811e6a9543185826def7c6fc88a7059444faa6898a7e9ca","observation_id":"ff0f101b-8ba0-49a6-833d-513bb6a8efaa","resolution":{"observed_at":"2026-08-15T16:43:52.572855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.529621Z","title":"Alvarez, and Ping Luo","venue":null,"work_id":"5e6a7040-4024-4cb9-a0f1-97caecf317fb","year":2021},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.212828Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:d563cf5a6b849a675c1837227d30da18db5d992a151d773b5a4919a0d984ab77","observation_id":"0802696a-1af0-4e2f-8a0a-665d74fa90cc","resolution":{"observed_at":"2026-08-15T16:43:52.536709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.508887Z","title":"Improve vision language model chain-of-thought reasoning, 2024","venue":null,"work_id":"87104770-1fe1-4a64-b1ad-b53cc1417d02","year":2024},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.219179Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:89db091eae26d6c90a7279ea6d4e234adf743109e2cc8c4e68d6675a2c8d0040","observation_id":"20365222-5643-4cc0-89c8-6a25d8ace7c8","resolution":{"observed_at":"2026-08-15T16:43:52.514988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22946","last_updated":"2025-05-28T23:58:37Z","snapshot_observed_at":"2026-08-17T16:16:01.560455Z","submitted_at":"2025-05-28T23:58:37Z","title":"NegVQA: Can Vision Language Models Understand Negation?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22946","snapshot_observed_at":"2026-08-15T16:43:52.235796Z","title":"Negvqa: Can vision language models understand nega- tion? arXiv preprint arXiv:2505.22946, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.235796Z"},"links":{"cited_paper":"/paper/2505.22946","citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:cd81d2ec9881f961486172c4a3f98f720461948fbdff7391c4bcdb949d135ebb","observation_id":"df454ef8-5092-4cbf-81b2-d66f19ccb8fa","resolution":{"observed_at":"2026-08-15T16:43:52.235796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:43:52.479813Z","title":"A study on the impact of visible green index and vegetation structures on brain wave change in residential landscape.Urban Forestry & Urban Greening, 64:127299, 2021","venue":null,"work_id":"30c47fd5-96d6-4014-8cdc-b1ba3649c521","year":2021},"citing_paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T16:43:52.244483Z"},"links":{"citing_paper":"/paper/2508.21565"},"observation_digest":"sha256:a2c88cda076049315f6bcae8e8983cd7f0e94b1c4774a1e4d8b9aecade00f6ec","observation_id":"f516c9c9-7109-428c-9898-a64ab16fc56e","resolution":{"observed_at":"2026-08-15T16:43:52.491168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21565","last_updated":"2025-08-29T12:21:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-17T08:23:21.693958Z","submitted_at":"2025-08-29T12:21:57Z","title":"How Well Do Vision--Language Models Understand Cities? A Comparative Study on Spatial Reasoning from Street-View Images"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":40},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2508.21565."}