{"as_of":"2026-08-15T21:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78246d128a2b41eba6dba6ad8e6670b688ced98acb70eb8c3f9ebdeac6dda81c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:43:29.336850Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-23T20:13:24.867220Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":"2403.16831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbanvlp: A multi-granularity vision-language pre-trained foundation model for urban indicator prediction","venue":null,"work_id":"6feff56a-4407-41e0-b645-b5465d08efa4","year":2024},"citing_paper":{"arxiv_id":"2410.04509","last_updated":"2026-04-20T02:03:24Z","snapshot_observed_at":"2026-08-02T21:14:32.237997Z","submitted_at":"2024-10-06T14:59:09Z","title":"ErrorRadar: Benchmarking Complex Mathematical Reasoning of Multimodal Large Language Models Via Error Detection","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-23T20:10:59.264484Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2410.04509"},"observation_digest":"sha256:1572196c48b866a51bbcb8e718d62cb17904ea49c4a9d6b773a24125f8b8e5de","observation_id":"61b1e7d4-020b-45a2-a222-07c3f5485eaf","resolution":{"observed_at":"2026-05-23T20:13:24.871280Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-08-10T16:43:29.336850Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13141","last_updated":"2025-07-02T14:38:26Z","snapshot_observed_at":"2026-08-13T21:27:57.946568Z","submitted_at":"2025-01-22T14:32:20Z","title":"AirRadar: Inferring Nationwide Air Quality in China with Deep Neural Networks","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T16:43:29.336850Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2501.13141"},"observation_digest":"sha256:f498b7d899d30f04129326aeaa84392adf24689cfc19fe4910ad089660afa42c","observation_id":"b21189e1-0e83-49ca-aedd-6ce28e4e9020","resolution":{"observed_at":"2026-08-10T16:43:29.336850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":"2403.16831","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Urbanvlp: A multi-granularity vision-language pre-trained foundation model for urban indicator prediction","venue":null,"work_id":"6feff56a-4407-41e0-b645-b5465d08efa4","year":2024},"citing_paper":{"arxiv_id":"2502.02871","last_updated":"2026-04-20T02:18:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-05T04:05:27Z","title":"Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-23T04:30:38.804702Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2502.02871"},"observation_digest":"sha256:e0ae69b802889728bbcdfbd349a02422b3847b3b8bdc3ab740947ca067da05d3","observation_id":"7b3e7cbb-c098-437e-ac7d-5783bfd830cc","resolution":{"observed_at":"2026-05-23T04:32:32.605049Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-08-07T15:20:04.443450Z","title":"Urbanvlp: A multi-granularity vision-language pre-trained foundation model for urban indicator prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15870","last_updated":"2025-05-21T13:17:34Z","snapshot_observed_at":"2026-08-09T22:52:59.057023Z","submitted_at":"2025-05-21T13:17:34Z","title":"Satellites Reveal Mobility: A Commuting Origin-destination Flow Generator for Global Cities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:20:04.443450Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2505.15870"},"observation_digest":"sha256:be2cc7275da30d54e920824d8bff51db6bf9252d08a7c511079c8a6a75bcdb32","observation_id":"2d083d7d-cc74-4db8-bfde-c283fa96a55c","resolution":{"observed_at":"2026-08-07T15:20:04.443450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-08-06T21:52:21.758851Z","title":"Urbanvlp: A multi- granularity vision-language pre-trained foundation model for urban indicator prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23219","last_updated":"2025-06-29T13:04:27Z","snapshot_observed_at":"2026-08-14T06:43:19.997848Z","submitted_at":"2025-06-29T13:04:27Z","title":"UrbanLLaVA: A Multi-modal Large Language Model for Urban Intelligence with Spatial Reasoning and Understanding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:52:21.758851Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2506.23219"},"observation_digest":"sha256:eb03f5678e9b92d9501ed97bd9385fdb75c5d8e6b3239facf0639e1f2876d7c1","observation_id":"57e99a67-4c0a-4127-8b1c-d71f82485cd5","resolution":{"observed_at":"2026-08-06T21:52:21.758851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-08-06T21:07:08.651744Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.00914","last_updated":"2025-07-01T16:18:29Z","snapshot_observed_at":"2026-08-15T02:04:25.077848Z","submitted_at":"2025-07-01T16:18:29Z","title":"Large Language Model Powered Intelligent Urban Agents: Concepts, Capabilities, and Applications","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:07:08.651744Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2507.00914"},"observation_digest":"sha256:90ca51b0369ffe97d49bec7caedf092018ab170974dd7da44d6e71870f87d47e","observation_id":"613c387d-2905-4f6d-ad57-9c00724a83b2","resolution":{"observed_at":"2026-08-06T21:07:08.651744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16831","snapshot_observed_at":"2026-08-05T20:23:03.839280Z","title":"arXiv preprint arXiv:2403.16831 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.10667","last_updated":"2025-08-14T14:06:28Z","snapshot_observed_at":"2026-08-05T20:23:02.382856Z","submitted_at":"2025-08-14T14:06:28Z","title":"AddressVLM: Cross-view Alignment Tuning for Image Address Localization using Large Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T20:23:03.839280Z"},"links":{"cited_paper":"/paper/2403.16831","citing_paper":"/paper/2508.10667"},"observation_digest":"sha256:890c1b4cabb03942d891a88d7b6564cc43b7a0610f1e72e408a658508daac58c","observation_id":"62fe3d9e-6caf-4541-a283-54a95ff8f6e1","resolution":{"observed_at":"2026-08-05T20:23:03.839280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.16831/citation-record","integrity":"/paper/2403.16831/integrity","json":"/paper/2403.16831/citation-record.json","paper":"/paper/2403.16831"},"outbound":[],"paper":{"arxiv_id":"2403.16831","last_updated":"2025-01-22T08:45:56Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T00:45:37.091670Z","submitted_at":"2024-03-25T14:57:18Z","title":"UrbanVLP: Multi-Granularity Vision-Language Pretraining for Urban Socioeconomic Indicator Prediction"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2403.16831."}