{"as_of":"2026-08-10T04:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:daaf2aee44a21bddabefab4456aecb9277723426868797cea8b4203135882450","coverage":[{"denominator":96,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:49:48.230001Z","state":"measured"},{"denominator":96,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":96,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23352/citation-record","integrity":"/paper/2506.23352/integrity","json":"/paper/2506.23352/citation-record.json","paper":"/paper/2506.23352"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.054070Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.054070Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:20eef025317b9f7932f7f8eb14f6f8b9da226ce70002a8b6f01908fe23bc5064","observation_id":"9a2a456f-48b1-461b-9bab-b5febf5309c0","resolution":{"observed_at":"2026-08-06T21:49:42.054070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T21:49:42.094181Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.094181Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:2dae8a6e19cabb2a2ce802bea0f9635d80b450fddd60b66020ee1a3bf08a880e","observation_id":"7bba69c6-6d78-4fd5-89d6-9cdd55d2ada1","resolution":{"observed_at":"2026-08-06T21:49:42.094181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.194838Z","title":"Henriques, Andrew Zisserman, and Andrea Vedaldi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.194838Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:5d87aad587a3b4a0249682461922ff928bdce1d0a69cadd2019482ce261ebaf4","observation_id":"3922716b-968a-46df-9b06-41652b632605","resolution":{"observed_at":"2026-08-06T21:49:42.194838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.256991Z","title":"Blumer, Qingx- uan Chen, and Francis Engelmann","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.256991Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f5991aa5b7ed68ae54ecc7db7ee78dca48cf85727dab5edc333c4d853b797f9c","observation_id":"05a9f140-72af-403e-8111-ef8f7d6c539b","resolution":{"observed_at":"2026-08-06T21:49:42.256991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.392137Z","title":"A persistent spatial semantic representation for high-level natural language instruction execution","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.392137Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:04581f1ffe39fa2f1733d1c6f52283a155138d649bee7ce8bfe2e352817c53d9","observation_id":"b093582a-470c-4d28-b589-ce745a4c8e3c","resolution":{"observed_at":"2026-08-06T21:49:42.392137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.499765Z","title":"Prompt-rsvqa: Prompt- ing visual context to a language model for remote sensing visual question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.499765Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:6067d6d6d915265d25c9ff8b87276320fdaf4673fb910415f8ce7a2ef2f212fb","observation_id":"71ca8a59-5ff8-47a7-9292-8244e40f89d9","resolution":{"observed_at":"2026-08-06T21:49:42.499765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.634508Z","title":"Scanrefer: 3d object localization in rgb-d scans using natu- ral language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.634508Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b4664d3f33a5af5bb925f6d76334dc1bd969de2f7bb76ebb9ab9f34a071dd321","observation_id":"dee5502b-394d-4b8a-9d94-53bcfd086c67","resolution":{"observed_at":"2026-08-06T21:49:42.634508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.745471Z","title":"Panoptic vision-language feature fields","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.745471Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a980c22fb12e1fa774436c1d78d9f23c70dc2f7193aab67587f0efe7e2670fff","observation_id":"2d18a5ce-27c7-4499-9d5a-6992720f8660","resolution":{"observed_at":"2026-08-06T21:49:42.745471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.839057Z","title":"Stylecity: Large-scale 3d urban scenes stylization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.839057Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:fadfca25a2015bfd10a638dc2be867b0c5730874dca28a26d84576216f2a644b","observation_id":"e45035e5-1c0c-469c-a16e-8289272ccb08","resolution":{"observed_at":"2026-08-06T21:49:42.839057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:42.929873Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:42.929873Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:dc09927a09538d0682bff4aa40c01bb7ead1e2a458adfd9226174bdc5668a7e2","observation_id":"d71297e6-2235-430c-96e6-bf273376ff1e","resolution":{"observed_at":"2026-08-06T21:49:42.929873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.012679Z","title":"Scannet: Richly-annotated 3d reconstructions of indoor scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.012679Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a6f85fcd21ccf4a063898262252d861d583b0d77e305541f8123f0d1739161e1","observation_id":"00fe7b97-3e74-4516-ab3c-9da16c510e9c","resolution":{"observed_at":"2026-08-06T21:49:43.012679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15393","last_updated":"2023-10-28T06:56:32Z","snapshot_observed_at":"2026-08-05T22:24:58.767708Z","submitted_at":"2023-05-24T17:56:16Z","title":"LayoutGPT: Compositional Visual Planning and Generation with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.15393","snapshot_observed_at":"2026-08-06T21:49:43.132312Z","title":"Layoutgpt: Compositional visual plan- ning and generation with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.132312Z"},"links":{"cited_paper":"/paper/2305.15393","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a278abc46cd96fe2b31a5d08f5a53a8b20426e3b7ee1259c4eef473f3d0fee73","observation_id":"da1aa099-20a3-46e0-a396-41eb294e5e9e","resolution":{"observed_at":"2026-08-06T21:49:43.132312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.190261Z","title":"Dynamic 3d gaussian fields for urban areas","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.190261Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:2b720415abfe88051b9e877af18262db4e941d29a2acafb9642794101c903346","observation_id":"1999571b-cd9a-407c-bc5f-ccfc1b13af7e","resolution":{"observed_at":"2026-08-06T21:49:43.190261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.253760Z","title":"Ue4-nerf:neural radiance field for real-time rendering of large-scale scene","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.253760Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:66007f4bbb3ece303346c1018913fefc56fdba4f9ad7819226e6e28955449eaf","observation_id":"70eb2b3b-63eb-4257-a5a6-a8e64cbdd79a","resolution":{"observed_at":"2026-08-06T21:49:43.253760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04988","last_updated":"2023-06-08T07:19:27Z","snapshot_observed_at":"2026-07-06T15:40:08.685976Z","submitted_at":"2023-06-08T07:19:27Z","title":"StreetSurf: Extending Multi-view Implicit Surface Reconstruction to Street Views","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04988","snapshot_observed_at":"2026-08-06T21:49:43.307473Z","title":"Streetsurf: Extending multi-view im- plicit surface reconstruction to street views","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.307473Z"},"links":{"cited_paper":"/paper/2306.04988","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:20316b327c899d703b170245c72256b16ec9ecd8b5f6504a94ad296aa1973c9d","observation_id":"a5fa8581-1343-47b9-8e7c-a86977f9e80d","resolution":{"observed_at":"2026-08-06T21:49:43.307473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.378479Z","title":"Visual program- ming: Compositional visual reasoning without training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.378479Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:ffdf180edc03cf0dbca4328fac8da7ea94efa6f09de6b85fdeb41f2506a64ee4","observation_id":"36a3ba48-3582-43fb-8f84-603d4d76c0a2","resolution":{"observed_at":"2026-08-06T21:49:43.378479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.437098Z","title":"Pigeon: Predicting image geolocations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.437098Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:6e21ee413371b674f5db6ee7084fae50731e50c8dd5338ac0fc824342252eced","observation_id":"15cf77ae-37cc-48a1-9156-f7661f6bd688","resolution":{"observed_at":"2026-08-06T21:49:43.437098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.490242Z","title":"Dragon: Drone and ground gaussian splatting for 3d building reconstruction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.490242Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:9ad97550e7e265f7dcc958eeed8c7133c3171795f3281459b1d9e6431b73281e","observation_id":"a4e7e80a-1a68-44a6-a34d-90d8b1bbb3b8","resolution":{"observed_at":"2026-08-06T21:49:43.490242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:43.533958Z","title":"3d-llm: Inject- ing the 3d world into large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.533958Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:8ee670c87f6b88b32403f19e630399b8fe7f5c01a9caa8e601b41a93dc05c63f","observation_id":"eb5e3a97-aac3-425d-a4cc-cc6dec241d00","resolution":{"observed_at":"2026-08-06T21:49:43.533958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15266","last_updated":"2023-07-28T02:23:35Z","snapshot_observed_at":"2026-08-05T09:46:05.780158Z","submitted_at":"2023-07-28T02:23:35Z","title":"RSGPT: A Remote Sensing Vision Language Model and Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15266","snapshot_observed_at":"2026-08-06T21:49:43.574175Z","title":"Rsgpt: A remote sensing vision language model and benchmark","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.574175Z"},"links":{"cited_paper":"/paper/2307.15266","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:e67a061bab1b979ba9e6fd05363b232bc8b84df2b7d48f31cc49dfbc7325bbad","observation_id":"3edb0cda-0e2e-45c5-b5c1-bc48b5709486","resolution":{"observed_at":"2026-08-06T21:49:43.574175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06234","last_updated":"2025-01-27T01:45:15Z","snapshot_observed_at":"2026-08-08T12:33:45.268848Z","submitted_at":"2024-10-08T17:45:51Z","title":"TEOChat: A Large Vision-Language Assistant for Temporal Earth Observation Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06234","snapshot_observed_at":"2026-08-06T21:49:43.614807Z","title":"Teochat: A large vision-language as- sistant for temporal earth observation data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.614807Z"},"links":{"cited_paper":"/paper/2410.06234","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:36d3af917a13c5ab53a64572080612e3de6b0c25b5a043e9f27c5458ffe68aa3","observation_id":"57381278-8928-4fa2-bd2c-0c0df261d55d","resolution":{"observed_at":"2026-08-06T21:49:43.614807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02084","last_updated":"2024-09-03T17:35:48Z","snapshot_observed_at":"2026-08-03T21:07:30.308924Z","submitted_at":"2024-09-03T17:35:48Z","title":"GraspSplats: Efficient Manipulation with 3D Feature Splatting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02084","snapshot_observed_at":"2026-08-06T21:49:43.660608Z","title":"Graspsplats: Efficient manipulation with 3d feature splatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.660608Z"},"links":{"cited_paper":"/paper/2409.02084","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d00c5f757f64498194cd3cd009ad4161614c93b4e36be12f3e6fc69cf9d9517a","observation_id":"cacaa869-fdd5-498b-aa6c-f7c052d768b2","resolution":{"observed_at":"2026-08-06T21:49:43.660608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:00.128731Z","title":"Fastlgs: Speeding up lan- guage embedded gaussians with feature grid mapping","venue":null,"work_id":"ba415ffc-2259-4ee3-9b3c-8e7d69d08812","year":2025},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.729855Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b0dfff11ab840938457cf4c32d94d21f9086ccb93f4df0a45303f602bdb78abf","observation_id":"da349638-f488-43c6-9293-b7e9a72dbcaa","resolution":{"observed_at":"2026-08-06T21:50:00.199756Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.962023Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":"deee3d88-cb9b-40cb-b095-0b6186afa91f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.778265Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:1fc302668999919b9cdbb0e606650b4dd9980046f0172cf2aa44395203e8ba58","observation_id":"4cc0bab2-8de2-4525-a191-6972b1f1a3ef","resolution":{"observed_at":"2026-08-06T21:50:00.069090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.798227Z","title":"A hierarchical 3d gaussian representation for real-time ren- dering of very large datasets.ACM Transactions on Graphics (TOG), 43(4), 2024","venue":null,"work_id":"aeed35e0-b4ee-4b08-8fc1-ff55b3024df2","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.817893Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:df47f7d8006a07594a152677873617caaa4a0f02338698c38ea2748367c99504","observation_id":"5079a02f-46e7-4f71-96b1-0ae8264c004f","resolution":{"observed_at":"2026-08-06T21:49:59.894873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.662944Z","title":"LERF: Language embed- ded radiance fields","venue":null,"work_id":"4aacd5f3-d29d-41bf-a8be-205fb9834e16","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.885600Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:333582fd21fd74013b0d52e3ab33ba16d5f8961fbe7b77a4399d4ae1b4da75b8","observation_id":"f03dc12f-8688-4d4f-b78a-3b4d89abee4c","resolution":{"observed_at":"2026-08-06T21:49:59.718873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.518442Z","title":"Lobell, and Ste- fano Ermon","venue":null,"work_id":"720917b2-6955-44af-8703-bb63f0527230","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.952849Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:c19887d5cad8e0d018c57dfe0bbd38338b08ac4642bb2ef9700c4478dff2ff7c","observation_id":"4d690336-278a-482b-b22a-6b0373ac9ea7","resolution":{"observed_at":"2026-08-06T21:49:59.590614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.409360Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Girshick","venue":null,"work_id":"76e25007-73d8-4ab0-83a5-4b991f292c27","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.000320Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:5e9efbcc1f26a81c16e99d0751d9b33cdf07ad9b0e926a42b1ebf0c0828ee9dd","observation_id":"77bafc28-a913-4c26-8aad-80d6f1db3910","resolution":{"observed_at":"2026-08-06T21:49:59.476659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.222961Z","title":"Segment any- thing","venue":null,"work_id":"d1b05c2d-b2a3-46c0-82a0-dc917a9f526d","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.042944Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:dee0bfa5830302b15131386aa7c8909f917b0de01ecd146a029dce84502d2763","observation_id":"512e23fd-0770-4804-8f56-d514e6f22f0c","resolution":{"observed_at":"2026-08-06T21:49:59.303634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17179","last_updated":"2024-04-12T22:23:32Z","snapshot_observed_at":"2026-08-09T05:37:15.584506Z","submitted_at":"2023-11-28T19:14:40Z","title":"SatCLIP: Global, General-Purpose Location Embeddings with Satellite Imagery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17179","snapshot_observed_at":"2026-08-06T21:49:44.101737Z","title":"Satclip: Global, general- purpose location embeddings with satellite imagery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.101737Z"},"links":{"cited_paper":"/paper/2311.17179","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d71a9e2e0e51665278a53220c1f8371eaaa482055bb6b4c0a7e515ae78326963","observation_id":"383964ea-5fb3-40a4-b019-7b71dbe8a3ed","resolution":{"observed_at":"2026-08-06T21:49:44.101737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:59.118264Z","title":"Decomposing nerf for editing via feature field dis- tillation","venue":null,"work_id":"0d6bec61-5f78-409b-b573-091c82be843e","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.136124Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:14f96c5e2b853179d35ac90ab4495ba62854eecd25fc9c1aaa87d474a02cb501","observation_id":"db4b74fd-35ac-4f0d-96c4-308024254d38","resolution":{"observed_at":"2026-08-06T21:49:59.166663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.998301Z","title":"Text2pos: Text-to-point-cloud cross-modal localiza- tion","venue":null,"work_id":"e81e781d-ad5f-4303-951b-8d976db2564e","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.170793Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:20c1961a5d07f0e9bd5e1b9fb88c0369a08783d3944a1a59518d9975c9cb0f48","observation_id":"4594861b-9cfa-4255-9ca0-32b88981eb59","resolution":{"observed_at":"2026-08-06T21:49:59.064991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.856739Z","title":"Geochat: Grounded large vision-language model for remote sensing","venue":null,"work_id":"d610beba-cab7-4299-8439-10f6ebf3c3e4","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.222774Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3b845a21c0bb37275410099d896b6a7588ce910700b4563602dd3fe79568f73b","observation_id":"8eb4957f-fbb9-41b1-8285-94555bb82c3d","resolution":{"observed_at":"2026-08-06T21:49:58.903803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.678476Z","title":"NeRF-XL: Scaling nerfs with multiple GPUs","venue":null,"work_id":"77498d10-3464-46b6-82cd-4fe51f3ef17f","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.267005Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:fbd816e75a9fcce2ee00414b2a61b477cb041d1d24d8c829e0a2b28e4f47055b","observation_id":"7b1fd120-5535-440d-8b72-83d94a97fa55","resolution":{"observed_at":"2026-08-06T21:49:58.773105Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.546718Z","title":"Matrixcity: A large-scale city dataset for city-scale neural rendering and beyond","venue":null,"work_id":"6dd4f624-7cb3-4b4a-9158-31516384908b","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.309914Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f03d6b56efe406edd8af135e9669e5d57da70a331342ab6693abdc1f8be8b6c3","observation_id":"51b0f3b3-7f83-4852-bc1d-694b87713b73","resolution":{"observed_at":"2026-08-06T21:49:58.613797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.398190Z","title":"Vastgaussian: Vast 3d gaus- sians for large scene reconstruction","venue":null,"work_id":"6ded315b-5af7-4cda-a20c-62a14ce08eca","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.345633Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a7d4f1cb963b6a5b4215c5057f26fea8fe62699773f0f046fd73a6565edc47c4","observation_id":"a5a46439-664f-40d8-a915-3f451efd8976","resolution":{"observed_at":"2026-08-06T21:49:58.486658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.289614Z","title":"Capturing, reconstructing, and simulating: the urbanscene3d dataset","venue":null,"work_id":"0eeb2eaf-ed52-47e4-ba05-bac0639d392d","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.377705Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7eec0329ea69fd5ab59e06b0b431bdefbf43377535bbe85a19a2dbab00d2782f","observation_id":"11471b57-9a6a-442e-adb6-c54a6d7a3237","resolution":{"observed_at":"2026-08-06T21:49:58.345746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.139130Z","title":"Re- moteclip: A vision language foundation model for remote sensing","venue":null,"work_id":"5ac34351-2805-4df3-aa19-df2048a6f80c","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.441781Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3fe4f5277f51870ffa470705405ff4b6d34e7072f9c840cf98173825a9ba67c1","observation_id":"2ffa59ba-1675-421a-89c6-c32d5bd75650","resolution":{"observed_at":"2026-08-06T21:49:58.217038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:58.018530Z","title":"Visual instruction tuning","venue":null,"work_id":"9af0550d-a2d3-44d2-a8a5-2167f9659ba3","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.492129Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:58da21edd19567b446ff0876025eddd9c028bebc0d5caabb540cac8c53a74bcd","observation_id":"321362df-eaa4-42f8-ad62-66f8dfe04287","resolution":{"observed_at":"2026-08-06T21:49:58.049953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.838249Z","title":"Citygaus- sian: Real-time high-quality large-scale scene rendering with gaussians","venue":null,"work_id":"7c546017-0758-4a1d-9f12-5bb92390ebbe","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.536960Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:268433b480cbacb91369849db5f00bd993b2c083dac88f91a026f8e559e57836","observation_id":"7da5c1eb-1eb3-48c3-abb9-73bcdc066f97","resolution":{"observed_at":"2026-08-06T21:49:57.943733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.598933Z","title":"Citygaussianv2: Efficient and geometri- cally accurate reconstruction for large-scale scenes, 2024","venue":null,"work_id":"cbfbe8a7-10f7-40e7-a125-cde61db66640","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.579863Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:be57a884b31c132e439ae19115f6b29517bb5ce8fb59788c0a6874658205d773","observation_id":"c5b516e5-64a8-4bbc-9865-6fbfc9fb13b8","resolution":{"observed_at":"2026-08-06T21:49:57.732635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.399057Z","title":"Citygaussianv2: Efficient and geometri- cally accurate reconstruction for large-scale scenes","venue":null,"work_id":"971357b0-a899-4d1f-823d-0ef119ea327f","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.633032Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3060a8aefe47f19c02937452024de9d36cd6f718dca86c5d657308d8dab671fd","observation_id":"64464ef6-4f58-491e-a64e-c1aea177f006","resolution":{"observed_at":"2026-08-06T21:49:57.486653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.263263Z","title":"Chameleon: Plug-and-play compositional reasoning with large language models","venue":null,"work_id":"6fd05dd3-b3f5-4671-be12-cf4e0707b91f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.673401Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:68673847a4479ef5c633785a0fb48b5f41308f24c02a3c510fb6d2957c2a7bda","observation_id":"a39d028d-c282-40a8-841b-91b5017f9523","resolution":{"observed_at":"2026-08-06T21:49:57.326550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:57.066101Z","title":"Exploring models and data for remote sensing im- age caption generation","venue":null,"work_id":"fc4c9269-38b9-47e1-8980-2ba8f755daa7","year":2018},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.722564Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:75e2a629c1c53f7354744e9e4508b26c024689a8e15fcd9e2bffca1a95f6489f","observation_id":"411a2e79-1115-4057-b457-d2753476d1ce","resolution":{"observed_at":"2026-08-06T21:49:57.153451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10100","last_updated":"2024-07-08T04:33:37Z","snapshot_observed_at":"2026-08-09T17:28:27.215326Z","submitted_at":"2024-06-14T14:57:07Z","title":"SkySenseGPT: A Fine-Grained Instruction Tuning Dataset and Model for Remote Sensing Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10100","snapshot_observed_at":"2026-08-06T21:49:44.779870Z","title":"Skysensegpt: A fine-grained instruction tuning dataset and model for re- mote sensing vision-language understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.779870Z"},"links":{"cited_paper":"/paper/2406.10100","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3755eb38ca952c8bc0041bcb6d24c469cc1617b7cb9e03939932aa558238b5ae","observation_id":"42f8f1c8-c23b-4d8e-bec0-fae4bce9c14e","resolution":{"observed_at":"2026-08-06T21:49:44.779870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.932171Z","title":"A multiscale grouping transformer with clip latents for re- mote sensing image captioning","venue":null,"work_id":"b97b128d-9035-458d-9dc0-e4fd859a1a5e","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.839366Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3ac6ea4917581e481d5030cfb3ebac6523b38e8295cd36c39cb329a29094e213","observation_id":"1c23294a-ff1c-43ac-9251-0d118650d631","resolution":{"observed_at":"2026-08-06T21:49:56.999396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.776358Z","title":"Llama 3.2 connect 2024: Vision on the edge and mo- bile devices","venue":null,"work_id":"ad9870e1-4220-4e9e-a730-04d2057f97ac","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.886549Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7385cc7ef8652be72ce4bba4c97ef65ee3e76bea56b1ec6a3e322dc82aa4b2e9","observation_id":"8692614f-bbd4-425f-b298-23576a5f2c93","resolution":{"observed_at":"2026-08-06T21:49:56.865133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.570653Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":"0efd939f-fc25-40f0-8c32-ba9b5e044308","year":2020},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:44.962424Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d62d72ec11f30e8019c944749ec93fa172f45bfaaac4b5b04f9375e3a1020740","observation_id":"968bc7a2-0782-4099-b787-0fc6d70410f8","resolution":{"observed_at":"2026-08-06T21:49:56.632184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.456814Z","title":"Cityrefer: Geography-aware 3d visual grounding dataset on city-scale point cloud data","venue":null,"work_id":"94e2f7ea-1c6a-4085-9d5b-c48c6e818346","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.026632Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f3fe69af7871aa2d161cb780b86f7bd78aaaa21b0ea673628ff7764bc1fb6dc8","observation_id":"dadfd791-b5fc-4459-a5cf-e26c4aa29d90","resolution":{"observed_at":"2026-08-06T21:49:56.486953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.309526Z","title":"Lhrs-bot: Empowering remote sensing with vgi-enhanced large multimodal language model","venue":null,"work_id":"a7889c98-bb8e-4e92-b91c-6e6f15a0ba37","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.078369Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7d741c759bcbb6602c04cf596f133ea3cd7bc869eb48825e3d53f27074ee249c","observation_id":"c84971c3-8ab1-4f8c-98e6-f143ba7b7feb","resolution":{"observed_at":"2026-08-06T21:49:56.346668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:56.177745Z","title":"Hello gpt-4o","venue":null,"work_id":"eec27654-29cd-48eb-908c-2d1c7ba1adb8","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.171325Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:31198875f6bb6ce343bc4f8ac6cba3800333a089765b285ed63d57dbf803ea6c","observation_id":"a6f53a50-2fbb-4fa8-9bb5-82087eb5ffff","resolution":{"observed_at":"2026-08-06T21:49:56.242315Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.981342Z","title":"Vhm: Versatile and honest vision lan- guage model for remote sensing image analysis","venue":null,"work_id":"7327660b-84ff-49b1-a495-bee4c78c56b1","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.242656Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:5aef011318cb6695a769a827ed798a70bd8bc4d857a2df690aeea81fab4003f7","observation_id":"a7d2eac8-8edb-49c0-9d47-9a7287cd4e45","resolution":{"observed_at":"2026-08-06T21:49:56.086960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.806437Z","title":"Langsplat: 3d language gaussian splatting","venue":null,"work_id":"0fa7187c-fb56-4529-a76f-78ef09ff7e34","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.317392Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:879b00cf8e584800808353ee7dba8b83affba03f90eb3fca2d0a4c03bfa81060","observation_id":"ede4e48d-4a1f-44e3-8d07-8c976f4a375d","resolution":{"observed_at":"2026-08-06T21:49:55.894524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.645989Z","title":"Deep semantic understanding of high resolution remote sensing image","venue":null,"work_id":"05a4f757-4c0d-46ef-9f6d-e588dd10596c","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.454471Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:c0c07fb1d5373a74697dc6ce244aa0aa4201b8dce4e9f5b4a10d1d35c4580bde","observation_id":"597031c2-4287-4768-9ec9-9c81916f7abe","resolution":{"observed_at":"2026-08-06T21:49:55.736156Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.533691Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"f9b12d89-29da-48aa-9df1-5bf46e41d808","year":2021},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.537922Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d270e4530b9a49799c9683bad5cd6beb77556e822221adc98a28aab3bf872409","observation_id":"c47a1362-4105-4afd-b80a-93a9f0db17c5","resolution":{"observed_at":"2026-08-06T21:49:55.596461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.317267Z","title":"Derf: Decom- posed radiance fields","venue":null,"work_id":"99a791d9-fd7f-4071-9ba4-1561a9c0f43d","year":2020},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.650119Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:658fcd4fb806af028b48030214f461dfaa90ff47155d24413d91e0e45948efbc","observation_id":"12ebebed-4dce-4e81-9e20-ce61af8ba3db","resolution":{"observed_at":"2026-08-06T21:49:55.445680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.162380Z","title":"Toolformer: Language models can teach themselves to use tools","venue":null,"work_id":"938c2f18-5778-4b6f-a2b1-39c2992acbe1","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.703626Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:031c14fc5d4f2de40fbebea0698dde1f7837896511a2d378f5f0be0f9836cdf5","observation_id":"72561cb0-d64b-4d2e-9e0d-559e86cabb15","resolution":{"observed_at":"2026-08-06T21:49:55.249562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.05663","last_updated":"2023-05-22T22:34:29Z","snapshot_observed_at":"2026-08-06T13:49:39.474018Z","submitted_at":"2022-10-11T17:57:10Z","title":"CLIP-Fields: Weakly Supervised Semantic Fields for Robotic Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.05663","snapshot_observed_at":"2026-08-06T21:49:45.758919Z","title":"Clip-fields: Weakly supervised semantic fields for robotic memory","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.758919Z"},"links":{"cited_paper":"/paper/2210.05663","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:b7c7d08db9f9b4fa196bfe7114bd08a551b1489bfb240377426c9a62e6742be0","observation_id":"c64e465f-305b-429a-8906-0612a0ab092e","resolution":{"observed_at":"2026-08-06T21:49:45.758919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:55.020880Z","title":"Language embedded 3d gaussians for open- vocabulary scene understanding","venue":null,"work_id":"9935f64b-83ce-4c13-a9d0-d095b6691f47","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.808762Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:e7afdb9eda6656d1b5013102382b308a55efaac5b52b5ddcca7bf8419ee2f700","observation_id":"1cca6068-bdbe-4e95-b372-49d2d1cc4e29","resolution":{"observed_at":"2026-08-06T21:49:55.086891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.907734Z","title":"Real-time view synthesis for large scenes with millions of square meters","venue":null,"work_id":"6d4e2e3d-aa26-4ccd-b62d-f96c556614ba","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.867334Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4ad5e7c0205b6a2a28f8ef218188d89197fa90a1ee89ac2733563433275d1533","observation_id":"753f4515-7c61-4625-8f72-df9435fd83cc","resolution":{"observed_at":"2026-08-06T21:49:54.947992Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.705630Z","title":"City-on-web: Real-time neural rendering of large- scale scenes on the web","venue":null,"work_id":"6688e07f-5614-4be2-8092-fd22a9915c07","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:45.905136Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:337ecea57f75eac94e57341dfcc477a2bbd29a04affebdc8f4ba4f27d4867bd0","observation_id":"86280683-e13f-4125-a85d-f36cb77c5652","resolution":{"observed_at":"2026-08-06T21:49:54.815656Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.524563Z","title":"De- composing 3d scenes into objects via unsupervised volume segmentation","venue":null,"work_id":"3cb39655-9c48-4bbc-9a39-4bb95535a9fb","year":2021},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.023299Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:6970d0fd04db5b303fdf870cd06d9830887dc2e472c74aff0ea121620bf8d923","observation_id":"b9c0206e-f8e7-4604-82a5-16898e815aeb","resolution":{"observed_at":"2026-08-06T21:49:54.633027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.368604Z","title":"Modular visual question answering via code generation","venue":null,"work_id":"b2d66fe5-be18-4b04-b5e7-c5f4e50d9b7f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.069829Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7012443c981e2096a8331346af7d0284f2b74ae7514947907b0c6fa90a22077a","observation_id":"700651a4-cb5f-4101-b462-ca96833df9cb","resolution":{"observed_at":"2026-08-06T21:49:54.454110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.226134Z","title":"3d ques- tion answering for city scene understanding","venue":null,"work_id":"9409d382-50cb-46fb-b999-df04c0030c47","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.122863Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:07b4393468d0f573c3f83b2055b9a14c2bb60350f6c461dd0863f0dc7dbd7f0a","observation_id":"dc431695-f1e0-4f6f-a2d7-2bbbf9863b43","resolution":{"observed_at":"2026-08-06T21:49:54.292203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:54.154381Z","title":"Visual grounding in remote sensing images","venue":null,"work_id":"3e543165-daed-4f44-9d81-8c595b2853b9","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.179689Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:6037997fff71175504863f39e8cd1fe161138179f2013f30cf36fa23fe8df3b2","observation_id":"a116152e-ee2d-47bc-a708-0b273c10d0b5","resolution":{"observed_at":"2026-08-06T21:49:54.192127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.967287Z","title":"ViperGPT: Visual inference via python execution for reasoning","venue":null,"work_id":"2a253cfa-0193-494c-a9b4-5526044ab1a4","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.235926Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:e3269aaef3d1c8d47f050f4cb17f7c06209d597f452d252798a81b533451c73a","observation_id":"89523449-652f-4b7d-93aa-f2de235e1a3b","resolution":{"observed_at":"2026-08-06T21:49:54.059622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.819118Z","title":"Srinivasan, Jonathan T","venue":null,"work_id":"8e5397e2-4b89-4dd4-ba49-2e0ba11f9329","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.293702Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:93174ef9d75fb93eb7d05def597e75d9c60a084a2e5a310323289a20e4cd66b1","observation_id":"d3fd2ac5-28eb-43fd-947f-dc05078d97f3","resolution":{"observed_at":"2026-08-06T21:49:53.881502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.680540Z","title":"Crs-diff: Controllable generative re- mote sensing foundation model","venue":null,"work_id":"eef328a6-0f86-4719-801b-1991ab76e3ce","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.366132Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:ed7b13f79b64c8274877a33d83226b90d822ee8b8007b0b1db4d915d3f010f30","observation_id":"57e570d9-5479-4183-9948-0f315a385603","resolution":{"observed_at":"2026-08-06T21:49:53.729228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01413","last_updated":"2024-05-02T16:04:30Z","snapshot_observed_at":"2026-07-06T18:08:52.053005Z","submitted_at":"2024-05-02T16:04:30Z","title":"MiniGPT-3D: Efficiently Aligning 3D Point Clouds with Large Language Models using 2D Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01413","snapshot_observed_at":"2026-08-06T21:49:46.416409Z","title":"Minigpt-3d: Efficiently aligning 3d point clouds with large language models using 2d priors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.416409Z"},"links":{"cited_paper":"/paper/2405.01413","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:95d3d6e7297927538734077ed75176a67cd66db924531e248db042d5c5c2f8d8","observation_id":"e963ca73-2e31-42fd-b422-939edfc5e32f","resolution":{"observed_at":"2026-08-06T21:49:46.416409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.564637Z","title":"Mega-nerf: Scalable construction of large-scale nerfs for virtual fly-throughs","venue":null,"work_id":"3b06f302-793e-4747-837f-9a701d0f55d5","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.462758Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:8c2732d994b7daac182ba4cc2a851b40b815ee412981151eb828021379e258f8","observation_id":"43ac9ec0-b7ff-427a-a3de-96a9fb84d01e","resolution":{"observed_at":"2026-08-06T21:49:53.611663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.412250Z","title":"Geoclip: Clip-inspired alignment between locations and im- ages for effective worldwide geo-localization","venue":null,"work_id":"66b543ee-d2a4-43ae-8be7-fa221e43afa3","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.542012Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:1eef39982b9fec1bf1625b2fda7c2c97caaa5d6472bb9219fb1a03ad26b71338","observation_id":"66328b1d-9627-491e-b845-e8701b4ae3d7","resolution":{"observed_at":"2026-08-06T21:49:53.524417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:53.119014Z","title":"Skyscript: A large and semanti- cally diverse vision-language dataset for remote sensing","venue":null,"work_id":"cb731437-b28b-4d2e-b5b5-b7ce93082f8c","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.608758Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:34ee2ee1bf8c47b27b33f8b9e96ec168da1e862809dff584c779b99e72af3a4d","observation_id":"08dcae4e-331b-4fde-a88e-c931cd680623","resolution":{"observed_at":"2026-08-06T21:49:53.281261Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.908853Z","title":"Text2loc: 3d point cloud localization from natural language","venue":null,"work_id":"aa55bf91-5e41-4f81-82e9-0e5a6bee761d","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.661207Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:cc4e75c65cadeacf97b9ca5a955e176c378d718fa3234cbb4abdaaa849ffda40","observation_id":"96d58b29-89ee-43af-b61c-3fb6d54e869a","resolution":{"observed_at":"2026-08-06T21:49:52.994039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.616020Z","title":"Bungeenerf: Progressive neural radiance field for extreme multi-scale scene rendering","venue":null,"work_id":"2d0e2a62-6e00-43cc-998c-b5f57bf54b79","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.717819Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f7df81e84fc38a0b33bf4ef7d3aac29bd7fc144607050cd187680f6f60a3726e","observation_id":"e6fdab54-f947-4033-8866-5f2f7e532a5c","resolution":{"observed_at":"2026-08-06T21:49:52.782372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.329368Z","title":"Citydreamer: Compositional generative model of unbounded 3D cities","venue":null,"work_id":"168f350f-7d96-45ff-b72d-7db237d2f743","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.764874Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:bc5d80b519f9830501cece2ae2ca67dca70ee9f34675b21c10c5f5f36b29731f","observation_id":"74ea19dd-d55c-4610-96da-75d4db71c88a","resolution":{"observed_at":"2026-08-06T21:49:52.490533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06526","last_updated":"2025-02-27T05:39:54Z","snapshot_observed_at":"2026-07-06T18:28:20.634381Z","submitted_at":"2024-06-10T17:59:55Z","title":"Generative Gaussian Splatting for Unbounded 3D City Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06526","snapshot_observed_at":"2026-08-06T21:49:46.818968Z","title":"GaussianCity: Generative gaussian splatting for unbounded 3D city generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.818968Z"},"links":{"cited_paper":"/paper/2406.06526","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4c9c8cb501fe7b8c09f560f042fe076f4c7b5d27a98f95aab6a9a4184488844c","observation_id":"7cb1dfe4-9caa-4660-8e0f-322ee862b86d","resolution":{"observed_at":"2026-08-06T21:49:46.818968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:52.004317Z","title":"Grid-guided neural radiance fields for large urban scenes","venue":null,"work_id":"56e91b69-6e1b-407b-9f0f-55df67564c31","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.895366Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4cde494340cd4c20d4226d3e490d28f100eafb214e59a5609596146a68231180","observation_id":"8ad4195c-3cd5-4c51-9efb-b631cd4f3f37","resolution":{"observed_at":"2026-08-06T21:49:52.184167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.767269Z","title":"Pointllm: Empowering large language models to understand point clouds","venue":null,"work_id":"05ec943f-e3e5-4bf6-a1fb-a8e47b951ae8","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:46.938093Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:c3fc82282f1cf53e30f02fe5dc598d3c2d31ecd5a9467ad148cad9b40c2ee522","observation_id":"b760559c-52cb-4306-a908-3e67e5e05eeb","resolution":{"observed_at":"2026-08-06T21:49:51.883576Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.531490Z","title":"Addressclip: Empowering vision-language models for city-wide image address localization","venue":null,"work_id":"dda4836a-4536-4f13-ab94-453825b03d77","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.105618Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:3926a93ba35c57d4c8bbafb50d066e8c228c899ab1ae99b5998bb2ccf01fe12a","observation_id":"e3dd9d04-2419-4c03-a6a6-a96cfc73e4c1","resolution":{"observed_at":"2026-08-06T21:49:51.674509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.329008Z","title":"Unisim: A neural closed-loop sensor simulator","venue":null,"work_id":"20c01311-1638-4555-8c51-ffff14bc396f","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.217718Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:f451efcdcec56ecd0182ca7dac78d0d53e76818eef7aca544288757df1c3d7ca","observation_id":"c5b83c66-8f0f-4dff-983b-606d80e0b1ee","resolution":{"observed_at":"2026-08-06T21:49:51.420687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:51.035121Z","title":"Scannet++: A high-fidelity dataset of 3d indoor scenes","venue":null,"work_id":"772c8132-2d54-453f-b30d-a7ff79c41073","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.345334Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:010f42f4061127f929a0f87f1eaf2a43ee83fe560f2a66cb1c734db62e710936","observation_id":"8a8f6348-3a1f-4b59-8b62-811d51aae34f","resolution":{"observed_at":"2026-08-06T21:49:51.161037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.817913Z","title":"Dogs: Distributed-oriented gaus- sian splatting for large-scale 3d reconstruction via gaussian consensus","venue":null,"work_id":"108cbcbe-b01f-46f1-adfd-a496230d7a2e","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.442586Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:25c95afeaad8275e99f8ffcabea914caea4271e1622277cabf01e22369564c6e","observation_id":"928e6764-3973-4ad1-bf7b-d15f99d7e2e9","resolution":{"observed_at":"2026-08-06T21:49:50.891902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09079","last_updated":"2024-07-15T02:18:09Z","snapshot_observed_at":"2026-08-09T00:20:45.713184Z","submitted_at":"2024-03-14T03:52:33Z","title":"PreSight: Enhancing Autonomous Vehicle Perception with City-Scale NeRF Priors","version":3},"cited_work":{"arxiv_id":"2403.09079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.09079","snapshot_observed_at":"2026-08-06T21:49:48.477693Z","title":"PreSight: Enhancing Autonomous Vehicle Perception with City-Scale NeRF Priors","venue":"cs.CV","work_id":"6c0c2b10-0ec6-4bdd-8e5a-7b782371b5a5","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.509275Z"},"links":{"cited_paper":"/paper/2403.09079","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d47669920dc57e8e62f70b065dacc4fcbaf58c40465f1d9cc95db77dc6a744cf","observation_id":"c06fb373-00e8-4647-aca5-bfeb0b7331a2","resolution":{"observed_at":"2026-08-06T21:49:48.524762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.643978Z","title":"Exploring a fine-grained multiscale method for cross-modal remote sensing image re- trieval","venue":null,"work_id":"39dac2e7-4a5f-464e-9ec8-1a5eeb85fdd6","year":2022},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.551158Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:cbcaa4159e409d88e2dc8a78713bd2c36f65d3b07fe98a79afd77899d9024e2d","observation_id":"07bb5d59-1330-4260-90f3-f1ce37af3872","resolution":{"observed_at":"2026-08-06T21:49:50.727057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.343338Z","title":"Garfield++: Reinforced gaussian ra- diance fields for large-scale 3d scene reconstruction, 2024","venue":null,"work_id":"75573877-f65e-4d87-8c98-a598feaa0e88","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.607078Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a0ac168163134b0d52feec85eafec1808e294355d1ab62fbec7f41225073155c","observation_id":"c8b06b90-3f35-40f9-bfbd-76a741394e33","resolution":{"observed_at":"2026-08-06T21:49:50.489234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:50.111234Z","title":"3DitScene: Editing any scene via language-guided disentan- gled gaussian splatting","venue":null,"work_id":"d8613150-87fa-4baf-87ab-ddace664206b","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.663922Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d5f4660a8d065a1bd3873fea3e61398a7ea7b39654465d4fd3987b32b99c2458","observation_id":"1444202d-ec7b-4a38-9b77-da8efe02732a","resolution":{"observed_at":"2026-08-06T21:49:50.181200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.910887Z","title":"Earthgpt: A universal multi-modal large lan- guage model for multi-sensor image comprehension in re- mote sensing domain","venue":null,"work_id":"95ef4a41-7237-450a-a131-17c148575dae","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.719996Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:e8a7782ed4986fe3fdd65fc7c76efca105e0982b4e4bb2382eee0d33a2eb9f92","observation_id":"5d435d0e-5c3e-4e41-bda2-42231a60e7fa","resolution":{"observed_at":"2026-08-06T21:49:49.989182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13596","last_updated":"2024-11-29T10:18:58Z","snapshot_observed_at":"2026-08-08T11:55:45.577205Z","submitted_at":"2024-07-18T15:35:00Z","title":"EarthMarker: A Visual Prompting Multi-modal Large Language Model for Remote Sensing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.13596","snapshot_observed_at":"2026-08-06T21:49:47.792628Z","title":"Earthmarker: A visual prompt learning frame- work for region-level and point-level remote sensing imagery comprehension","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.792628Z"},"links":{"cited_paper":"/paper/2407.13596","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:9d83663bfbe230acb0d64620d7101692d4f195fdd11b03bc13565ff5e59c13b6","observation_id":"cb0f6bdb-ae78-497e-8085-d4022ea2b322","resolution":{"observed_at":"2026-08-06T21:49:47.792628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03003","last_updated":"2023-03-07T14:46:21Z","snapshot_observed_at":"2026-08-06T19:59:55.051274Z","submitted_at":"2023-03-06T10:04:50Z","title":"Efficient Large-scale Scene Representation with a Hybrid of High-resolution Grid and Plane Features","version":2},"cited_work":{"arxiv_id":"2303.03003","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.03003","snapshot_observed_at":"2026-08-06T21:49:48.322269Z","title":"Efficient Large-scale Scene Representation with a Hybrid of High-resolution Grid and Plane Features","venue":"cs.CV","work_id":"354ec982-a84f-4c26-9df5-9cfdb4531cbb","year":2023},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.847955Z"},"links":{"cited_paper":"/paper/2303.03003","citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4f3dcc00e419a8446536775ce1ad697a713ba38b54640aa1d0859bf60499f321","observation_id":"a6fde006-503c-4e13-a313-7da9fb1a1243","resolution":{"observed_at":"2026-08-06T21:49:48.374875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.657807Z","title":"Aerial lifting: Neural urban semantic and building instance lifting from aerial imagery","venue":null,"work_id":"707129df-d965-42b3-ae6f-f5fb99d231c4","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.900648Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:ae08628b1b3e47d8088ef4f32e75b1d6143d31d764838b123d73266ca31e7140","observation_id":"a7ef6112-0d56-40b4-8e46-add371eadc78","resolution":{"observed_at":"2026-08-06T21:49:49.770435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.408607Z","title":"Rs5m and georsclip: A large-scale vision- language dataset and a large vision-language model for remote sensing","venue":null,"work_id":"c4d5ccec-a593-4a83-90bd-1eada7ace1df","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:47.958787Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:4f091f33e18d60990ad6c91bfea27559650550dc389bb1dc23bfc708879750f7","observation_id":"de21f140-582b-4c75-9827-6bbac2003409","resolution":{"observed_at":"2026-08-06T21:49:49.525950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.176618Z","title":"Mutual Attention Inception Network for Remote Sensing Visual Question Answering","venue":null,"work_id":"4e2dccd2-3bcd-4d6e-9d69-50689145a6ea","year":2021},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.037601Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:09d0cca0daa84c6c4369daf76b0793bf02dbd3fc7fa82a9ba713e7a12ab058cc","observation_id":"861b8f96-6aef-48a5-9807-82467594e760","resolution":{"observed_at":"2026-08-06T21:49:49.261423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:49.045710Z","title":"Drivinggaussian: Composite gaussian splatting for surrounding dynamic au- tonomous driving scenes","venue":null,"work_id":"eb373c2b-14e7-4586-9258-16ed88707bf9","year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.120675Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:7fe8d4fa0f54b1b8fc5b744be775dbedf71be5ea2d7ef099e65de105cfd83060","observation_id":"e9afdf7b-ffbb-44f9-8cac-136746af8ab1","resolution":{"observed_at":"2026-08-06T21:49:49.088711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:48.162222Z","title":"Towards vision- language geo-foundation models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.162222Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:cf759a7b73bde8313e9a650554708a2367d3f5d6b2bec9cb80f46dfb12a54319","observation_id":"067fb573-df17-4484-9755-f991eb3f2950","resolution":{"observed_at":"2026-08-06T21:49:48.162222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:48.876936Z","title":"3d-vista: Pre-trained transformer for 3d vision and text alignment","venue":null,"work_id":"2335dff3-7a17-4a04-91c5-64a1d7720a27","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.227457Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:a8bcbcb718a4b36ea3abf1ed5f7a505e97a5344504ecfa5638ae843ad33a3cd6","observation_id":"665b8c4d-6538-4db8-9d99-a80c8c9f3ed5","resolution":{"observed_at":"2026-08-06T21:49:48.941651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:49:48.733635Z","title":"'yes' if {ANSWER1} < {ANSWER2} else 'no'","venue":null,"work_id":"d496eee2-a099-427d-b48e-07a82e6f0e92","year":null},"citing_paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:48.230001Z"},"links":{"citing_paper":"/paper/2506.23352"},"observation_digest":"sha256:d66a9e3d3411741268a289066d51dc285a84c67a78385035d446bac75d1d9c82","observation_id":"0eddabe3-4fb5-4160-a229-5338d77d636e","resolution":{"observed_at":"2026-08-06T21:49:48.805064Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23352","last_updated":"2025-06-29T18:03:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T05:37:38.871712Z","submitted_at":"2025-06-29T18:03:03Z","title":"GeoProg3D: Compositional Visual Reasoning for City-Scale 3D Language Fields"},"reference_resolution":{"displayed":96,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":2,"verified_fuzzy":64},"total_outbound_references":96},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 96 of 96 outbound references and 0 inbound Pith citation observations for arXiv:2506.23352."}