{"as_of":"2026-08-10T00:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a1c045bdeaba761e26cd776e95b95eefd09b348edf1eac9abdaf4e86e00a942f","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:39:43.408345Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14115/citation-record","integrity":"/paper/2607.14115/integrity","json":"/paper/2607.14115/citation-record.json","paper":"/paper/2607.14115"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.143516Z","title":"Gsv-cities: Toward appropriate supervised visual place recognition.Neurocomputing, 513:194–203, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.143516Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:1ae5aed1c76f1af755fbe01ec83f8a9195eabd99f768e1462326174962815c47","observation_id":"6d81dd4d-3b32-48de-94ee-ab9cbbc455ec","resolution":{"observed_at":"2026-08-02T14:39:39.143516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.14217","last_updated":"2023-02-28T00:43:13Z","snapshot_observed_at":"2026-08-09T11:12:06.039074Z","submitted_at":"2023-02-28T00:43:13Z","title":"Global Proxy-based Hard Mining for Visual Place Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.14217","snapshot_observed_at":"2026-08-02T14:39:39.201606Z","title":"Global proxy-based hard mining for visual place recognition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.201606Z"},"links":{"cited_paper":"/paper/2302.14217","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:6cc0fb25ec366b94197b2180b880d04af104d9bdde5ac5af6ba64ef7850e597f","observation_id":"df89369e-5249-4ecb-9a15-3459e7b03b51","resolution":{"observed_at":"2026-08-02T14:39:39.201606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.267722Z","title":"BoQ: A place is worth a bag of learnable queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.267722Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:dd90f93d63d60a67184d575671e044e6667b35e3f32a88c2e6040fd54f8b9ce1","observation_id":"f75dcdde-0338-43ac-b742-1a65ba9800d3","resolution":{"observed_at":"2026-08-02T14:39:39.267722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.347228Z","title":"Netvlad: Cnn architecture for weakly supervised place recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.347228Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:98827db4de3374942e17a4f54fa68a086cb899cab55b63b8c33f663b9c864d25","observation_id":"044524bf-f53e-4a64-ade6-f1f1d0c20243","resolution":{"observed_at":"2026-08-02T14:39:39.347228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.430324Z","title":"Ask&confirm: active detail enriching for cross-modal retrieval with partial query","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.430324Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:f1def5ef158abbcbf81d1085670c876dc659324a34e35bd2d51dd5977127c838","observation_id":"9e50e462-1665-41f8-b7c2-53445175215a","resolution":{"observed_at":"2026-08-02T14:39:39.430324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.508679Z","title":"where am i?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.508679Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:1a7907e134524f19b6d3b76268e4a383b61f28d8f91c1c9ce4d5d3a01646038a","observation_id":"72b0da76-59b1-42e9-9015-c994ff59c504","resolution":{"observed_at":"2026-08-02T14:39:39.508679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22390","last_updated":"2026-04-24T09:28:35Z","snapshot_observed_at":"2026-07-06T23:08:47.078992Z","submitted_at":"2026-04-24T09:28:35Z","title":"Region Matters: Efficient and Reliable Region-Aware Visual Place Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22390","snapshot_observed_at":"2026-08-02T14:39:39.583709Z","title":"Region matters: Efficient and re- liable region-aware visual place recognition.arXiv preprint arXiv:2604.22390, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.583709Z"},"links":{"cited_paper":"/paper/2604.22390","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:a4938c9fd6b68367af3e0e25025d453ad05f48c42a3ac3c17c06af191020f501","observation_id":"94fb2119-50ca-418a-8717-1a8bb761545d","resolution":{"observed_at":"2026-08-02T14:39:39.583709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.665070Z","title":"SAGE: Spatial-visual adaptive graph exploration for efficient visual place recognition","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.665070Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:f767d001d3cca36272968ef3d881376671b2f55750152f4ebbbd0857c1f92321","observation_id":"5d6f3a76-388d-452b-a6c2-683dc08e31e0","resolution":{"observed_at":"2026-08-02T14:39:39.665070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.747412Z","title":"Towards natural language-guided drones: Geotext-1652 benchmark with spatial relation matching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.747412Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:4f84121af4a60bae82219fc3c43e6b81764305feae302a86774c04aee0838b77","observation_id":"545e630d-aa1a-410a-89e3-1b0b5d0f2c74","resolution":{"observed_at":"2026-08-02T14:39:39.747412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.797523Z","title":"Sam- ple4geo: Hard negative sampling for cross-view geo- localisation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.797523Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:13043f200605326d613b4d53931e494061baa4a8d686b6efb05f50e775d6acde","observation_id":"f47764ab-4990-4e13-a092-3019e1615f1c","resolution":{"observed_at":"2026-08-02T14:39:39.797523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:39.874044Z","title":"Seq- matchnet: Contrastive learning with sequence matching for place recognition & relocalization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.874044Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:f1a605e4817ff7a347be4953a92d5d6ff27b68ed8984067ca133ab8fe27a5ec5","observation_id":"0a48b0d7-f127-4d49-a3e8-f94698d8d2c1","resolution":{"observed_at":"2026-08-02T14:39:39.874044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T14:39:39.959139Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:39.959139Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:f7fc3f5fb77aeeedc1c3ead54d6ea8b697397002f6a08cc9f463c7a5834ed521","observation_id":"eef4fbc7-5dbf-47d1-91c0-f4b1da6bebb9","resolution":{"observed_at":"2026-08-02T14:39:39.959139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.020449Z","title":"Textplace: Visual place recognition and topolog- ical localization through reading scene texts","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.020449Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:161f23f83272e55b38a4b16d7dada7aa77a3f2d8f1c890f92d6a4fe0f6583418","observation_id":"a42aebdc-2615-4502-b72a-d82548e8153e","resolution":{"observed_at":"2026-08-02T14:39:40.020449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.116057Z","title":"Progeo: Generating prompts through image- text contrastive learning for visual geo-localization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.116057Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:ae720d828a7a324c6cc353ee6604bf97af791fedfda666224a2fe43b2c43db31","observation_id":"4690cd53-8964-4e74-9e52-c19fef2cc5ba","resolution":{"observed_at":"2026-08-02T14:39:40.116057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.196754Z","title":"Optimal transport ag- gregation for visual place recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.196754Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:c37e0fb4f8f053efdb3b781888e0c1f8ab199a62730d8995a704ce384e704d1b","observation_id":"446b4d00-f85e-4c5d-8eb9-c87a75675a95","resolution":{"observed_at":"2026-08-02T14:39:40.196754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.282316Z","title":"Close, but not there: Boosting geographic distance sensitivity in visual place recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.282316Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:4f1a04d01e6c1442defd99b447e4086feee7d518119724817e50c5f6ed49d954","observation_id":"76ae7ba9-544e-4d14-ab45-24c25940845e","resolution":{"observed_at":"2026-08-02T14:39:40.282316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-02T14:39:40.364752Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.364752Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:d8c758301754278514f40154d1063dafdf2c60005d3bee28f47978c63395df3d","observation_id":"6c0923c1-d8e3-4499-8287-094c29b5ca15","resolution":{"observed_at":"2026-08-02T14:39:40.364752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.447356Z","title":"Cross-modal implicit relation rea- soning and aligning for text-to-image person retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.447356Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:eea66da54c9b61218b2213808f32482f60dc3b7533607dce04ae807c156bfbf6","observation_id":"7683195f-e8a4-4dd5-8b44-61b8c4732fe3","resolution":{"observed_at":"2026-08-02T14:39:40.447356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.507494Z","title":"Text2pos: Text-to-point-cloud cross-modal localiza- tion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.507494Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:8c72011910ecd0a9b63285a38ef622813e995064200279e4b31ddafcef32bc35","observation_id":"9aaf1dc2-bcc0-488b-a4cb-850d328f9982","resolution":{"observed_at":"2026-08-02T14:39:40.507494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.587880Z","title":"Whittlesearch: Interactive image search with relative at- tribute feedback.International Journal of Computer Vision, 115(2):185–210, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.587880Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:219a83588120fb3424ea3e96f548c47e4dc579b0627c634eb1ccde76afafbdb6","observation_id":"2c67acc5-ddc2-4a7e-9d4e-241198cfcbf3","resolution":{"observed_at":"2026-08-02T14:39:40.587880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.698349Z","title":"Cosmo: Content-style modulation for image retrieval with text feed- back","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.698349Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:7edb64bd7ba3ba342d5c675ebe10de26b9231540b7cfd8ce055dafdb32f2db05","observation_id":"2df1e1eb-36b9-4c46-ad15-308003c429bc","resolution":{"observed_at":"2026-08-02T14:39:40.698349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03411","last_updated":"2024-07-24T23:03:01Z","snapshot_observed_at":"2026-08-08T16:40:48.720365Z","submitted_at":"2024-06-05T16:09:01Z","title":"Interactive Text-to-Image Retrieval with Large Language Models: A Plug-and-Play Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03411","snapshot_observed_at":"2026-08-02T14:39:40.780873Z","title":"Interactive text-to-image retrieval with large language models: A plug-and-play approach.arXiv preprint arXiv:2406.03411, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.780873Z"},"links":{"cited_paper":"/paper/2406.03411","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:505c112119b25cdebf706dd9e261de74052afe884ac886baaafb5f3ca2b9d3cc","observation_id":"5958a955-1502-423d-9104-534c0691dc9a","resolution":{"observed_at":"2026-08-02T14:39:40.780873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.841666Z","title":"Chatting makes perfect: Chat-based image retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.841666Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:5cb53d2b61d1db646b24534f45eeb269720c512505cbcbe50095eb4d67b86bbd","observation_id":"adc00c94-d481-4aae-8ec3-ba0451eb6b98","resolution":{"observed_at":"2026-08-02T14:39:40.841666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:40.918209Z","title":"Omnicity: Omnipotent city understanding with multi-level and multi- view images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:40.918209Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:58e9e2228153e868596576ec11950ab83e4faddc23b6e630df7d89b965c18792","observation_id":"680708bc-0ab2-47cb-bec3-3d564a0c4b7a","resolution":{"observed_at":"2026-08-02T14:39:40.918209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.001765Z","title":"Simple baselines for interactive video retrieval with questions and answers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.001765Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:4ae53a4b424399b95649ac2f1ceb9d1149975c477ed90753015fd7bc1ff1ea42","observation_id":"45506850-506e-4812-a644-e754d0b80a59","resolution":{"observed_at":"2026-08-02T14:39:41.001765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-02T14:39:41.107742Z","title":"Visual- rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.107742Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:13ca319a485a88f04fbc027a3d495181ee173443c3a940eb0aeb5b3adab7fc80","observation_id":"1ae29204-3fda-4586-a3b8-5659dc0e2a5c","resolution":{"observed_at":"2026-08-02T14:39:41.107742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.177835Z","title":"Towards seamless adapta- tion of pre-trained models for visual place recognition","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.177835Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:b5437841ee6d6658a7a57199fbd1abe2cb24c614e3fc34a5c04187dbcd9ae6c7","observation_id":"7b73d86a-4423-482b-ba41-2294a4241b23","resolution":{"observed_at":"2026-08-02T14:39:41.177835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.246535Z","title":"Supervlad: Com- pact and robust image descriptors for visual place recogni- tion.Advances in Neural Information Processing Systems, 37:5789–5816, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.246535Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:943235e238dca5b90e126a804a20ba1e8c17b7b61d8a84a9c7a394e7738fc999","observation_id":"3bc298de-c8fe-4ffb-9dbe-8db09f7956cc","resolution":{"observed_at":"2026-08-02T14:39:41.246535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10174","last_updated":"2025-05-24T02:19:27Z","snapshot_observed_at":"2026-08-07T16:05:54.586910Z","submitted_at":"2025-04-14T12:26:31Z","title":"LLaVA-ReID: Selective Multi-image Questioner for Interactive Person Re-Identification","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10174","snapshot_observed_at":"2026-08-02T14:39:41.329868Z","title":"Llava-reid: Selective multi-image ques- tioner for interactive person re-identification.arXiv preprint arXiv:2504.10174, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.329868Z"},"links":{"cited_paper":"/paper/2504.10174","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:1b3b7d34d95b0a4b110b5562c2fe75dfb3d73f09e49638e8ab474359bc22e508","observation_id":"c8f66496-45c6-4bed-b1c4-ae672778d6e8","resolution":{"observed_at":"2026-08-02T14:39:41.329868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17520","last_updated":"2024-06-25T12:59:46Z","snapshot_observed_at":"2026-07-06T18:36:42.830927Z","submitted_at":"2024-06-25T12:59:46Z","title":"Tell Me Where You Are: Multimodal LLMs Meet Place Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17520","snapshot_observed_at":"2026-08-02T14:39:41.410192Z","title":"Tell me where you are: Multimodal llms meet place recognition.arXiv preprint arXiv:2406.17520, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.410192Z"},"links":{"cited_paper":"/paper/2406.17520","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:c2463fb37baaa3db1b4e23b6fa471f28c6a97caea1b71ba3dc079c5b80fe666a","observation_id":"ab159d0e-7c40-4d45-bc96-a713fd345018","resolution":{"observed_at":"2026-08-02T14:39:41.410192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.491749Z","title":"Learn- ing to retrieve videos by asking questions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.491749Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:1d5aa73ea9007c79e85d8c06fcdc863ef4390b0a7f4d150e1e6a3ca35cb2c35c","observation_id":"b9f26f10-e957-456c-9a85-2db65a7fc899","resolution":{"observed_at":"2026-08-02T14:39:41.491749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.577075Z","title":"Emvp: Em- bracing visual foundation model for visual place recognition with centroid-free probing.Advances in Neural Information Processing Systems, 37:120928–120950, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.577075Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:cf4d56fcd51426a27f775872f5ec8b22ebc9ac849bef2b65b369accface4f335","observation_id":"883543fb-d6fb-4b9e-90f3-75cba2a29af0","resolution":{"observed_at":"2026-08-02T14:39:41.577075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.660639Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.660639Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:9cc52c96d0775556eb736640ef64b35f9e6abb0ac84cdff2fb561b39cb58efe7","observation_id":"70250d35-1285-4c4d-adab-0bcfc9f16dd5","resolution":{"observed_at":"2026-08-02T14:39:41.660639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:41.746035Z","title":"From coarse to fine: Robust hierarchical localization at large scale","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.746035Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:75f4978e5654294e3c1f502000bf86fa0bb25742250e0ed317ccd824c87bf4fc","observation_id":"57a845fa-a392-480e-8ca0-f5458d828766","resolution":{"observed_at":"2026-08-02T14:39:41.746035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14195","last_updated":"2025-03-07T12:30:18Z","snapshot_observed_at":"2026-08-07T18:03:14.574974Z","submitted_at":"2025-02-20T02:00:02Z","title":"Bridging Text and Vision: A Multi-View Text-Vision Registration Approach for Cross-Modal Place Recognition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14195","snapshot_observed_at":"2026-08-02T14:39:41.830609Z","title":"Bridging text and vision: A multi-view text-vision registration approach for cross- modal place recognition.arXiv preprint arXiv:2502.14195,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.830609Z"},"links":{"cited_paper":"/paper/2502.14195","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:200e9b8ff6ff9232f382ff7e87f65ef858aa88a78be88e8e49d3965b6f4f6404","observation_id":"4cd26d6c-3e2e-4fe5-a3cf-8eaf757650ce","resolution":{"observed_at":"2026-08-02T14:39:41.830609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T14:39:41.913539Z","title":"Deepseekmath: Pushing the limits of math- ematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.913539Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:071536005f328732d3d6f9acafa62d87ef41f09e29022a721c8b6fa191d2ce73","observation_id":"9a5d4326-f24f-40d1-912b-62e2abfab7b6","resolution":{"observed_at":"2026-08-02T14:39:41.913539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-02T14:39:41.971750Z","title":"Vlm-r1: A stable and generaliz- able r1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:41.971750Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:1a8260e3b39cb2c2e8a36cef86619ae1a4b72f2c1a3011bc8c62c90e84d63bf2","observation_id":"11454ed3-1d24-4970-9d84-6935fb79c2c9","resolution":{"observed_at":"2026-08-02T14:39:41.971750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.048832Z","title":"Where am i looking at? joint location and orientation es- timation by cross-view matching","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.048832Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:65e545a2204f8b7aee62748fad786d2721ef8a667d40c4e938a9d41c934a7247","observation_id":"49a055f8-a119-403b-9ee0-899d7e21b6fd","resolution":{"observed_at":"2026-08-02T14:39:42.048832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06501","last_updated":"2025-08-11T16:25:17Z","snapshot_observed_at":"2026-08-07T17:19:17.780729Z","submitted_at":"2025-03-09T08:03:41Z","title":"TextInPlace: Indoor Visual Place Recognition in Repetitive Structures with Scene Text Spotting and Verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06501","snapshot_observed_at":"2026-08-02T14:39:42.108448Z","title":"Textinplace: Indoor vi- sual place recognition in repetitive structures with scene text spotting and verification.arXiv preprint arXiv:2503.06501,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.108448Z"},"links":{"cited_paper":"/paper/2503.06501","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:e77360c36c4ae3a14a83f4561c459abea89ede46d162543aefa5106c7d39f801","observation_id":"0095fdb1-8ec0-4bfe-bcd1-05de325cb63e","resolution":{"observed_at":"2026-08-02T14:39:42.108448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.159054Z","title":"Loc4plan: Locating be- fore planning for outdoor vision and language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.159054Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:2554470ba9269309e69d0389f7db82b4b73b8140c831e8e6c1c1906fa74feabd","observation_id":"d8be864d-3b63-48a8-8919-b2aee52037bb","resolution":{"observed_at":"2026-08-02T14:39:42.159054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.243908Z","title":"Focus on local: Finding reliable discriminative regions for visual place recognition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.243908Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:50ef7978f70fbf1dc315e81891ee60d88e2caf43e8efa5c92b6d6438cdb6bc86","observation_id":"cd8e3e24-d008-4bdc-a0eb-7760d5fa08a0","resolution":{"observed_at":"2026-08-02T14:39:42.243908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06730","last_updated":"2024-07-09T10:15:31Z","snapshot_observed_at":"2026-08-08T17:27:25.100378Z","submitted_at":"2024-07-09T10:15:31Z","title":"LVLM-empowered Multi-modal Representation Learning for Visual Place Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06730","snapshot_observed_at":"2026-08-02T14:39:42.328089Z","title":"Lvlm-empowered multi-modal representation learning for visual place recognition.arXiv preprint arXiv:2407.06730,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.328089Z"},"links":{"cited_paper":"/paper/2407.06730","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:8898c02ff1177247182f130ee26867edc8c774b218f4ed21bb3aad3fccfc2756","observation_id":"9b832fc1-88de-495f-a0cb-f9419250150f","resolution":{"observed_at":"2026-08-02T14:39:42.328089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.410690Z","title":"Multi-similarity loss with general pair weighting for deep metric learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.410690Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:33e5386bb6b130f625517efc2b8cb3cd3a52806a6c690c94bce0f198de3344ec","observation_id":"3aecf139-7d29-482f-92d1-f270b7386029","resolution":{"observed_at":"2026-08-02T14:39:42.410690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.497204Z","title":"Fine-grained cross-view geo-localization using a correlation-aware homography estimator.Advances in Neu- ral Information Processing Systems, 36:5301–5319, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.497204Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:ae4fbdf84c3ba90e9477b19e6096efe0820216f956743532dca40bd7e611d518","observation_id":"01364525-4486-431f-a994-af26f6e2aae0","resolution":{"observed_at":"2026-08-02T14:39:42.497204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.610369Z","title":"A theoretical analysis of ndcg type ranking measures","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.610369Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:f7393069ade6c9c01e616253c73488b78a6aed26c9ce3b7299d1ad417adb02ac","observation_id":"2fd26477-f525-4538-8146-8da39567677a","resolution":{"observed_at":"2026-08-02T14:39:42.610369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.672422Z","title":"Text2loc: 3d point cloud localization from natural language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.672422Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:cd904a9b39c2be82320aaba5690b4f16d64b37ff054717e4a9c58eac58ff5ed3","observation_id":"aa3d28c3-fd8f-4220-9fa5-354aa6b04fac","resolution":{"observed_at":"2026-08-02T14:39:42.672422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.753892Z","title":"Adapting fine-grained cross-view localization to areas with- out fine ground truth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.753892Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:1d1395bcf9cc1bb7447b15ef7e50201f777a6ebb7ed5b4114632f913598bbd5e","observation_id":"88f6c4bb-f38d-4169-9e13-dd79b18fabbe","resolution":{"observed_at":"2026-08-02T14:39:42.753892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:42.842868Z","title":"Flair: Vlm with fine- grained language-informed image representations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.842868Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:567c977f2a3532175a3a2e6ba4e20f372cacc5ef9c4b85bca4fc562c10b648c6","observation_id":"cead20c2-a77e-4e44-bd1b-dbd3faf29979","resolution":{"observed_at":"2026-08-02T14:39:42.842868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05071","last_updated":"2025-05-21T06:18:41Z","snapshot_observed_at":"2026-08-09T03:39:57.040395Z","submitted_at":"2025-05-08T09:06:53Z","title":"FG-CLIP: Fine-Grained Visual and Textual Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05071","snapshot_observed_at":"2026-08-02T14:39:42.933706Z","title":"Fg- clip: Fine-grained visual and textual alignment.arXiv preprint arXiv:2505.05071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:42.933706Z"},"links":{"cited_paper":"/paper/2505.05071","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:e13a88bc0ca1a39ef9affd707e319abe948f24651a72f06625f245bd030a95da","observation_id":"8addccce-036f-48d6-98bb-def375b1dbfc","resolution":{"observed_at":"2026-08-02T14:39:42.933706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:43.019303Z","title":"Skydiffusion: Street-to-satellite im- age synthesis with diffusion models and bev paradigm.arXiv e-prints, pages arXiv–2408, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:43.019303Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:626a8fa9511e78ce0914946f33f955b76f22c48eac79d815e7da79ef4073697d","observation_id":"0bf30321-753e-429e-b6ed-9a7eb5f6c2f9","resolution":{"observed_at":"2026-08-02T14:39:43.019303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:43.109120Z","title":"Cross-view image geo- localization with panorama-bev co-retrieval network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:43.109120Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:ed8ec262c3de9bc705305c3e7930cfaebce9c131bc633663542adcd937acc1ff","observation_id":"793e0ed6-328c-4e59-bb67-885edfa4bce5","resolution":{"observed_at":"2026-08-02T14:39:43.109120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:43.183346Z","title":"Where am i? cross-view geo-localization with natural language descrip- tions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:43.183346Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:9d3397d76b83277558b57fef4d1fc01d48780913809d90115fb818257fd59a9a","observation_id":"c01cdd01-a29b-4220-919f-b426f732598e","resolution":{"observed_at":"2026-08-02T14:39:43.183346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:43.281595Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:43.281595Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:3248b2ac1988337662e5203fde63bf9ad0cc6108ad23a54911f104e18c29d3d2","observation_id":"21a01e68-f8b5-4ade-942a-3f48c3c321c7","resolution":{"observed_at":"2026-08-02T14:39:43.281595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-08-02T14:39:43.349828Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation.arXiv preprint arXiv:2402.15852, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:43.349828Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:a06d1bd68fec7214f2134c8958eedf4a491067170ca25eecb3d5682f2ca57ef2","observation_id":"98a8c816-ee0c-4969-9424-a2cb2a7d18b7","resolution":{"observed_at":"2026-08-02T14:39:43.349828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:39:43.408345Z","title":"Enhancing interactive image retrieval with query rewriting using large language models and vision lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T14:39:43.408345Z"},"links":{"citing_paper":"/paper/2607.14115"},"observation_digest":"sha256:31a795d2b3bd5902e513853eea004956d5ea4d97fc26e354160d87cc192125e7","observation_id":"9695888d-038a-4ca4-bb40-6d3f815fdec8","resolution":{"observed_at":"2026-08-02T14:39:43.408345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14115","last_updated":"2026-05-08T12:04:43Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T02:02:45.985438Z","submitted_at":"2026-05-08T12:04:43Z","title":"DialogueVPR: Towards Conversational Visual Place Recognition"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 0 inbound Pith citation observations for arXiv:2607.14115."}